帮帮文库

返回

毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现 毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现

格式:word 上传:2022-06-24 19:06:55
温馨提示:手指轻点页面,可唤醒全屏阅读模式,左右滑动可以翻页。
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(1)
1 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(2)
2 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(3)
3 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(4)
4 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(5)
5 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(6)
6 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(7)
7 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(8)
8 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(9)
9 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(10)
10 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(11)
11 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(12)
12 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(13)
13 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(14)
14 页 / 共 31
毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现.doc预览图(15)
15 页 / 共 31

1、率申请上海交通大学学士学位论文期末基金资产总值单位基金净收益单位基金净资产总共语料数量篇表五财务指数公告语料分析部分结果两种信息抽取方法的比较在本模块的设计和实现中,前后采用了基于规则的结构主义方法和基于语料库统计的功能主义方法。两种方法的异同及优缺点比较如下基于规则的结构主义方法基于语料库统计的功能主义方法抽取规则是人为总结制定的,故抽取效果很大部分取决于规则的完善性与合理性。抽取规则隐含于的模型参数中,通过语料库训练模型的而得,故抽取效果主要取决于语料库的文本容量和标注质量。对于简单文本分析效率高准确率高。对于简单文本分析效率和准确率都相对较低。分析能力相当有限,且扩充性差,难以分析复杂文本,准确率也随文本复杂性增加而显著下降。具有较强的可扩充性,只要训练获取合适的模型参数,即可对更复。

2、及到用语言所标记的文本中的名称项和指同项的处理。除了场景模板任务以外,名称项指同项和模板元素信息抽取任务均与特定专业领域无关。测试的语料采用华尔街杂志中的文本。年的是最近的次信息理解会议。它的信息抽取任务涉及抽取文档中的名称项人名组织名和地点名指同项确定模板元素之间的关系,如地点关系雇佣关系和生产关系等抽取文档中的事件。文档包含多语种的新闻稿。训练用的文档专业领域是关于飞机坠毁报道,而测试用的文档专业领域是关于发射事件报道。系统系统是美国加里福尼亚斯坦福研究所人工智能中心从年开始开发的个基于多层非确定有限状态自动机模型的自然语言文本信息抽取系统。它共有六层转换机制,即切分标记层预处理层名称项识别层简单短语识别层复杂短语识别层指同求解层。分解的语言处理使此系统能够处理大量的与专业领域无关的。

3、用方便地处理文档,使用了作为的语言分析器。该分析器是源代码公开的自由软件,并通过了的内部测试。此分析器目前支持标准,是公认的功能完善性能可靠的语言分析器。由于以上工具在等多种操作系统上均可运行,所以可以很方便地实现移植。开发调试操作系统平台是。硬件平台是。经过对人工分词标注的语料库的单词统计,共获得领域单词个。在对公告分类后,主要集中研究两种类型的公告决议公告财务指标公告。对语料做关键词统计后,得到的结果如下关键词出现次数平均单篇出现率决议决议公告董事会监事会董监事会公告董事董监事监事股东大会总共语料数量篇表四决议公告语料分析部分结果关键词出现次数平均单篇出现率财务指标每股净资产净资产收益率每股收益调整后每股净资产每股净资产每股收益单位基金收益单位基金资产净值期末基金资产净值基金资产净值收。

4、下的预期驱动分析器提取预期内容。是个资助的为推动技术发展的个重要的系列工程。有许多大学研究所参加。年的和年的主要集中在从小规模的海军信息文本中抽取相关的信息。年的和年的采用的文本主题和类型发生了变化,采用关于拉丁美洲国家恐怖事件通用主题的报纸和有线新闻文本作为语料源,系统包括预定义好的信息模板和辅助抽取规则,基本任务是从在线文本中抽取有关信息填入预定义的模板中的属性槽中。年的的文本主题是关于合资企业的商业新闻以及微电子芯片的制作方面的新闻,涉及英语和日语文档。所抽取的信息包括合资企业的合资者合资公司的名称所有权和申请上海交通大学学士学位论文资本以及预期的活动,或者微电子芯片的制作活动的性质和状态等有关项。涉及到多语言和多领域的文档,以便进行抽取信息的性能评价比较。年的的信息抽取任务第次涉。

5、在东北大学学要在我们的系统中,应用算法获取模型参数,需要对算法做适当的更改。最主要的修改是上述算法中的终止条件。与应用在语音识别中的隐马尔科夫模型不同,我们衡量模型质量时,并不是要求整个模型输出序列的总体概率最大为最优,而是输出该序列时所经历的隐路径中最佳路径的概率最大为最优。所以,在第三步应该改为终止条件,为阈值。申请上海交通大学学士学位论文实现与结果分析模块实现情况在本模块的实现中,使用到了如下些资源,在此做简单叙述。由于考虑到本系统将能够方便地挂接在上,要求具有较好的跨平台能力,故决定采用做为开发工具。目前使用的是的作为。使用的数据库系统是的通用数据库系统。在模块内部的中间数据表示,均采用的是规范,即以文档的形式在各个子系统之间传递。为了使。

6、杂的文本类型进行抽取,而准确率仍有定的保障。旦确定规则,即可采用自动语法分析器生成器如或自动构造分析器。需要大量训练才能获取模型参数,且不能保证获取最佳值,必要时需要人工调整。表六两种信息抽取方法的比较可见,两种方法在不同的应用环境下具有不同的优缺点。所以应该根据需要选择合适的方法。近期其它些研究中,已经考虑将两种方法有机地结合,使它们互补短长,发挥各自最佳的分析优势。这也是计算语言学发展的必然趋势,结构主义和功能主义必将走向统。结果总结在基于汉语信息抽取模型的股市公告信息抽取系统的设计与实现中,已获得的成果罗列如下提出了基于汉语信息抽取模型的股市公告信息抽取系统的框架结构和分布图。分析了简化信息抽取模型的必要性,给出了简化后的信息抽取模型。简单讨论了小领域分词子模块的设计原则。对。

7、句法结构,以致于与专业领域相关的语义和语用处理能被应用到相当大部分的语言结构上。正因为系统具有这样的特点,它已被成功地运用于许多应用中。计划由美国国防部和共同资助的计划包括至少个与工业和学术有关的项目。目的是改进文本处理的流行技术。的体系结构使用组通用的文本处理模块已能满足不同的文本处理应用的需要。这些应用主要是文本检测定位包含信息类型的文本和信息抽取定位文本中的特定信息。在研究的第阶段,参与者通过些活动如和对文本检测和信息抽取所建立算法进行改进以及提高对评价这些改进的技术。在第二阶段的研究中,参与者为了使技术组成构件标准化,将注意力转向软件体系结构的开发上。使各种所开发的工具具有即插即用的性能,增加软件的共享程度。在目前进行的第三阶段的研究中,种称为的平台被开发,它支持评价扩展和探索进。

8、域。当然,仍然必要针对相应领域的特征,适当修改模型或算法。申请上海交通大学学士学位论文参考文献刘开瑛,中文文本自动分词技术研究,山西大学计算机科学系,张冬茉,姚天昉,王纤,多语种天气预报文本生成系统中句子规划器的设计与实现,上海交通大学计算机系刘开瑛,郭炳炎,自然语言处理,科学出版社张冬茉,王纤,基于的信息抽取模型的研究,上海交通大学,姚天顺,自然语言理解,清华大学出版社,蔡自兴,徐光祐,人工智能及其应用第二版,清华大学出版社,于江生,隐模型及其在自然语言处理中的应用,北京大学计算语言学研究所于江生,计算语言学中的概率统计方法,北京大学计算语言学研究所于江生,基于约束的句法语义分析,北京大学计算语言学研究所胡睿,基于的信息抽取模型的研究和实现,上海交通大学计算机系,孙宾,现代汉语文本的词语。

9、中的体系结构。将采用结构为研究者提供鲁棒及相配的组成构件。它将支持体系结构的扩展,以便与机器翻译语音和光学字符识别图象观察用户界面构件以及大规模信息系统相适应。系统由德国人工智能研究中心语言技术实验室在项目中所开发的系统是个联机的德语文挡信息抽取智能系统。文档的专业领域包括通讯稿经济报告和技术说明书。系统拥有大量的语言知识资源如电子词典包括万条词项以及可扩展性很强的专门语法以及极其快速和鲁棒的自然语言构件。它还能利用机器学习机制使自身能为实现新功能得到训练和配置,并能申请上海交通大学学士学位论文适应所需的信息数量和各种文档长度。它被集成了图形可视化技术服务器体系结构和英特网访问技术。作为个有效的智能信息检索的核心系统已经成功地运用于科学和工业项目中。国内对信息抽取的研究才刚刚起步。年月。

10、指代分析,等等。标注质量的提高。目前的人工标注标准仍然具有定的模糊性,可能因为主观差异导致标注尺度掌握的不同。这从些方面极大地影响到了语料的可信度。因此需要制定更为明确清晰的标注标准,加上适当的标注工具,可以更高效率获取更高质量的语料库。模型参数学习。目前的迭代算法虽然能够获取较优的模型参数,但是并不能够保证对语料库信息的充分利用。可以结合其它机器学习方法,提高模型参数学习的效率和质量。两种信息抽取方法的结合。结构主义与功能主义的结合是目前自然语言处理领域的必然趋势,例如可以通过语料库统计来学习抽取规则,也可以通过规则指导统计数据的应用,等等。这有待相关理论的发展和应用上的尝试。模型的推广。本文论述了股市公告信息抽取系统的设计和实现,但是其中的绝大多数方法可以方便地扩展到其他应用领。

11、切分技术,北京大学计算语言学研究所孙宾北京大学计算语言学研究所,孙宾,汉语信息提取的部分研究,北京大学计算语言学研究所姚天昉等,种基于信息抽取和文本生成的多语种信息检索模型,上海交通大学计算机科学与工程系,德国人工智能研究中心申请上海交通大学学士学位论文致谢在本文即将结束之际,我要由衷地感谢在我毕业设计阶段,乃至本科四年学习生活中帮助过我的师长与同学。我要首先感谢我的导师教授。在整整年的学习科研中,老师给予了我极大的关心和帮助。张老师治学严谨知识渊博诲人不倦,在学术和为人上都为我作出了榜样。在张老师的帮助下,使我的课题研究能够顺利开展,并取得定阶段性成果。在此,我向她表示最真挚的感谢。我还要感谢老师。在年的研究与实践中,老师为课题的顺利进行作出很多贡献。尤其在安排语料库构造的工作中,王老师。

12、大量领域文本做了人工标注,初步够建了领域语料库。尝试了采用基于规则的简单文本信息抽取算法。提出了基于隐马尔科夫模型的信息抽取算法。改进了选择模型参数的迭代算法。分析了两种信息抽取方法的异同及优缺点遗留的问题目前为止,本信息抽取系统的设计与实现过程中,发现了以下些问题,有待解决申请上海交通大学学士学位论文多语种的问题。本系统目前为止仍然是基于汉语信息抽取技术的。但是根据信息抽取技术的特征,构建跨语种的信息抽取系统是可能的。可以构建中间语汇,将抽取后的信息以于语种的方式表述。具体研究仍有待于进步的讨论。自动分词的完善。目前的自动分词词典结构仍然相当简单,可以通过添加些附加属性来提高分词的质量。自动标注的实现。自动标注的实现中,又将包括许多复杂的浅层自然语言处理技术,如命名实体的识。

参考资料:

[1]毕业论文:硕士论文--基于Struts应用框架的设计与实现(第76页,发表于2022-06-24)

[2]毕业论文:硅钢片模具设计(第23页,发表于2022-06-24)

[3]毕业论文:硅橡胶蛋糕盒生产工艺与模具设计(第31页,发表于2022-06-24)

[4]毕业论文:砖窑卸垛机器人本体的结构设计与优化(第44页,发表于2022-06-24)

[5]毕业论文:研究优化企业员工培训(第24页,发表于2022-06-24)

[6]毕业论文:码跺机器人机械毕业设计说明书(第39页,发表于2022-06-24)

[7]毕业论文:码跺机器人机构毕业设计说明书--四坐标圆柱形机器人(第39页,发表于2022-06-24)

[8]毕业论文:码头混凝土裂缝的预防分析 (第8页,发表于2022-06-24)

[9]毕业论文:矿芦湖北分区15#煤二采区毕业设计(第43页,发表于2022-06-24)

[10]毕业论文:矿用链板输送机传动装置设计(第23页,发表于2022-06-24)

[11]毕业论文:矿用机械输送机设计(第51页,发表于2022-06-24)

[12]毕业论文:矿用挖掘机斗杆结构有限元分析(第31页,发表于2022-06-24)

[13]毕业论文:矿用回柱绞车毕业设计(第47页,发表于2022-06-24)

[14]毕业论文:矿灯槽盖注塑模具设计(第56页,发表于2022-06-24)

[15]毕业论文:矿山贯通测量技术设计(第59页,发表于2022-06-24)

[16]毕业论文:矿山设备维修与管理(第23页,发表于2022-06-24)

[17]毕业论文:矿山机电专业毕业设计(第33页,发表于2022-06-24)

[18]毕业论文:矿山摇摆式输送机毕业设计说明书(第60页,发表于2022-06-24)

[19]毕业论文:矿山排水的论文:矿山排水抢险救援设备立井快速安装与平台设计技术(第5页,发表于2022-06-24)

[20]毕业论文:矿厂监控设计(第27页,发表于2022-06-24)

预览结束,还剩 16 页未读
阅读全文需用电脑访问
温馨提示 电脑下载 投诉举报

1、手机端页面文档仅支持阅读 15 页,超过 15 页的文档需使用电脑才能全文阅读。

2、下载的内容跟在线预览是一致的,下载后除PDF外均可任意编辑、修改。

3、所有文档均不包含其他附件,文中所提的附件、附录,在线看不到的下载也不会有。

1、该文档不包含其他附件(如表格、图纸),本站只保证下载后内容跟在线阅读一样,不确保内容完整性,请务必认真阅读。

2、有的文档阅读时显示本站(www.woc88.com)水印的,下载后是没有本站水印的(仅在线阅读显示),请放心下载。

3、除PDF格式下载后需转换成word才能编辑,其他下载后均可以随意编辑、修改、打印。

4、有的标题标有”最新”、多篇,实质内容并不相符,下载内容以在线阅读为准,请认真阅读全文再下载。

5、该文档为会员上传,下载所得收益全部归上传者所有,若您对文档版权有异议,可联系客服认领,既往收入全部归您。

毕业论文:硕士论文:汉语股市公告信息抽取系统的设计与实现
帮帮文库
页面跳转中,请稍等....
帮帮文库

搜索

客服

足迹

下载文档