基于模板抽取和丰富特征的药名词典生成

来源 :第五届全国信息检索学术会议CCIR2009 | 被引量 : 0次 | 上传用户:aie520
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
近年来,关于药的作用及其对人类健康影响的研究越来越多,相关的文献也迅速增长,工业界认为90%的药物标靶来自于生物医学文献,随之基于药的相关检索逐渐成为焦点。而为相关专家提高检索效率、方便获得资料的第一步就是要准确的识别出药名,构建药名词典。文中给出了从生物医学文献中抽取出药名来构建词典的方法,第一次将基于上下文模板的命名实体识别方法用于药名实体识别并结合了丰富的特征对候选药名进行去噪。它首先由有限的药名种子出发,从大量未标生物医学文献中抽取出上下文信息;然后选取每个上下文的引导词从而构建模板,文中所用生成模板的方法简单有效,利用它抽取出粗糙的候选药名集合:最后选择丰富的特征利用机器学习的方法,对候选词典进行去噪,得到高质量的大规模药名词典。词典中包含了很多在常用数据库(Drugbank)中没有的药名,抽样调查准确率达到了73%,潜在准确率达到了80.8%。方法在模板生成以及候选药名去噪时的特征选择上并不局限于药名属性,可以尝试将该方法用于其它生物医学文献命名实体识别。
其他文献
张爱萍同志是我国国防科技事业的杰出领导者,他呕心沥血铸利剑,为发展以“两弹一星”为主要标志的国防尖端科技事业,建立国防工业体系,提高我军武器装备的现代化水平,付出了大量心
本文介绍了高度重视科学技术在社会主义建设事业中的关键作用、参与组织领导制定和实施了我国第一个科技发展规划《1956-1967年科学技术发展远景规划纲要》,全面推进我国科学
伟大的无产阶级革命家周恩来同志为我国的革命和建设事业建立了丰功伟绩。在我国的科技事业中,同样凝结着周恩来的辛勤劳动和卓越智慧,他是新中国科学技术事业的伟大奠基人。本
人物关系抽取是实体关系抽取研究的一个重要分支。本文提出了一种基于搜索引擎的人物社会关系抽取方法。该方法首先将人物关系特征词与测试集人名一起作为组合关键词提交到搜
会议
目前,中国硝酸硝铵产能和产量已经自给有余,且在生产技术、安全管理方面逐渐成熟,但整个行业发展中存在着产能过剩、创新能力不强问题。未来硝酸硝铵应发挥自身优势,通过发展
针对专利文献的特点,本文提出了一种基于统计和规则相结合的多策略分词方法。该方法利用文献中潜在的切分标记,结合切分文本的上下文信息进行最大概率分词,并利用术语前后缀规律
句际语义关系是指语篇上下文中相邻句子之间存在的语义关系。准确的识别句际语义关系对于文本理解、文本推理和文本结构分析具有重要的意义。然而,由于受到语篇上下文环境、指
会议
本文研究开放式中文命名实体识别问题。针对传统命名实体识别方法具有训练语料标注困难,自适应能力不强等缺点,研究人员提出了开放式的命名实体识别。但由于汉语的特殊性,使得开
在利用统计方法对文摘中词频特征和词位置分布特征进行分析的基础上,提出增加词同现特征用于自动文摘系统的新方法。文中把该方法表示为基于词位置与同现特征的中文自动文摘模
随着生物医学的迅速发展,从医学文献中抽取蛋白质关系已经成为面向生物医学方面的自然语言处理任务中一项非常重要的任务。目前研究学者已经提出很多蛋白质关系抽取的方法,但是
会议