首页> 中文期刊> 《中文信息学报》 >基于自然标注信息和隐含主题模型的无监督文本特征抽取

基于自然标注信息和隐含主题模型的无监督文本特征抽取

         

摘要

术语和惯用短语可以体现文本特征.无监督的抽取特征词语对诸多自然语言处理工作起到支持作用.该文提出了“聚类-验证”过程,使用主题模型对文本中的字符进行聚类,并采用自然标注信息对提取出的字符串进行验证和过滤,从而实现了从未分词领域语料中无监督获得词语表的方法.通过优化和过滤,我们可以进一步获得了富含有术语信息和特征短语的高置信度特征词表.在对计算机科学等六类不同领域语料的实验中,该方法抽取的特征词表具有较好的文体区分度和领域区分度.

著录项

相似文献

  • 中文文献
  • 外文文献
  • 专利
获取原文

客服邮箱:kefu@zhangqiaokeyan.com

京公网安备:11010802029741号 ICP备案号:京ICP备15016152号-6 六维联合信息科技 (北京) 有限公司©版权所有
  • 客服微信

  • 服务号