基于自然标注信息和隐含主题模型的无监督文本特征抽取

饶高琦; 于东; 荀恩东

首页> 中文期刊> 《中文信息学报》 >基于自然标注信息和隐含主题模型的无监督文本特征抽取

基于自然标注信息和隐含主题模型的无监督文本特征抽取

开具论文收录证明 >>

期刊封面封底目录下载 >>

文献代查 >>

页面导航

摘要
著录项
相似文献
相关主题

摘要

术语和惯用短语可以体现文本特征.无监督的抽取特征词语对诸多自然语言处理工作起到支持作用.该文提出了“聚类-验证”过程,使用主题模型对文本中的字符进行聚类,并采用自然标注信息对提取出的字符串进行验证和过滤,从而实现了从未分词领域语料中无监督获得词语表的方法.通过优化和过滤,我们可以进一步获得了富含有术语信息和特征短语的高置信度特征词表.在对计算机科学等六类不同领域语料的实验中,该方法抽取的特征词表具有较好的文体区分度和领域区分度.

著录项

来源
《中文信息学报》 |2015年第6期|141-149|共9页
作者
饶高琦; 于东; 荀恩东;
展开▼
作者单位

北京语言大学大数据与语言教育研究所,北京100083;

中国语言政策与标准研究所,北京100083;

北京语言大学大数据与语言教育研究所,北京100083;

北京语言大学大数据与语言教育研究所,北京100083;

展开▼
原文格式 PDF
正文语种 chi
中图分类信息处理（信息加工）;
关键词
自然标注信息; 自然语块; 隐含主题模型; 领域特征; 文体特征;

相似文献

中文文献
外文文献
专利

1. 基于半监督LDA主题模型的ZeroNet文本内容分析 [J] . 过小宇 ,丁建伟 ,江泓 . 信息技术 . 2020,第003期
2. 基于标签的半监督HDP文本分类主题模型 [J] . 李永忠 ,郑滔 . 模式识别与人工智能 . 2017,第012期
3. 基于LDA主题模型的维吾尔语无监督词义消歧 [J] . 袁扬 ,李晓 ,杨雅婷 . 厦门大学学报（自然科学版） . 2020,第002期
4. 基于Biterm主题模型的无监督微博情感倾向性分析 [J] . 张佳明 ,王波 ,唐浩浩 . 计算机工程 . 2015,第007期
5. 基于改进LDA主题模型的产品特征抽取 [J] . 佘维军 ,刘子平 ,杨卫芳 . 计算机与现代化 . 2016,第11期
6. 基于社群隐含主题挖掘和多社群信息融合的自动图像标注 [C] . Chen Ye ,陈烨 ,Shao Jian . 第六届智能CAD与数字娱乐学术会议 . 2009
7. 基于主题模型的中医药隐含语义信息挖掘 [A] . 商任翔 . 2013

基于自然标注信息和隐含主题模型的无监督文本特征抽取

摘要

著录项

相似文献

相关主题

期刊订阅