首页> 中文期刊> 《中文信息学报》 >基于语义串抽取及主题相似度度量的维吾尔文文本分类

基于语义串抽取及主题相似度度量的维吾尔文文本分类

         

摘要

该文研究一种改进的n元递增算法来抽取维吾尔文本中表达关键信息的语义串,并用带权语义串集来刻画文本主题,提出了一种类似于Jaccard相似度的文本和类主题相似度度量方法,并实现了相应的维吾尔文分类算法.实验结果表明,该文提出的文本模型简单有效,分类算法计算量不高,而且还能达到或超过经典分类器的分类综合性能.%This paper proposes an improved frequent pattern-grow th approach to discover and extract the semantic strings which express key information in Uyghur texts .Then the topics are described by these weighted semantic strings .Based on these features ,the Uyghur text classification is conducted by a new-designed Jaccard-like similari-ty measure .Experimental results show that the proposed method achieves comparable performance with a reasonable computation cost with regard to two traditional classifiers .

著录项

相似文献

  • 中文文献
  • 外文文献
  • 专利
获取原文

客服邮箱:kefu@zhangqiaokeyan.com

京公网安备:11010802029741号 ICP备案号:京ICP备15016152号-6 六维联合信息科技 (北京) 有限公司©版权所有
  • 客服微信

  • 服务号