【24h】

Web data extraction techniques: A review

机译:Web数据提取技术:回顾

获取原文
获取原文并翻译 | 示例

摘要

Web data extraction is the process of extracting user required information from websites. The web document contains data which is not in structured format. From the word web data extraction, we mean the extraction of data that is present in the web documents in HTML format. Then removing the unwanted stuff such as tags, advertisements, videos and so on. Then learning the information or patterns or features present in that data. Today, most researchers uses web data extractors because the internet contains huge data which makes the process of manual information extraction from the web documents complicated. In this paper, we have studied about different techniques for data extraction used by different authors that takes the user required data from a set of web pages. A comparative analysis of web data extraction techniques is given.
机译:Web数据提取是从网站提取用户所需信息的过程。 Web文档包含非结构化格式的数据。从Web数据提取一词,我们是指以HTML格式提取Web文档中存在的数据。然后删除不需要的内容,例如标签,广告,视频等。然后学习该数据中存在的信息或模式或特征。如今,大多数研究人员都使用Web数据提取器,因为Internet包含大量数据,这使得从Web文档中手动提取信息的过程变得复杂。在本文中,我们研究了不同作者使用的不同数据提取技术,这些技术从一组网页中获取用户所需的数据。对网络数据提取技术进行了比较分析。

著录项

相似文献

  • 外文文献
  • 中文文献
  • 专利
获取原文

客服邮箱:kefu@zhangqiaokeyan.com

京公网安备:11010802029741号 ICP备案号:京ICP备15016152号-6 六维联合信息科技 (北京) 有限公司©版权所有
  • 客服微信

  • 服务号