HI,欢迎来到好期刊网,发表咨询:400-888-9411 订阅咨询:400-888-1571证券代码(211862)

基于主题型页面的正文信息抽取技术研究

摘要:Web页面信息通常包含大量无关结构和HTML标记,而页面主题信息通常淹没其中,如何快速获取Web页面主题信息。本文提出了一种抽取策略,首先判定是否为主题型页面,然后提取网页正文信息,最后利用正则表达式滤除内容块中HTML标记和无关文字。实验结果表明:该方法能准确地完成主题型网页的正文抽取任务。

关键词:
  • 主题型页面  
  • 网页标题  
  • 正文抽取  
作者:
万文兵
单位:
仪征技师学院 江苏仪征211400
刊名:
计算机光盘软件与应用

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

计算机光盘软件与应用杂志紧跟学术前沿,紧贴读者,致力于创办以创新、准确、实用为特色,突出综述性、科学性、实用性,及时报道国内外计算机技术在科研、教学、应用方面的研究成果和发展动态,为国内计算机同行提供学术交流的平台。坚持指导性与实用性相结合的原则,创办于1998年,杂志在全国同类期刊中有很重的学术价值。