教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 高等教育 >

基于Heritrix的Web信息抽取

来源:网络收集 时间:2026-09-21
导读: 基于Heritrix的Web信息抽取.txt28生活是一位睿智的长者,生活是一位博学的老师,它常常春风化雨,润物无声地为我们指点迷津,给我们人生的启迪。不要吝惜自己的爱,敞开自己的胸怀,多多给予,你会发现,你也已经沐浴在了爱河里。基于.. Heirx的.. We rtib信

基于Heritrix的Web信息抽取.txt28生活是一位睿智的长者,生活是一位博学的老师,它常常春风化雨,润物无声地为我们指点迷津,给我们人生的启迪。不要吝惜自己的爱,敞开自己的胸怀,多多给予,你会发现,你也已经沐浴在了爱河里。基于.. Heirx的.. We

rtib信息抽取

陈俊彬曹树金

中山大学资讯管理系广州5100 006

[摘要]针对现阶段Web信息抽取技术的不足,提出一种基于Heritrix的精确抽取方法,由三个分别独立的功能模

块共同完成。与一般信息抽取不同,本方法注重于在精确抽取的前提下实现通用化,做到可以根据数据库表的字

段来进行最小单位的信息抽取,并且较好地解决信息采集通用性和准确性之间的矛盾。.. [关键词]HrtiHMLasrWeb数据采集

eirx信息抽取.. Tpre[分类号]G250.73

WebInfrtotatosdorti

omainExrcinBaenHeirx

eun ahnChnJnbiCoSuji

DepartmentofInformationManagement,SunYat—senUniversity,Guangzhou510006

[Abtathsaeitoueaehdoac ccrtifrainetatoaeoeirxac ccrigthhrafWeno

src]TipprnrdcsmtofuaenomtoxrcinbsdnHrtiodnotesotgeobifrmaroxrcintcnlg.h ytmiooeftrersetvdueeetfosaafifrtoxrcin,inetatoehooyTessescmpsdoheepciemol.Dif ffrnrmuulwyonomainetato

thtd iounpeciionael

llaeeraty.Icnetrattemiim uitofifortiocodigthefedoaln

emehosfcsorsswsgnlitaxchnmunnmanacrnotilftbei

daase.

tba

[KewrseirxifrtoxrcinHTprebifrtocusto

yod]HrtinomainetatoMLasrWenomainaqiiin

的信息抽取技术需要用户的大量参与,但自动化程度 不高;而自动化程度高的抽取技术其准确率和适应性 较低,实用性较差。即使是机器学习,也要通过大量的

Web信息抽取(Webinformationextraction,WIE)的样本学习来提高获取规则的自动化程度,这意味着系

目标是把文本里包含的信息进行结构化处理,转化成统需要经过较长时间的学习才能获得较好的查准率。

特定的结构,以便于理解和利用。随着.. Intemet的迅猛纵观信息抽取技术的发展历史,研究者们提出了

发展,Web已经成为全球传播与共享科研、教育、商业不少优秀的抽取策略.。从实现方法的原理出发,可

和社会信息等最重要和最具潜力的巨大信息源。面对以将信息抽取技术划分为4个类别:①基于自然语言

如此巨大的互联网信息库,如何快速、有效、经济地得理解方式;②基于ontology方式;③基于网页结构特征

到某个主题的所有相关信息就成了当前一个十分热门方式;④基于统计学习的方式。基于自然语言理解方

的研究课题。与传统的信息资源相比,Web上信息资式的信息抽取在一定程度上借鉴了自然语言处理技

源有着分布性、异构性、开放性、动态性和庞大性等特术,利用子句结构、短语和子句间的关系建立基于语法

点,这些特点导致Web上数据的信息接口和组织形式和语义的抽取规则,实现信息抽取。其缺点是抽取速

各不相同,也使得Web上的信息资源不能被有效的利度慢,使用范围窄,很难做到通用。基于ontology方式

用。在这样的背景下,Web信息抽取技术成为了研究主要是利用对数据本身的描述信息实现抽取,对网页

的热点。结构的依赖较少。只要事先创建的应用领域的ontolo- g)r足够强大,系统可以对某一应用领域中各种网页实

2艾献绿述现信息抽取。目前只能对特定领域构建,并且还只能 采用半自动的方式由人工参与,这样使得该方法要求 在.. Web信息抽取领域中,信息抽取的准确性和通很高,工作量巨大。基于网页结构特征方式的特点

用性之间的矛盾一直是该研究领域的难题。性能较好是根据Web页面的结构来定位信息,在信息抽取之前

收稿ri期:20 008—07—2

22修日期:20

008—09—11本文起Ij:贞码:1 112—115本文责任编辑:易【三

112。LIBRARY AND INFORM ATION SERVICE。

通过解析器将Web文档解析成语法树,然后通过自动 或半自动的方式产生抽取规则,最终转化为对语法树 的操作来实现信息的抽取,本策略实现简单,抽取的准 确性好,但要求人工参与。基于统计学习的信息抽取 策略是根据统计学原理,首先构造一个模型以模拟 信息抽取的过程,应用统计学方法从训练语料中得出 模型的参数;然后用训练好的模型对待抽取语料进行 信息抽取。该方法需要经过较长时间的样本学习,且 实现复杂。

对信息抽取技术的划分标准其实有很多,并不限

于以上所提。各种信息抽取策略针对特定的场合都有 其独特的优势,也有其相应的缺点。其中,基于网页结 构特征的信息抽取是现阶段最为常用的抽取手段,实 现起来相对简单,可进行精确的信息抽取。在现阶段 的研究中,已有不少文献针对这一抽取策略提出了相 对可行的实现方法,例如基于DOM树的自动抽取和基 于机器学习的抽取技术。这类方法重点关注信息抽 取的通用性,在准确性方面有待提高。正如前文所述, 通用性和准确性之间的矛盾一直是信息抽取领域的难 题,然而现阶段在保证信息抽取的准确性,又不失通用 性的方面还没有较为理想的实现方法。大部分的抽取 方法都是重点先考虑通用性;也有一些文献提出了很 好地很精确的抽取方法,但是却没有实现相对通用性, 抽取系统的可移植性和可维护性很差,也难以应对千

变万化的.. Web页面。

3系统分析与设计

笔者在实践的基础上提出一种以Heirx

rti为基础,

结合HTML[,arser的信息抽取思路,下面将给出具体实 现方法和抽取系统。本方法注重于在精确抽取的前提 下实现通用化,做到可以根据数据库表的字段来进行 最小单位的信息抽取,并且较好地解决信息采集通用 性和准确性之间的矛盾,同时具有较好的可扩展性和 抽取速度。

本抽取系统主要用于对论坛信息的精确抽取,以

实际的例子来阐述一种信息抽取的思路,在设计上采 用分层与模块分治的设计思想,保证系统有良好的移

植性和扩展性,这个对于变化无常的Web信息来说非 常有必要。

系统主要包括三个模块:数据采集模块、页面清

洗模块、数据库模块(见图1)。对于待抽取的站点,由 数据采集模块根据入口地址对其进行采集,将目标页

圉雪jf ff铉作>>

第《宙》卷第。期.. 20 009年5月

面采集到本地上,通过设定规则,可以保证系统只存储 待分析的目标页面,对页面清洗模块的标准化提供很 大方便。页面清洗模块负责对高度统一的目标页面进 行清洗,最终提取出结构化文本,由数据库模块存入对 应的库表字段中。

数据采集模块页面清洗模块数据库模块

图1系统结构

在具体实现上,首先需要对待采集站点进行分析, 确定人口地址,如论坛的版面列表地址、新闻网页的主 页地址等,本文以逸仙时空.. BBS为例进行说明,入E1 地址是ht

ttp://bbs.sysu.edu.cn/bbsal ll,即所有版面列

表。在数据采集模块,Hrtri根据入口地址与自定义 eix

的网址筛选规则,开始对种子URL进行分析,动态取 回符合条件的目标页面文本,即论坛帖子的html代 码,直到遍历完站点内的所有URL,为页面清洗模块提 供统一的目标页面。在页面清洗 …… 此处隐藏:1772字,全部文档内容请下载后查看。喜欢就下载吧 ……

基于Heritrix的Web信息抽取.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/604242.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)