教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 高等教育 >

基于Heritrix的Web信息抽取(2)

来源:网络收集 时间:2026-09-21
导读: rtieirx 是一个由Java开发的开源Web爬虫系统,用来获取完 整的、精确的站点内容的深度复制,可通过.. web用户 界面启动、监控、调整,允许弹性地定义要获取的URL。 其最出色之处在于强大的可扩展性,允许开发者任意

rtieirx

是一个由Java开发的开源Web爬虫系统,用来获取完 整的、精确的站点内容的深度复制,可通过.. web用户 界面启动、监控、调整,允许弹性地定义要获取的URL。 其最出色之处在于强大的可扩展性,允许开发者任意 选择或扩展各个组件,实现特定的抓取逻辑,而且重新 爬行对相同的URL不针对先前的进行替换,其默认提 供的组件完全支持传统爬虫的工作。

在Heirx架构中中央控制器Calotol llr

rti,rwCnre

是核心组件,决定了整个抓取任务的开始与结束。用 户在HertieU控制台设置抓取任务后hrti首

irxwb!,eirx 先构造.. xst

ttnsade对象,rwCn

MLeigHnlr然后调用Calo—.. trl

llr构造一个CaIotoe实例并初

oe的构造函数,rwCnrl llr

始化,这样CrawlContol

llrer就具备了运行条件。此时,

只需调用rqetrwSat方法就可以启动线程池

eusCaltr()

和Frnir以便向线程池中工作线程提供抓取用的

ote,

URL链接(最开始的是设置好的入口种子链接,之后.. l13

是分析出来的新链接)。紧接着抓取线程工作开始,不精确的数据采集了,采集过程界面如图3所示:

断循环通过处理器链。除非用户暂停或终止否则直 到无链接可抓,控制器认为任务执行完成,将所有线程 关闭。.. ‘

至(,) ~

Heritrix抓取流程大致如图2所示:..

URL的处理器,负责分配 下一个被处理的URL

对抓取时一些先决条

件的判断

用于解析网络传输协议

用于解析当前获取的

服务器返回的内容

用于将抓取到的信息

用于将解析出来的URL有 件地加入到待处理队列中

图2 Herti

irx工作流程

在具体的站点采集中,由于站点有很多其他链接, 所以经常会采集到很多其他无关的页面,这无疑会对 下面的页面清洗带来麻烦,而且也降低了采集效率,因 而需要针对要采集的目标页面来定义网址筛选规则, 以确保不会采集到其他无关页面。具体有两种方式: 一 it

是向Heritrx添加自己的Exractor来限制解析出来 的URL;另外也可以扩展.. PostProces ssor,对进入待处理

队列的URL进行筛选,以剔除无关的链接。下面笔者 用第二种方法做个演示,对逸仙时空IM版的所有帖子 进行采集。

逸仙时空.. IM版的人口地址是.. ht ttp:/ //b

bbs.sysu...

edu.cn/b

bbsdoc?board=IM,对该版的HTML代码分析

后可得知,每个帖子的.. URL为:,其中.. M.

ad:I ie:M.9837795765.所以对.. IRL地址的筛

8377A是帖子的识别名,f

选主要基于地址中的borie关键词。在具体代

ad和fl

码实现上,可以自己开发一个新的PostProces ssor类,继

承Frnirceue父类,shdl

oteShdlr然后重写父类中的.. ceue

()方法,判断是否符合地址筛选规则,在此演示中,只 需判断是否存在关键词即可。若考虑程序的可重用 性,可把该功能类封装起来,在需要对其他不同站点进 行采集时,只需重新传人关键词即可。

最后需要在.. Heritrix的.. WebUI中进行一些设置,

制定抓取时的必要参数,然后便可以对目标站点进行

114。LIBRARY AND ION SERVI·

NFORMATICE

图3 Heritrix抓取界面..

4.2页面清洗模块

所谓页面清洗,就是根据后续需求来剔除目标页

面中不需要的信息内容,从而划分并提取出精确的信 息块,例如论坛某张帖子的发表时间、内容、发表.. IP 等,这对于后续的信息分析等工作起着很重要的作用。

页面清洗模块主要由HTMLparser来完成。HT—..

MLparser是一个纯JAVA编写的HTML解析库,它不

依赖于其他的JAVA库,主要用于改造或提取.. HTML。.. HTMLparser能超高速解析.. HTML,而且不易出错。对 于直接用HTMLparser来提取网页链接并实时分析的 方法,本系统的优点在于能使.. HMLa~r

Tple代码模块更

加通用化,rtri采集好的统

因为该模块处理的是由Heix 一

的目标页面代码,只需针对页面代码特点来确定清 洗代码而无需考虑抽取链接时的其他意外情况,这样 的思路更有利于系统重用性,如图4所示:

页面清洗模块 匡

图4页面清洗流程

目标页面是.. Heifx

rti过滤出来的统一度较高的页

面,HTML[arser读取存储在本地的目标页面(实际上 就是读取HTML代码),然后依据HTML的规范解析, 最终得到一棵.. DOM树。该树反映了目标页面的内容 和结构,包含了页面的各个元素以及他们之间的层次

构成关系。因为最终的结构化文本需要对应存储到数 据库表的各个字段中,所以需要自定义清洗规则来定 位到详细信息,例如发帖人、发帖时间和发帖IP等。 …… 此处隐藏:401字,全部文档内容请下载后查看。喜欢就下载吧 ……

基于Heritrix的Web信息抽取(2).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/604242.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)