基于Heritrix的Web信息抽取(2)
rtieirx
是一个由Java开发的开源Web爬虫系统,用来获取完 整的、精确的站点内容的深度复制,可通过.. web用户 界面启动、监控、调整,允许弹性地定义要获取的URL。 其最出色之处在于强大的可扩展性,允许开发者任意 选择或扩展各个组件,实现特定的抓取逻辑,而且重新 爬行对相同的URL不针对先前的进行替换,其默认提 供的组件完全支持传统爬虫的工作。
在Heirx架构中中央控制器Calotol llr
rti,rwCnre
是核心组件,决定了整个抓取任务的开始与结束。用 户在HertieU控制台设置抓取任务后hrti首
irxwb!,eirx 先构造.. xst
ttnsade对象,rwCn
MLeigHnlr然后调用Calo—.. trl
llr构造一个CaIotoe实例并初
oe的构造函数,rwCnrl llr
始化,这样CrawlContol
llrer就具备了运行条件。此时,
只需调用rqetrwSat方法就可以启动线程池
eusCaltr()
和Frnir以便向线程池中工作线程提供抓取用的
ote,
URL链接(最开始的是设置好的入口种子链接,之后.. l13
是分析出来的新链接)。紧接着抓取线程工作开始,不精确的数据采集了,采集过程界面如图3所示:
断循环通过处理器链。除非用户暂停或终止否则直 到无链接可抓,控制器认为任务执行完成,将所有线程 关闭。.. ‘
至(,) ~
Heritrix抓取流程大致如图2所示:..
URL的处理器,负责分配 下一个被处理的URL
对抓取时一些先决条
件的判断
用于解析网络传输协议
用于解析当前获取的
服务器返回的内容
用于将抓取到的信息
用于将解析出来的URL有 件地加入到待处理队列中
图2 Herti
irx工作流程
在具体的站点采集中,由于站点有很多其他链接, 所以经常会采集到很多其他无关的页面,这无疑会对 下面的页面清洗带来麻烦,而且也降低了采集效率,因 而需要针对要采集的目标页面来定义网址筛选规则, 以确保不会采集到其他无关页面。具体有两种方式: 一 it
是向Heritrx添加自己的Exractor来限制解析出来 的URL;另外也可以扩展.. PostProces ssor,对进入待处理
队列的URL进行筛选,以剔除无关的链接。下面笔者 用第二种方法做个演示,对逸仙时空IM版的所有帖子 进行采集。
逸仙时空.. IM版的人口地址是.. ht ttp:/ //b
bbs.sysu...
edu.cn/b
bbsdoc?board=IM,对该版的HTML代码分析
后可得知,每个帖子的.. URL为:,其中.. M.
ad:I ie:M.9837795765.所以对.. IRL地址的筛
8377A是帖子的识别名,f
选主要基于地址中的borie关键词。在具体代
ad和fl
码实现上,可以自己开发一个新的PostProces ssor类,继
承Frnirceue父类,shdl
oteShdlr然后重写父类中的.. ceue
()方法,判断是否符合地址筛选规则,在此演示中,只 需判断是否存在关键词即可。若考虑程序的可重用 性,可把该功能类封装起来,在需要对其他不同站点进 行采集时,只需重新传人关键词即可。
最后需要在.. Heritrix的.. WebUI中进行一些设置,
制定抓取时的必要参数,然后便可以对目标站点进行
114。LIBRARY AND ION SERVI·
NFORMATICE
图3 Heritrix抓取界面..
4.2页面清洗模块
所谓页面清洗,就是根据后续需求来剔除目标页
面中不需要的信息内容,从而划分并提取出精确的信 息块,例如论坛某张帖子的发表时间、内容、发表.. IP 等,这对于后续的信息分析等工作起着很重要的作用。
页面清洗模块主要由HTMLparser来完成。HT—..
MLparser是一个纯JAVA编写的HTML解析库,它不
依赖于其他的JAVA库,主要用于改造或提取.. HTML。.. HTMLparser能超高速解析.. HTML,而且不易出错。对 于直接用HTMLparser来提取网页链接并实时分析的 方法,本系统的优点在于能使.. HMLa~r
Tple代码模块更
加通用化,rtri采集好的统
因为该模块处理的是由Heix 一
的目标页面代码,只需针对页面代码特点来确定清 洗代码而无需考虑抽取链接时的其他意外情况,这样 的思路更有利于系统重用性,如图4所示:
页面清洗模块 匡
图4页面清洗流程
目标页面是.. Heifx
rti过滤出来的统一度较高的页
面,HTML[arser读取存储在本地的目标页面(实际上 就是读取HTML代码),然后依据HTML的规范解析, 最终得到一棵.. DOM树。该树反映了目标页面的内容 和结构,包含了页面的各个元素以及他们之间的层次
构成关系。因为最终的结构化文本需要对应存储到数 据库表的各个字段中,所以需要自定义清洗规则来定 位到详细信息,例如发帖人、发帖时间和发帖IP等。 …… 此处隐藏:401字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [高等教育]公司协助某村精准扶贫工作总结.doc
- [高等教育]高二生物知识点总结(全)
- [高等教育]苏教版数学三年级下册《解决问题的策略
- [高等教育]仪器分析课程学习心得
- [高等教育]2017年五邑大学数学与计算科学学院333
- [高等教育]人教版七年级下册语文第四单元测试题(
- [高等教育]2018年秋七年级英语上册Unit7Howmuchar
- [高等教育]2017年八年级下数学教学工作小结
- [高等教育]湖南省怀化市2019届高三统一模拟考试(
- [高等教育]四年级下册科学_基础训练及答案教材
- [高等教育]城郊煤矿西风井管路伸缩器更换施工安全
- [高等教育]昆八中20182019学年度上学期期末考试
- [高等教育]项目部各类人员任命书
- [高等教育]上市公司经营水务产业的模式
- [高等教育]人教版高二化学第一学期第三章水溶液中
- [高等教育]【中考物理第一轮复习资料】四.压强与
- [高等教育]金坑水电站报废改建工程机电设备更新改
- [高等教育]高中生物教学工作计划简易版
- [高等教育]2017年西华大学攀枝花学院(联合办学)44
- [高等教育]最新整理超短爆笑英文小笑话大全
- 优秀教师继续教育学习心得体会
- 阳历到阴历的转换
- 留守儿童教育案例分析
- 华师17春秋学期《玩教具制作与环境布置
- 测速传感器新型安装装置的现场应用
- 人教版小学数学三年级下册第四单元
- 创业个人意向书
- 山东省潍坊市2012年高考仿真试题(三)
- [恒心][好卷速递]四川省成都外国语学校
- 多少人错把好转反应当成了病情加重处理
- 中外广播电视史复习资料整理
- 江苏省扬州市江都区宜陵镇中学2014-201
- 工程造价专业毕业实习报告
- 广西师范学院心理与教育统计
- aympkrq基于 - asp的博客网站设计与开
- 建筑业外出经营相关流程操作(营改增后
- 人治 德治 法治
- [精华篇]常识判断专项训练题库
- 中国共产党为什么要实行民主集中
- 小学数学第三册第一单元试卷(A、B、C




