网络爬虫的设计实现
[关键词:网络爬虫,毕业论文] [热度 ]| 提示:此毕业设计论文完整版包含【论文】 作品编号:rjgc0515,word全文:57页,合计:30000字 |
本文通过JAVA语言实现一个基于广度优先偏历算法的多线程爬虫程序。通过实现此爬虫程序可以定点搜集某一站点的URLs,如果需要搜集其它信息,可以在解析URLs的同时,解析获取相应信息。
本毕设题目是国家标准采集引擎,通过对系统进行软件测试,开启服务器端,点击下载按键,开始解析URL形成XML文档,界面显示解析的网址,解析错误的网址,程序进度,单击检测是否更新的按键,得到网页是否有更新,如果更新,页面显示需要更新,点击更新键,下载更新的国家标准,窗口的下方显示解析的网址,在代理页面,可以点击刷新代理,得到当日最新代理,及时更新代理可以提高下载网页的成功率,单击开启服务器,服务器开启出于监听状态。
客户端可以遍历指定的文件夹,得到文件夹下的文件,可以在列表里打开文件,删除文件,添加到上传列表的操作,在上传列表和下面的客户端口,可以和服务器交换文件,实现Socket通信。
本设计主要是通过在eclipse软件环境中进行,设计过程中首先服务器端获得网页URL,URL的获得途径有从客户端获得的已经形成的URL,和解析网站获得的更新的URL两种途径,然后根据URL连接该网页,获取网页源代码,获取网页源代码中需要的网页内容,去除多余的标签,空格,最后形成XML文档,服务器端的还包含获得IP代理,因为反复解析同一个网站,网站的防火墙会让本地IP无法访问该网站,所以我们需要用到IP代理循环访问网站解决这个问题,服务器端还可以阅本地文件的模块,方便文件阅读的客户端主要是过滤本地的文档与服务器端进行信息交互,传送需要解析的URL,获得已经解析的网页源代码所形成的XML文档。


| 提示:此毕业设计论文完整版包含【论文】 作品编号:rjgc0515,word全文:57页,合计:30000字 |
本软件工程毕业设计论文作品由 毕业论文设计参考 [http://www.qflunwen.com] 征集整理——网络爬虫的设计实现(论文)!

当前位置: