X为了获得更好的用户体验,请使用火狐、谷歌、360浏览器极速模式或IE8及以上版本的浏览器
帮助中心 | 关于我们
欢迎来到辽阳市科技创新服务平台,请 登录 | 注册
尊敬的 , 欢迎光临!  [会员中心]  [退出登录]
当前位置: 首页 >  科技成果  > 详细页

[00151761]互联网信息采集系统

交易价格: 面议

所属行业: 软件

类型: 软件著作权

技术成熟度: 正在研发

专利所属地:中国

专利号:2012SR011819

交易方式: 技术转让

联系人: 西南科技大学

进入空间

所在地:四川绵阳市

服务承诺
产权明晰
资料保密
对所交付的所有资料进行保密
如实描述
|
收藏
|

技术详细介绍

互联网信息采集系统是为挖掘和分析互联网数据提供大量格式化数据的采集系统,系统提供了采集网站入口地址管理、网页增量抓取、BBS信息抽取模板设置、网页正文信息抽取、网页元数据(发布时间、标题、关键词等)抽取、索引建立、格式化网页数据存储(XML)、采集状态浏览等功能,实现了采集制定网站集合的网页,并抽取出网页中的各种元数据存储为XML文件,便于挖掘和分析。

系统主要为各种互联网信息分析与检索系统提供格式化数据。系统采用JAVA语言开发,不受操作系统限制;在网页抓取阶段采用了先进的链接分析算法,有效提高了采集速度;在信息抽取阶段采用文本密度结合模板的方式,提高了信息抽取的精度;系统提供了基于浏览器的采集状态监视界面,可以实时了解并控制系统状态。系统可在1小时左右完成40个网站的扫描,采集指定时间段的数据。


互联网信息采集系统是为挖掘和分析互联网数据提供大量格式化数据的采集系统,系统提供了采集网站入口地址管理、网页增量抓取、BBS信息抽取模板设置、网页正文信息抽取、网页元数据(发布时间、标题、关键词等)抽取、索引建立、格式化网页数据存储(XML)、采集状态浏览等功能,实现了采集制定网站集合的网页,并抽取出网页中的各种元数据存储为XML文件,便于挖掘和分析。

系统主要为各种互联网信息分析与检索系统提供格式化数据。系统采用JAVA语言开发,不受操作系统限制;在网页抓取阶段采用了先进的链接分析算法,有效提高了采集速度;在信息抽取阶段采用文本密度结合模板的方式,提高了信息抽取的精度;系统提供了基于浏览器的采集状态监视界面,可以实时了解并控制系统状态。系统可在1小时左右完成40个网站的扫描,采集指定时间段的数据。


推荐服务:

主办单位:辽阳市科学技术局

技术支持单位:科易网

辽ICP备16017206号-1

辽公网安备 21100302203138号

关于我们

平台简介

联系我们

客服咨询

400-649-1633

工作日:08:30-21:00

节假日:08:30-12:00

13:30-17:30