X为了获得更好的用户体验,请使用火狐、谷歌、360浏览器极速模式或IE8及以上版本的浏览器
帮助中心 | 关于我们
欢迎来到辽阳市科技创新服务平台,请 登录 | 注册
尊敬的 , 欢迎光临!  [会员中心]  [退出登录]
当前位置: 首页 >  科技成果  > 详细页

[00331869]针对多记录网页的记录项抽取系统及方法

交易价格: 面议

所属行业: 分析仪器

类型: 发明专利

技术成熟度: 通过小试

专利所属地:中国

专利号:CN201410503955.9

交易方式: 资料待完善

联系人: 福州大学

进入空间

所在地:福建福州市

服务承诺
产权明晰
资料保密
对所交付的所有资料进行保密
如实描述
|
收藏
|

技术详细介绍

摘要:本发明涉及一种针对多记录网页的记录项抽取系统及方法,该系统包括:记录树对齐模块,接收已抽取好的记录区域子树,并利用标签信息及语义信息进行树对齐,得到一棵超树,从而让相同语义的节点对应于超树的同一个节点;记录内容抽取模块,使用文本密度及文本密度和度量指标确定记录中记录内容位置;记录项输出模块,将记录区域里所有记录项及其语义标注按照树节点先序遍历输出;反馈框架,在抽取记录项后利用抽取结果检查记录区域定位是否正确,不正确则重新定位记录区域,进而修改记录项抽取结果,正确则直接结束抽取流程。该系统及方法能够高效、准确地对多记录网页中记录区域进行记录项抽取,抽取速度快、准确度高,通用性强,适用范围广。
摘要:本发明涉及一种针对多记录网页的记录项抽取系统及方法,该系统包括:记录树对齐模块,接收已抽取好的记录区域子树,并利用标签信息及语义信息进行树对齐,得到一棵超树,从而让相同语义的节点对应于超树的同一个节点;记录内容抽取模块,使用文本密度及文本密度和度量指标确定记录中记录内容位置;记录项输出模块,将记录区域里所有记录项及其语义标注按照树节点先序遍历输出;反馈框架,在抽取记录项后利用抽取结果检查记录区域定位是否正确,不正确则重新定位记录区域,进而修改记录项抽取结果,正确则直接结束抽取流程。该系统及方法能够高效、准确地对多记录网页中记录区域进行记录项抽取,抽取速度快、准确度高,通用性强,适用范围广。

推荐服务:

主办单位:辽阳市科学技术局

技术支持单位:科易网

辽ICP备16017206号-1

辽公网安备 21100302203138号

关于我们

平台简介

联系我们

客服咨询

400-649-1633

工作日:08:30-21:00

节假日:08:30-12:00

13:30-17:30