欢迎来到知嘟嘟! 联系电话:13336804447 卖家免费入驻,海量在线求购! 卖家免费入驻,海量在线求购!
知嘟嘟
我要发布
联系电话:13336804447
知嘟嘟经纪人
收藏
专利号: 2014101904770
申请人: 重庆邮电大学
专利类型:发明专利
专利状态:已下证
专利领域: 计算;推算;计数
更新日期:2024-02-23
缴费截止日期: 暂无
价格&联系人
年费信息
委托购买

摘要:

权利要求书:

1.Web网站产品详细信息的分类抓取方法,其特征在于:首先抓取网站产品一级分类的首页,通过分析抓取的分类首页源文件,获取下一级产品分类首页链接;然后逐级抓取,直到网站所有分类首页抓取完毕;通过分析各级分类子页面的源文件,获取翻页元素和各分类页面数,然后生成各分类的子页面链接,最后根据各分类的子页面链接,完成各分类子页面的抓取。

2.根据权利要求1所述的Web网站产品详细信息的分类抓取方法,其特征在于:各分类页面抓取的具体步骤如下:步骤1:一级分类首页的url导入url任务队列;

步骤2:判断url任务队列否为空,若不为空则网站的分类首页还未抓取完毕;若为空则表示网站的所有分类首页已抓取完,跳至步骤8,开始抓取各分类子页面;步骤3:若url任务队列不为空,则根据url队列中的网站分类首页url开始抓取网页;步骤4:记录url的抓取状态;保存抓取成功的分类首页源文件和url;未抓取成功的分类首页的url再次加入url任务队列;三次抓取失败的url则认为此url无效;步骤5:解析分类首页源文件,获取下一级产品分类的首页url;

步骤6:根据抓取成功的页面url,对解析出的url去重,然后加入url任务队列;

步骤7:循环步骤2,直到网站所有分类首页源文件抓取完;

步骤8:解析所有分类首页源文件,获取各分类页面数、翻页元素和分类首页url;

步骤9:根据获取的各分类页面数、翻页元素和分类首页url,生成各分类的子页面链接;

步骤10:根据各分类的子页面链接,抓取全部分类子页面;

步骤11:保存各分类子页面源文件。

3.Web网站产品详细信息的产品信息库构建方法,其特征在于:所述方法是针对采用权利要求1或2的分类抓取方法抓取的网页,通过分析各分类子页面源文件,根据产品列表信息块和产品所属分类信息块,提取产品信息和产品所属分类信息字段,获取字段中的id及文本描述信息,最后建立网站产品id、所属各级分类id以及其他详细信息的映射关系,并对id描述说明,构建成产品信息库。

4.根据权利要求3所述的Web网站产品详细信息的产品信息库构建方法,其特征在于:所述产品信息库分别由id映射、产品id描述、分类id描述3个表格组成;id映射表由产品id编号、产品所属各级分类id和其他详细信息组成;产品id描述表由产品id和产品的文本描述组成;分类id描述表由各级分类id和其文本描述组成。

5.根据权利要求3或4所述的Web网站产品详细信息的产品信息库构建方法,其特征在于:所述建立产品信息库的方法如下:步骤1:解析分类子页面源文件,获取产品列表信息块和产品所属分类信息块;

步骤2:提取产品所属分类信息块中的分类信息字段;

步骤3:提取产品列表信息块中的每个产品的产品信息字段;

步骤4:提取分类信息字段和产品信息字段中的id和文本描述信息;

步骤5:按照表格格式输入id字段和文本描述信息,最后存入数据库。