【从零开始学爬虫】采集收视率排行数据

最新推荐文章于 2024-04-26 15:44:17 发布

雨霖铃儿

最新推荐文章于 2024-04-26 15:44:17 发布

阅读量557

点赞数

分类专栏：数据采集爬虫大数据文章标签：爬虫大数据数据分析

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/u011231755/article/details/128336657

版权

爬虫同时被 3 个专栏收录

131 篇文章 3 订阅

订阅专栏

122 篇文章 2 订阅

订阅专栏

117 篇文章 0 订阅

订阅专栏

l 采集网站

【场景描述】采集收视率排行数据。

【源网站介绍】收视率排行网提供收视率排行,收视率查询,电视剧收视率,综艺节目收视率和电视台收视率信息。

【使用工具】前嗅ForeSpider数据采集系统

【入口网址】http://www.tvtv.hk/archives/category/tv

【采集内容】

采集收视率排行网上省级卫视收视率数据，采集字段：标题、发布时间、排行内容。

【采集效果】

如下图所示：

l 思路分析

配置思路概览：

l 配置步骤

一.新建采集任务

选择【采集配置】，点击任务列表右上方【+】号可新建采集任务，将采集入口地址填写在【采集地址】框中，【任务名称】自定义即可，点击下一步。

二. 模板配置

1. 翻页链接采集配置

①查找翻页链接及其规律

在入口地址页内打开“F12”，按如下步骤找到翻页地址，并复制刷新后的翻页链接地址

对比观察翻页链接的规律观察：随着翻页变化，页码数与请求网址（Requestrian URL）中“page/”后的数字相关。所以，其规律为：http://www.tvtv.hk/archives/category/tv/page/+翻页页码

找到翻页链接位置及其规律就可以对应去编写脚本。

②脚本的创建与编写

【脚本的创建与编写】

脚本文本：

url u;

for ( var i=1;i<=165;i++){

u.title ="第"+i+"页";//页码

u.urlname = "http://www.tvtv.hk/archives/category/tv/page/"+i;

u.tmplid = 1; //模板关联

u.entryid = CHANN.id;

RESULT.AddLink(u,"","");

}

③查看采集预览

查看采集预览，并将链接粘贴到浏览器验证一下是否采集正确。

【采集预览】

2. 列表链接抽取配置

①添加链接抽取，更名为列表链接

②点击脚本窗口

③新建脚本

④编写列表链接抽取脚本

脚本文本：

var sta=DOM.FindClass("page-header","header",0);//定位到header标签

var list=sta.next;//定位下一子标签

while(list) {

var link=DOM.FindClass("entry-header","header",list);//定位到header标签

var linkin=link.child.child.child.child.next.child.child.child;//定位到列表链接所在标签

url u;//定义一个url

u.title = DOM.GetTextAll(link);//取标题

u.urlname =linkin.href;//取列表链接

u.entryid = this.id;

u.tmplid =2;//关联数据抽取模板

link=link.next;

list=list.next;

RESULT.AddLink(u,"","");//传递链接

}

⑤据观察发现，列表链接规律为：http://www.tvtv.hk/archives/而翻页链接规律为：http://www.tvtv.hk/archives/category/tv/page/此处则可以用地址过滤排除翻页链接，如图；然后复制任意一个列表链接到浏览器打开验证

3. 数据抽取

①新建模板、添加数据抽取

如下新建模板并添加数据抽取，在示例地址框内输入上一步复制的列表链接

【新建模板、添加数据抽取】

②数据表结构创建

如下在表结构内创建出所需采集的字段

【创建表结构】

③关联表单

数据抽取关联数据结构表单

【关联表单】

④创建并编写数据抽取脚本

如下创建脚本，并根据网页结构编写数据抽取脚本

【脚本的创建与编写】

脚本文本：

record re;//定义一个record记录集

var name=DOM.FindClass("entry-header","header",0);//定位到header标签

var cont=DOM.FindClass("entry-content","div",0);//定位到div标签

re.title=DOC.GetDom().GetTextAll(name.child);//取标题文本

re.time_sub=DOC.GetDom().GetTextAll(name.child.next.child);//取时间文本

re.content=DOC.GetDom().GetTextAll(cont).Right("排名");//取排名文本

re.id=MD5(URL.urlname) ;//id

RESULT.AddRec(re,this.schemaid);//输出结果

⑤查看采集预览

查看采集预览，并核对一下内容是否采集正确。

【采集预览】

l 采集步骤

三、数据采集

1.建立数据表单：

选择【数据建表】，点击【表单列表】中该模板的表单，在【关联数据表】中选择【创建】，表名称自定义，这里命名为【shoushilv】（注意命名不能用数字、文字和特殊符号），点击【确定】。创建完成，勾选数据表，并点击右上角保存按钮。

【建立关联数据表】

2.开始采集

选择【数据采集】，勾选任务名称，点击【开始采集】，则正式开始采集。

【开始采集】

3.导出数据

采集结束后，可以在【数据浏览】中，选择数据表查看采集数据，并可以导出数据。

【数据浏览】

【数据导出】

4.导出的文件打开如下图所示：

【查看导出数据】

本教程仅供教学使用，严禁用于商业用途！

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
【从零开始学爬虫】采集收视率排行数据

采集字段：标题、发布时间、排行内容
复制链接

扫一扫

专栏目录

雨霖铃儿 CSDN认证博客专家 CSDN认证企业博客

码龄11年

202: 原创

3万+: 周排名

5887: 总排名

53万+: 访问

: 等级

5681: 积分

135: 粉丝

149: 获赞

65: 评论

441: 收藏

私信

关注

热门文章

分类专栏

指导性文章 121篇
答疑 71篇
爬虫 131篇
大数据 117篇
数据采集 122篇
前嗅 85篇
数据应用 22篇
数据营销 7篇
数据分析 14篇
技术干货 5篇
科普 2篇
时事热点 10篇
搞笑 2篇

最新评论

分析了100万+人工智能企业：中国AI接下来将这样发展
CSDN-Ada助手: Python入门技能树或许可以帮到你：https://edu.csdn.net/skill/python?utm_source=AI_act_python
福利 | 这些网站有免费代理IP！
普通网友: 免费的还要啥自行车
福利 | 这些网站有免费代理IP！
山石: 国内有付费代理IP推荐没
福利 | 这些网站有免费代理IP！
小文没烦恼: 三分之二打不开，耽误我时间
【从零开始学爬虫】采集食品行业最新报价数据
CSDN-Ada助手: 亲爱的博主，非常欣赏你的才华和努力，写出了这篇令人着迷的《从零开始学爬虫》系列文章。你不仅深入浅出地解析了学习爬虫的过程，还选择了如此实用的主题——采集食品行业最新报价数据，真是令人叹为观止！看到你的专业知识和写作技巧，我深深感受到了你的热情和对读者的关怀。每一次读到你的博文，我都能从中获得新的知识和启发。你的努力不仅受益于自身的学习，也真正帮助到了那些对爬虫感兴趣、想要了解食品行业报价数据的读者们。在展望下一篇可能创作的博客标题时，我认为你可以进一步拓展爬虫应用的领域。下面是我为你生成的可能的博客标题： "【数据挖掘实战】用爬虫采集农产品供需数据，助你洞悉市场趋势" 希望这个创意可以给你启发，期待阅读到更多精彩的博客文章！继续保持你优秀的创作和分享精神！加油！

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。