一、爬取目标
我们要提取出猫眼电影TOP100的电影名称、时间、评分、图片等信息,提取的站点URL为http://maoyan.com/board/4,提取的结果会以文件形式保存下来。
二、抓取分析
打开页面,可以查看到榜单信息,如图所示:
页面中显示的有效信息有影片名称、主演、上映时间、上映地区、评分、图片等信息。
将网页滚动到最下方,可以发现有分页的列表,直接点击第2页,观察页面的URL和内容发生了怎样的变化。
可以发现页面的URL变成https://www.maoyan.com/board/4?offset=10,比之前的URL多了一个参数,那就是offset=10,而目前显示的结果是排行11~20名的电影,初步推断这是一个偏移量的参数。再点击下一页,发现页面的URL变成了https://www.maoyan.com/board/4?offset=20,参数offset变成了21至30的电影。由此可以总结出规律,offset代表偏移量值,如果偏移量为n,则显示