这几天开始背诵考研单词,在网上查找英语考研必备词汇,发现都是长这样的:
每一页的点击太费时费力了。因此萌生了为什么不能用爬虫把单词爬下来保存在本地呢?说干咱就干。首先点开搜索中的某个网页,分析网页的结构,找到其中的规律。例如,我找的是跨考考研的网站:
这是该网站http://www.kuakao.com/english/ch/39183.html的英语词汇链接起始.
安全起见,我们先查看网站的robots协议,可以看到并没有限制我们爬取词汇页面。
接下来使用chrome浏览器,右键点击view page source(ctrl-U),也可以选择inspect(ctrl+shift+I),找到对应的词汇部分&#x