爬虫
Janvn
这个作者很懒,什么都没留下…
展开
-
[Python]网络爬虫(一):抓取网页的含义和URL基本构成
一、网络爬虫的定义网络爬虫,即Web Spider,是一个很形象的名字。把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页的。从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它链接地址,然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一转载 2014-11-04 20:34:00 · 864 阅读 · 0 评论 -
用scrapy框架时,出现问题:ValueError: invalid literal for int() with base 10: 'dev0'
在用python爬虫框架scrapy的时候,出现ValueError: invalid literal for int() with base 10: 'dev0'这个问题,纠结了好久,原来是在装依赖包的时候有问题,后来将pyOpenSSL这个依赖包换了一个版本重新安装后,问题顺利解决。原创 2015-06-17 20:05:07 · 5798 阅读 · 2 评论