第一步:给各个火车站按省归类
走过的坑:之前我先去12306上把所有的火车站名字爬了下来,然后做个地图网站爬虫,爬取所有车站的详细地址信息,但是有几百个不常见的火车站搜不出来,遂作罢;然后又做个百度百科爬虫,逐个把火车站的地址信息提取出来,但是又是几百个火车站在百度百科没有地址信息,有的还是地铁站名(oh my god),遂又放弃。
直到前几天,我遇到了下面这个网站:
真是踏破铁鞋无觅处,得来全不费功夫
所有火车站都在,我不禁感慨了一下之前在坑里逝去的青春
这是个很简单的静态网页,直接开始写爬虫:
简单介绍一下上面的代码,很适合初学者练手,首先将第一个网页中把各省的链接找到(province_items),提取href组成url2,再把每个省和对应的火车站数量le