python网络爬虫实战解析

最新推荐文章于 2024-07-07 08:00:00 发布

hello the only world

最新推荐文章于 2024-07-07 08:00:00 发布

阅读量504

点赞数

分类专栏：爬虫课后答案文章标签：爬虫

本文链接：https://blog.csdn.net/qq_56670226/article/details/116542970

版权

本文介绍了使用Python进行网络爬虫实战，目标是获取股票数据。首先找到股票代码列表网站并利用Requests和PyQuery库获取数据，然后通过分析发现数据实际来源于数据接口，而不是页面本身。最后，使用同样的库解析接口返回的JSONP数据，将数据存储到MySQL数据库中。

摘要由CSDN通过智能技术生成

郑重声明：本文仅用于学习等目的。
分析
首先要爬取股票数据，肯定要先知道有哪些股票吧，这里小编找到了一个网站，这个网站上有股票的编码列表：https://hq.gucheng.com/gpdmylb.html 。

打开 Chrome 的开发者模式，将股票代码一个一个选出来吧。具体过程小编就不贴了，各位同学自行实现。
我们可以将所有的股票代码存放在一个列表中，剩下的就是找一个网站，循环的去将每一只股票的数据取出来咯。
这个网站小编已经找好了，是同花顺，链接： http://stockpage.10jqka.com.cn/000001/ 。

想必各位聪明的同学已经发现了，这个链接中的 000001 就是股票代码。
我们接下来只需要拼接这个链接，就能源源不断的获取到我们想要的数据。
实战
首先，还是先介绍一下本次实战用到的请求库和解析库为： Requests 和 pyquery 。数据存储最后还是落地在 Mysql 。
获取股票代码列表
第一步当然是先构建股票代码列表咯，我们先定义一个方法：
def get_stock_list(stockListURL):
r =requests.get(stockListURL, headers = headers)
doc = PyQuery(r.text)
list = []
# 获取所有 section 中 a 节点，并进行迭代
for i in doc(’.stockTable a’).items():
try:
href = i.attr.href
list.append(re.findall(r"\d{6}", href)[0])
except:
continue
list = [item.lower() for item in list] # 将爬取信息转换小写
return list复制代码

将上面的链接当做参数传入，大家可以自己运行下看下结果，小编这里就不贴结果了，有点长。。。
获取详情数据
详情的数据看起来好像是在页面上的，但是，实际上并不在，实际最终获取数据的地方并不是页面，而是一个数据接口。
http://qd.10jqka.com.cn/quote.php?cate=real&type=stock&callback=showStockDate&return=json&code=000001复制代码

至于是怎么找出来，小编这次就不说，还是希望各位想学爬虫的同学能自己动动手，去寻找一下，多找几次，自然就摸到门路了。
现在数据接口有了，我们先看下返回的数据吧：
showStockDate({“info”:{“000001”:{“name”:"\u5e73\u5b89\u94f6\u884c"}},“data”:{“000001”:{“10”:“16.13”,“8”:“16.14”,“9”:“15.87”,“13”:“78795234.00”,“19”:“1262802470.00”,“7”:“16.12”,“15”:“40225508.00”,“14”:“37528826.00”,“69”:“17.73”,“70”:“14.51”,“12”:“5”,“17”:“945400.00”,“264648”:“0.010”,“199112”:“0.062”,“1968584”:“0.406”,“2034120”:“9.939”,“1378761”:“16.026”,“526792”:“1.675”,“395720”:"-948073.000",“461256”:"-39.763",“3475914”:“313014790000.000”,“1771976”:“1.100”,“6”:“16.12”,“11”:""}}})复制代码

很明显，这个结果并不是标准的 json 数据，但这个是 JSONP 返回的标准格式的数据，这里我们先处理下头尾，将它变成一个标准的 json 数据，再对照这页面的数据进行解析，最后将分析好的值写入数据库中。
def getStockInfo(list, stockInfoURL):
count = 0
for stock in list:
try:
url = stockInfoURL + stock
r = requests.get(url, headers=headers)
# 将获取到的数据封装进字典
dict1 = json.loads(r.text[14: int(len(r.text)) - 1])
print(dict1)

        # 获取字典中的数据构建写入数据模版
        insert_data = {
            "code": stock,
            "name": dict1['info'][stock]['name'],
            "jinkai": dict1['data'][stock]['7'],
            "chengjiaoliang": dict1['data'][stock]['13'],
            "zhenfu": dict1['data'][stock]['526792'],
            "zuigao": dict1['data'][stock]['8'],
            "chengjiaoe": dict1['data'][stock]['19'],
            "huanshou": dict1['data'][stock]['1968584'],
            "zuidi": dict1['data'][stock]['9'],
            "

最低0.47元/天解锁文章

hello the only world

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python网络爬虫实战解析

电机学第七版乌曼课后答案电化学方法原理和应用第二版邵元华课后答案电力系统继电保护黄少锋课后答案生物化学第4版同步辅导与习题集朱圣庚PDF机床数控技术及应用第四版陈蔚芳课后答案机器视觉算法与应用第2版课后答案数据结构教程第5版李春葆课后答案建筑材料第四版课后答案应用统计学第四版卢冶飞课后答案基因工程袁婺洲第二版课后答案电机学第七版乌曼课后答案电化学方法原理和应用第二版邵元华课后答案电力系统继电保护黄少锋课后答案生物化学第4版同步辅导与习题集朱圣庚PDF机床数控技术及应用第四版陈蔚芳
复制链接

扫一扫

专栏目录