手把手教你使用 Python 网络爬虫获取基金信息

最新推荐文章于 2025-09-04 08:00:30 发布

转载最新推荐文章于 2025-09-04 08:00:30 发布 · 653 阅读

CC 4.0 BY-SA版权

原文链接：https://mp.weixin.qq.com/s?__biz=Mzg3MjU3NzU1OA==&mid=2247522355&idx=1&sn=dddbded04e4f80e9b789f63c10c487a4&chksm=cf96efbe16cbbff95c6cccc36db9a774926c182cf10ed87fd910588dcff2c55e4ae635390ad0&scene=126&sessionid=0

文章标签：

#python #爬虫 #java #前端 #javascript

一、前言

前几天有个粉丝找我获取基金信息，这里拿出来分享一下，感兴趣的小伙伴们，也可以积极尝试。

二、数据获取

这里我们的目标网站是某基金官网，需要抓取的数据如下图所示。

可以看到上图中基金代码那一列，有不同的数字，随机点击一个，可以进入到基金详情页，链接也非常有规律，以基金代码作为标志的。

其实这个网站倒是不难，数据什么的，都没有加密，网页上的信息，在源码中都可以直接看到。

这样就降低了抓取难度了。通过浏览器抓包的方法，可以看到具体的请求参数，而且可以看到请求参数中只有pi在变化，而这个值恰好对应的是页面，直接构造请求参数就可以了。

代码实现过程

找到数据源之后，接下来就是代码实现了，一起来看看吧，这里给出部分关键代码。

获取股票id数据

response = requests.get(url, headers=headers, params=params, verify=False)
    pattern = re.compile(r'.*?"(?P<items>.*?)".*?', re.S)
    result = re.finditer(pattern, response.text)
    ids = []
    for item in result:
        # print(item.group('items'))
        gp_id = item.group('items').split(',')[0]

结果如下图所示：

之后构造详情页链接，获取详情页的基金信息，关键代码如下：

response = requests.get(url, headers=headers)
response.encoding = response.apparent_encoding
selectors = etree.HTML(response.text)
danweijingzhi1 = selectors.xpath('//dl[@class="dataItem02"]/dd[1]/span[1]/text()')[0]
danweijingzhi2 = selectors.xpath('//dl[@class="dataItem02"]/dd[1]/span[2]/text()')[0]
leijijingzhi = selectors.xpath('//dl[@class="dataItem03"]/dd[1]/span/text()')[0]
lst = selectors.xpath('//div[@class="infoOfFund"]/table//text()')

结果如下图所示：