前言
喜马拉雅是专业的音频分享平台,聚集了有声小说,有声读物,有声书,FM电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢?html
今天带你们爬取喜马拉雅音频数据,一块儿期待吧!!python
这个案例的视频地址在这里json
https://v.douyu.com/show/a2JEMJj3e3mMNxml
项目目标
爬取喜马拉雅音频数据ide
受害者地址工具
https://www.ximalaya.com/
本文知识点:url
一、系统分析网页性质
二、多层数据解析
三、海量音频数据保存
环境:spa
python 3.6
pycharm
requests
parsel
思路:(爬虫案例)
1.肯定数据所在的连接地址(url)
2.经过代码发送url地址的请求
3.解析数据(要的, 筛选不要的)
4.数据持久化(保存)
案例思路:code
1. 在静态数据中获取音频的id值
2. 发送指定id值json数据请求(src)
3. 从json数据中解析音频所对应的URL地址
开始写代码
先导入所需的模块orm
importrequestsimport parsel #数据解析模块
import re
1.肯定数据所在的连接地址(url) 逆向分析 网页性质(静态网页