网络爬虫-bs4解析基础

最新推荐文章于 2023-07-31 18:41:28 发布

一金两斤

最新推荐文章于 2023-07-31 18:41:28 发布

阅读量206

点赞数

分类专栏：网络爬虫文章标签：爬虫 python servlet

原文链接：https://www.bilibili.com/video/BV1Yh411o7Sz?p=20&vd_source=c1fbf609ddc30b36a9d00577df1296a5

版权

网络爬虫专栏收录该内容

10 篇文章 0 订阅

订阅专栏

bs4进行数据解析
- 数据解析的原理：
- 1.标签定位
- 2.提取标签、标签属性中存储的数据值
- bs4数据解析的原理：
- 1.实例化一个BeautifulSoup对象，并且将页面源码数据加载到该对象中
- 2.通过调用BeautifulSoup对象中相关的属性或者方法进行标签定位和数据提取
- 环境安装：
- pip install bs4
- pip install lxml
- 如何实例化BeautifulSoup对象：
- from bs4 import BeautifulSoup
- 对象的实例化：
- 1.将本地的html文档中的数据加载到该对象中
fp = open('./test.html','r',encoding='utf-8')
soup = BeautifulSoup(fp,'lxml')
- 2.将互联网上获取的页面源码加载到该对象中
page_text = response.text
soup = BeatifulSoup(page_text,'lxml')
- 提供的用于数据解析的方法和属性：
- soup.tagName:返回的是文档中第一次出现的tagName对应的标签
- soup.find():
- find('tagName'):等同于soup.div
- 属性定位：
-soup.find('div',class_/id/attr='song')
- soup.find_all('tagName'):返回符合要求的所有标签（列表）
- select：
- select('某种选择器（id，class，标签...选择器）'),返回的是一个列表。
- 层级选择器：
- soup.select('.tang > ul > li > a')：>表示的是一个层级
- oup.select('.tang > ul a')：空格表示的多个层级
- 获取标签之间的文本数据：
- soup.a.text/string/get_text()
- text/get_text():可以获取某一个标签中所有的文本内容
- string：只可以获取该标签下面直系的文本内容
- 获取标签中属性值：
- soup.a['href']
text.html

<html lang="en">
<head>
   <meta charset="UTF-8" />
   <title>测试bs4</title>
</head>
<body>
   <div>
       <p>百里守约</p>
   </div>
   <div class="song">
       <p>李清照</p>
       <p>王安石</p>
       <p>苏轼</p>
       <p>柳宗元</p>
       <a href="http://www.song.com/" title="赵匡胤" target="_self">
           <span>this is span</span>
       宋朝是最强大的王朝，不是军队的强大，而是经济很强大，国民都很有钱</a>
       <a href="" class="du">总为浮云能蔽日,长安不见使人愁</a>
       <img src="http://www.baidu.com/meinv.jpg" alt="" />
   </div>
   <div class="tang">
       <ul>
           <li><a href="http://www.baidu.com" title="qing">清明时节雨纷纷,路上行人欲断魂,借问酒家何处有,牧童遥指杏花村</a></li>
           <li><a href="http://www.163.com" title="qin">秦时明月汉时关,万里长征人未还,但使龙城飞将在,不教胡马度阴山</a></li>
           <li><a href="http://www.126.com" alt="qi">岐王宅里寻常见,崔九堂前几度闻,正是江南好风景,落花时节又逢君</a></li>
           <li><a href="http://www.sina.com" class="du">杜甫</a></li>
           <li><a href="http://www.dudu.com" class="du">杜牧</a></li>
           <li><b>杜小月</b></li>
           <li><i>度蜜月</i></li>
           <li><a href="http://www.haha.com" id="feng">凤凰台上凤凰游,凤去台空江自流,吴宫花草埋幽径,晋代衣冠成古丘</a></li>
       </ul>
   </div>
</body>
</html>

python文件

#!/usr/bin/env python
# -*- coding:utf-8 -*-
from bs4 import BeautifulSoup
if __name__ == "__main__":
#将本地的html文档中的数据加载到该对象中
fp = open('./test.html','r',encoding='utf-8')
soup = BeautifulSoup(fp,'lxml')
# print(soup)
# print(soup.a) #soup.tagName 返回的是html中第一次出现的tagName标签
# print(soup.div)
#find('tagName'):等同于soup.div
# print(soup.find('div')) #print(soup.div)
# print(soup.find('div',class_='song').string)
# print(soup.find_all('a'))
# print(soup.select('.tang'))
print(soup.select('.tang > ul a')[0]['href'])