BeautifulSoup库学习笔记

最新推荐文章于 2022-02-25 22:24:30 发布

tianyuan233

最新推荐文章于 2022-02-25 22:24:30 发布

阅读量232

点赞数

分类专栏：爬虫文章标签：库 bsp

本文链接：https://blog.csdn.net/t1anyuan/article/details/79561254

版权

爬虫专栏收录该内容

5 篇文章 0 订阅

订阅专栏

import requests
from bs4 import BeautifulSoup
import lxml
# data = requests.get('https://book.douban.com/').text

data = '''
<ul>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-main","uid":"0"}' href="https://www.douban.com" target="_blank">豆瓣</a></li>
<li class="on"><a data-moreurl-dict='{"from":"top-nav-click-book","uid":"0"}' href="https://book.douban.com">读书</a>
</li>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-movie","uid":"0"}' href="https://movie.douban.com" target="_blank">电影</a>
</li>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-music","uid":"0"}' href="https://music.douban.com" target="_blank">音乐</a>
</li>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-location","uid":"0"}' href="https://www.douban.com/location" target="_blank">同城</a>
</li>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-group","uid":"0"}' href="https://www.douban.com/group" target="_blank">小组</a>
</li>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-read","uid":"0"}' href="https://read.douban.com/?dcs=top-nav&amp;dcm=douban" target="_blank">阅读</a>
</li>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-fm","uid":"0"}' href="https://douban.fm/?from_=shire_top_nav" target="_blank">FM</a>
</li>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-time","uid":"0"}' href="https://time.douban.com/?dt_time_source=douban-web_top_nav" target="_blank">时间</a>
</li>
<li class=""><a data-moreurl-dict='{"from":"top-nav-click-market","uid":"0"}' href="https://market.douban.com/?utm_campaign=douban_top_nav&amp;utm_source=douban&amp;utm_medium=pc_web" target="_blank">市集</a>
</li>
</ul>
'''
soup = BeautifulSoup(data,'lxml')
#

#print(soup.prettify())
# print(soup.title.name)

标签选择器只返回匹配的第一个标签

# print(soup.head)
# print(soup.p['class'])
# print(soup.p.contents)
# print(soup.div.children)
# for i,child in enumerate(soup.ul.children):
#     print(i,child)

#获取父节点
# print(soup.a.parent)
#获取祖先节点
# print(soup.a.parents)
#兄弟节点
# print([i for i in enumerate(soup.li.next_siblings)])

标准选择器

# for li in soup.find_all('ul'):
#     print(li.find_all('li'))
#     print(len(li.find_all('li')))
#     print(type(li.find_all('li')))

CSS选择器

# print(soup.select('ul li'))
# print(soup.select('li a'))
# for i in soup.select('li a'):
#获取内容
#     print(i.get_text())
#     print(i.contents)
#获取属性
#     print(i.get('href'))
#     print(i.attrs['data-moreurl-dict'])

tianyuan233

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
BeautifulSoup库学习笔记

import requestsfrom bs4 import BeautifulSoupimport lxml# data = requests.get('https://book.douban.com/').textdata = '''<ul><li class=""><a data-moreurl-dict='{"from":"top-nav-click-main","uid":"0"
复制链接

扫一扫