基于Beautiful Soup 4.2.0文档的学习记录（3）——get_text()、get()

最新推荐文章于 2024-08-04 08:26:03 发布

HeatDeath

最新推荐文章于 2024-08-04 08:26:03 发布

阅读量7.4k

点赞数 11

分类专栏： Python爬虫文章标签： bs4

本文为博主原创文章，未经博主允许不得转载。哈哈哈

本文链接：https://blog.csdn.net/HeatDeath/article/details/64930478

版权

Python爬虫专栏收录该内容

18 篇文章 0 订阅

订阅专栏

get_text()

如果只想得到tag中包含的文本内容,那么可以用 get_text() 方法,这个方法获取到tag中包含的所有文版内容包括子孙tag中的内容,并将结果作为Unicode字符串返回:

markup = '<a href="http://example.com/">\nI linked to <i>example.com</i>\n</a>'
soup = BeautifulSoup(markup)

soup.get_text()
u'\nI linked to example.com\n'
soup.i.get_text()
u'example.com'

可以通过参数指定tag的文本内容的分隔符:

# soup.get_text("|")
u'\nI linked to |example.com|\n'

还可以去除获得文本内容的前后空白:

# soup.get_text("|", strip=True)
u'I linked to|example.com'

或者使用 .stripped_strings 生成器,获得文本列表后手动处理列表:

[text for text in soup.stripped_strings]
# [u'I linked to', u'example.com']

get()

tag.get(attr)，可以得到tag标签中attr属性的value

for link in soup.find_all('a'):
    print(link.get('href'))
    # http://example.com/elsie
    # http://example.com/lacie
    # http://example.com/tillie