python爬虫初学者2

最新推荐文章于 2023-03-07 09:24:13 发布

hldcsc

最新推荐文章于 2023-03-07 09:24:13 发布

阅读量160

点赞数

本文链接：https://blog.csdn.net/hldcsc/article/details/104242483

版权

这篇博客是Python爬虫初学者系列的第二篇，作者ywz2008008分享了如何使用BeautifulSoup和lxml模块来精准地从网页中提取内容。通过id或属性定位目标信息，使用find和find_all方法查找单个或多个元素。文章还提到了Python循环与C语言的不同，以及对`if name == 'main'`的理解困惑。

摘要由CSDN通过智能技术生成

代码内容 By ywz2008008
上一篇内容读出了页面的内容，虽然乱乱的一团，但还是成功了。
今天继续读出精准的内容，重点用到了：BeautifulSoup、lxml模块。

#!/usr/bin/python
# -*- coding: UTF-8 -*-
import requests
from bs4 import BeautifulSoup
movie_url = 'https://movie.douban.com/subject/1292052/'
def download_page(url):
	headers = {
   
	'User-Agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_12)AppleWebKit/537.36 (KHTML, like Gecko) Chrome/47.0.2526.80 Safari/537.36'
	}
	data = requests.get(url, headers = headers).content
	return data
def paser_html(html):
	soup = BeautifulSoup(html, 'lxml')
	title = soup.find(property =