python爬虫初学者2

这篇博客是Python爬虫初学者系列的第二篇,作者ywz2008008分享了如何使用BeautifulSoup和lxml模块来精准地从网页中提取内容。通过id或属性定位目标信息,使用find和find_all方法查找单个或多个元素。文章还提到了Python循环与C语言的不同,以及对`if name == 'main'`的理解困惑。
摘要由CSDN通过智能技术生成

代码内容 By ywz2008008
上一篇内容读出了页面的内容,虽然乱乱的一团,但还是成功了。
今天继续读出精准的内容,重点用到了:BeautifulSoup、lxml模块。

#!/usr/bin/python
# -*- coding: UTF-8 -*-
import requests
from bs4 import BeautifulSoup
movie_url = 'https://movie.douban.com/subject/1292052/'
def download_page(url):
	headers = {
   
	'User-Agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_12)AppleWebKit/537.36 (KHTML, like Gecko) Chrome/47.0.2526.80 Safari/537.36'
	}
	data = requests.get(url, headers = headers).content
	return data
def paser_html(html):
	soup = BeautifulSoup(html, 'lxml')
	title = soup.find(property = 
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值