爬虫入门二：用html文件保存爬取到的数据

树深时见鹿_ic

于 2019-08-19 22:03:53 发布

阅读量2.5k

点赞数 4

分类专栏：知识扩展文章标签：爬虫入门学习 Beautiful

本文链接：https://blog.csdn.net/qq_18505209/article/details/99768069

版权

爬虫入门二（续一）

文末附教程博客链接，感兴趣可以去看一下。

用html文件保存爬取到的数据

python代码：

import requests
from bs4 import BeautifulSoup
#1-1.获取网页信息保存到文件的过程
#url = "https://movie.douban.com/cinema/later/chengdu/"
#response = requests.get(url)
#file_obj = open('douban.html','w',encoding="utf-8")
#file_obj.write(response.content.decode('utf-8'))
#file_obj.close()
#1-2.从文件获取信息的过程
#file_obj = open('douban.html','r', encoding="utf-8")
#html = file_obj.read()
#file_obj.close()
#1-3.初始化BeautifulSoup，解析网页
#soup = BeautifulSoup(html, 'lxml')
#print(soup.find)
#2.直接抓取、解析
url = "https://movie.douban.com/cinema/later/chengdu/"
response = requests.get(url)
soup = BeautifulSoup(response.content.decode('utf-8'), 'lxml')
#3.获取并分析元素
all_movies = soup.find(<

最低0.47元/天解锁文章

树深时见鹿_ic

关注

4
点赞
踩
13

收藏

觉得还不错? 一键收藏
0
评论
爬虫入门二：用html文件保存爬取到的数据

爬虫入门二（续一）一直很想学习一下爬虫，今天忙里偷闲看了一篇教程博客之后开始入门学习，很感谢教程作者的讲解与分享，文末附教程博客链接，感兴趣可以去看一下。用html文件保存爬取到的数据import requestsfrom bs4 import BeautifulSoup#1-1.获取网页信息保存到文件的过程#url = "https://movie.douban.com/cine...
复制链接

扫一扫

专栏目录