python爬虫笔记第一章（基于路飞学城课程）

最新推荐文章于 2023-07-06 10:00:46 发布

小企鹅的学习日记

最新推荐文章于 2023-07-06 10:00:46 发布

阅读量1.2k

点赞数 3

分类专栏：爬虫文章标签： python

本文链接：https://blog.csdn.net/weixin_46501211/article/details/115054807

版权

第一章

你好！这是基于b站2021年路飞学成爬虫教程的python爬虫学习笔记，主要是方便作者复习和回顾课程内容。
已经发布第一章，第二章。

了解爬虫是什么——以爬baidu.com为例

爬⾍就是我们通过我们写的程序去抓取互联⽹上的数据资源. ⽐如, 此时我需要百度的资源. 在不考虑爬⾍的情况下, 我们肯定是打开浏览器, 然后输⼊百度的⽹址,紧接着, 我们就能在浏览器上看到百度的内容了. 那换成爬⾍呢? 其实道理是⼀样的. 只不过, 我们需要⽤代码来模拟⼀个浏览器, 然后同样的输⼊百度的⽹址. 那么我们的程序应该也能拿到百度的内容. 对吧~

在python中, 我们可以直接⽤urllib模块来完成对浏览器的模拟⼯作~

# 爬虫: 通过编写程序来获取到互联网上的资源
# 百度
# 需求: 用程序模拟浏览器. 输入一个网址. 从该网址中获取到资源或者内容
from urllib.request import urlopen
url = "http://www.baidu.com"
resp = urlopen(url)

#print(resp.read().decode("utf-8"))


with open("mybaidu.html",'w',encoding='utf-8') as f:
    f.write(resp.read().decode("utf-8")) #将网页的页面源代码保存下来
print("over")

效果：

最低0.47元/天解锁文章

小企鹅的学习日记

关注

3
点赞
踩
12

收藏

觉得还不错? 一键收藏
0
评论
python爬虫笔记第一章（基于路飞学城课程）

这里写自定义目录标题python爬虫笔记1爬虫的分类和流程功能快捷键合理的创建标题，有助于目录的生成如何改变文本的样式插入链接与图片如何插入一段漂亮的代码片生成一个适合你的列表创建一个表格设定内容居中、居左、居右SmartyPants创建一个自定义列表如何创建一个注脚注释也是必不可少的KaTeX数学公式新的甘特图功能，丰富你的文章UML 图表FLowchart流程图导出与导入导出导入python爬虫笔记1你好！这是我的python爬虫学习笔记。爬虫的分类和流程搜索引擎流程：抓取网页-数据存储-
复制链接

扫一扫