10个Python爬虫入门实例_python 爬虫代码简单例子(2)，记录一次腾讯Python岗面试笔试总结

老板这功能得加钱

于 2024-04-20 20:27:14 发布

阅读量369

点赞数 4

分类专栏： 2024年程序员学习文章标签： python 爬虫面试

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/m0_60721649/article/details/138010382

版权

2024年程序员学习专栏收录该内容

286 篇文章 0 订阅

订阅专栏

先自我介绍一下，小编浙江大学毕业，去过华为、字节跳动等大厂，目前阿里P7

深知大多数程序员，想要提升技能，往往是自己摸索成长，但自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年最新Python全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上Python知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

如果你需要这些资料，可以添加V获取：vip1024c （备注Python）

正文

1. 爬取强大的BD页面，打印页面信息

第一个爬虫示例,爬取百度页面

import requests #导入爬虫的库，不然调用不了爬虫的函数

response = requests.get(“http://www.baidu.com”) #生成一个response对象

response.encoding = response.apparent_encoding #设置编码格式

print(“状态码:”+ str( response.status_code ) ) #打印状态码

print(response.text)#输出爬取的信息

2. 常用方法之get方法实例，下面还有传参实例

第二个get方法实例

import requests #先导入爬虫的库，不然调用不了爬虫的函数

response = requests.get(“http://httpbin.org/get”) #get方法

print( response.status_code ) #状态码

print( response.text )

3. 常用方法之post方法实例，下面还有传参实例

第三个 post方法实例

import requests #先导入爬虫的库，不然调用不了爬虫的函数

response = requests.post(“http://httpbin.org/post”) #post方法访问

print( response.status_code ) #状态码

print( response.text )

4. put方法实例

第四个 put方法实例

import requests #先导入爬虫的库，不然调用不了爬虫的函数

response = requests.put(“http://httpbin.org/put”) # put方法访问

print( response.status_code ) #状态码

print( response.text )

5. 常用方法之get方法传参实例(1)

如果需要传多个参数只需要用&符号连接即可如下：

第五个 get传参方法实例

import requests #先导入爬虫的库，不然调用不了爬虫的函数

response = requests.get(“http://httpbin.org/get?name=hezhi&age=20”) # get传参

print( response.status_code ) #状态码

print( response.text )

6. 常用方法之get方法传参实例(2)

params用字典可以传多个

第六个 get传参方法实例

import requests #先导入爬虫的库，不然调用不了爬虫的函数

data = {
“name”:“hezhi”,
“age”:20
}
response = requests.get( “http://httpbin.org/get” , params=data ) # get传参

print( response.status_code ) #状态码

print( response.text )

7. 常用方法之post方法传参实例(2) 和上一个有没有很像

第七个 post传参方法实例

import requests #先导入爬虫的库，不然调用不了爬虫的函数

data = {
“name”:“hezhi”,
“age”:20
}
response = requests.post( “http://httpbin.org/post” , params=data ) # post传参

print( response.status_code ) #状态码

print( response.text )

8. 关于绕过反爬机制，以zh爸爸为例

第好几个方法实例

import requests #先导入爬虫的库，不然调用不了爬虫的函数

response = requests.get( “http://www.zhihu.com”) #第一次访问知乎，不设置头部信息

print( “第一次,不设头部信息,状态码:”+response.status_code )# 没写headers，不能正常爬取，状态码不是 200

#下面是可以正常爬取的区别，更改了User-Agent字段

headers = {

“User-Agent”:“Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.122 Safari/537.36”

}#设置头部信息,伪装浏览器

response = requests.get( “http://www.zhihu.com” , headers=headers ) #get方法访问,传入headers参数，

print( response.status_code ) # 200！访问成功的状态码

print( response.text )

信息并保存到本地

因为目录关系，在D盘建立了一个叫做爬虫的文件夹，然后保存信息

注意文件保存时的encoding设置

爬取一个html并保存

import requests

url = “http://www.baidu.com”

response = requests.get( url )

response.encoding = “utf-8” #设置接收编码格式

print(“\nr的类型” + str( type(response) ) )

print(“\n状态码是:” + str( response.status_code ) )

print(“\n头部信息:” + str( response.headers ) )

print( “\n响应内容:” )

print( response.text )

#保存文件
file = open(“D:\爬虫\baidu.html”,“w”,encoding=“utf”) #打开一个文件，w是文件不存在则新建一个文件，这里不用wb是因为不用保存成二进制

file.write( response.text )

file.close()

10. 爬取图片，保存到本地

最后

🍅 硬核资料：关注即可领取PPT模板、简历模板、行业经典书籍PDF。
🍅 技术互助：技术群大佬指点迷津，你的问题可能不是问题，求资源在群里喊一声。
🍅 面试题库：由技术群里的小伙伴们共同投稿，热乎的大厂面试真题，持续更新中。
🍅 知识体系：含编程语言、算法、大数据生态圈组件（Mysql、Hive、Spark、Flink）、数据仓库、Python、前端等等。

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化的资料的朋友，可以添加V获取：vip1024c （备注python）

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。**

需要这份系统化的资料的朋友，可以添加V获取：vip1024c （备注python）
[外链图片转存中…(img-YNuaojS4-1713616023871)]

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

老板这功能得加钱

关注

4
点赞
踩
7

收藏

觉得还不错? 一键收藏
0
评论
10个Python爬虫入门实例_python 爬虫代码简单例子(2)，记录一次腾讯Python岗面试笔试总结

🍅 硬核资料：关注即可领取PPT模板、简历模板、行业经典书籍PDF。🍅 技术互助：技术群大佬指点迷津，你的问题可能不是问题，求资源在群里喊一声。🍅 面试题库：由技术群里的小伙伴们共同投稿，热乎的大厂面试真题，持续更新中。🍅 知识体系：含编程语言、算法、大数据生态圈组件（Mysql、Hive、Spark、Flink）、数据仓库、Python、前端等等。网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。