python爬虫
网络蜘蛛
是我知白哒
数据库运维牛马
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
lxml提取某个外层标签里的所有文本
lxml提取外层标签内所有文本原创 2024-12-22 10:31:00 · 649 阅读 · 0 评论 -
BeautifulSoup提取某个外层标签内的所有文本
separator = ""用于替换所有换行符和标签之间的分隔符为引号里的内容。strip=True,删除文本两侧多余空格。我在提取解析的时候直接选用这段xpath,但是结果只有“选项D错误:”只要提取了<div>标签里的所有文本,再拼接,就得到我需要的答案解析了。我们可以看到HTML中,剩下的两句在<strong>标签里。原创 2024-12-19 22:56:41 · 452 阅读 · 0 评论 -
selenium模拟某网校带密码登陆
浏览器自动化携带密码进入网课做题界面原创 2024-12-19 08:49:34 · 1099 阅读 · 0 评论 -
python爬取nstl40篇以上某校学位论文关键信息
使用selenium获取动态加载网页的关键信息原创 2024-10-22 15:50:52 · 519 阅读 · 3 评论 -
KeyError: ‘Spider not found: myspider‘
最外面的文件夹myspider是我创建的scrapy项目,它里面有一个叫做spiders的文件夹,我们新建的scrapy文件放到这个文件夹里,然后运行 ‘scrapy crawl 你的Spider名称’,爬虫程序才会运行。Scrapy 项目的 Spider 类应该位于。文件夹中的 Python 文件中。原创 2023-12-29 16:13:04 · 763 阅读 · 0 评论 -
设置Headers属性模拟浏览器
报头即请求报头(Request Header)是在发送 HTTP 请求时包含的一系列信息(按F12在网络下面可以找到,如果没有出现就按F5刷新),用于告诉服务器关于请求的详细信息和客户端的身份标识。它通常以键值对的形式组成,每个键值对表示一个具体的请求头字段和对应的值。上述代码爬取了经管之家的页面,并将页面保存在一个叫7.13的HTML文件中,keyword是搜索的关键词。User-Agent:用于标识发起请求的客户端身份信息,包括操作系统、浏览器等。Referer:表示当前请求的来源页面的 URL。原创 2023-07-14 15:41:49 · 1478 阅读 · 1 评论
分享