python爬虫学习

最新推荐文章于 2023-05-07 17:33:48 发布

榛砸Hazel

最新推荐文章于 2023-05-07 17:33:48 发布

阅读量118

点赞数

分类专栏： python 爬虫学习笔记

本文链接：https://blog.csdn.net/qq_44934798/article/details/99857966

版权

学习笔记同时被 3 个专栏收录

14 篇文章 0 订阅

订阅专栏

python

10 篇文章 0 订阅

订阅专栏

爬虫

2 篇文章 0 订阅

订阅专栏

Xpath是一门在 XML 文档中查找信息的语言。XPath 可用来在 XML 文档中对元素和属性进行遍历。

xpath提取网页内容 selector模块
XML 节点选择

表达式	描述
nodename	选取此节点的所有子节点。
/	从根节点选取。
//	从匹配选择的当前节点选择文档中的节点，而不考虑它们的位置。
.	选取当前节点。
…	选取当前节点的父节点。
@	选取属性。
bookstore	选取 bookstore 元素的所有子节点。
/bookstore	选取根元素 bookstore。
bookstore/book	选取属于 bookstore 的子元素的所有 book 元素。
//book	选取所有 book 子元素，而不管它们在文档中的位置。
bookstore//book	选择属于 bookstore 元素的后代的所有 book 元素，而不管它们位于 bookstore 之下的什么位置。
//@lang	选取名为 lang 的所有属性。

谓语路径表达式	结果：
/bookstore/book[1]	选取属于 bookstore 子元素的第一个 book 元素。
/bookstore/book[last()]	选取属于 bookstore 子元素的最后一个 book 元素。
/bookstore/book[last()-1]	选取属于 bookstore 子元素的倒数第二个 book 元素。
/bookstore/book[position()❤️]	选取最前面的两个属于 bookstore 元素的子元素的 book 元素。
//title[@lang]	选取所有拥有名为 lang 的属性的 title 元素。
//title[@lang=‘eng’]	选取所有 title 元素，且这些元素拥有值为 eng 的 lang 属性。
/bookstore/book[price>35.00]	选取 bookstore 元素的所有 book 元素，且其中的price 元素的值须大于 35.00。
/bookstore/book[price>35.00]/title	选取 bookstore 元素中的 book 元素的所有 title 元素，且其中的 price 元素的值须大于 35.00。

通配符	描述
*	匹配任何元素节点。
@*	匹配任何属性节点。
node()	匹配任何类型的节点。
/bookstore/*	选取 bookstore 元素的所有子元素。
//*	选取文档中的所有元素。
//title[@*]	选取所有带有属性的 title 元素。

选取若干路径/表达式	结果
//book/title / //book/price	选取 book 元素的所有 title 和 price 元素。
//title / //price	选取文档中的所有 title 和 price 元素。
/bookstore/book/title / //price	选取属于 bookstore 元素的 book 元素的所有 title 元素，以及文档中所有的 price 元素。：

Selector.xpath(’//div[@class=“msite-main”]/div/p/text()’) 得到指定部分文本

DeBug

module 'urllib' has no attribute 'urlopen'

urllib改urllib.request

TypeError: write() argument must be str, not bytes

原因为：Python3给open函数添加了名为encoding的新参数，而这个新参数的默认值却是‘utf-8’。这样在文件句柄上进行read和write操作时，系统就要求开发者必须传入包含Unicode字符的实例，而不接受包含二进制数据的bytes实例。

解决方法：
使用二进制写入模式（‘wb’）来开启待操作文件，而不能像原来那样，采用字符写入模式（‘w’）。

TypeError: cannot use a string pattern on a bytes-like

TypeError: can’t use a string pattern on a bytes-like object.
html用decode(‘utf-8’)进行解码，由bytes变成string。
py3的urlopen返回的不是string是bytes。
解决方法是：把’html’类型调整一下：html.decode(‘utf-8’)

SyntaxError: invalid character in identifier

代码行内有夹杂中文的空格，tab等，非文字字符．

'builtin_function_or_method' object is not subscriptable

f.readline[3] -> f.readline(3)

参考资料：
https://www.cnblogs.com/Axi8/p/5757270.html Python小爬虫——贴吧图片的爬取
https://www.cnblogs.com/Axi8/p/5773269.html Python小爬虫——贴吧图片爬虫V2.0
https://blog.csdn.net/kingyuan666/article/details/81214954
https://blog.csdn.net/tzs_1041218129/article/details/52228905
https://blog.csdn.net/it_arookie/article/details/82825448