python爬虫学习

10 篇文章 0 订阅
2 篇文章 0 订阅

Xpath是一门在 XML 文档中查找信息的语言。XPath 可用来在 XML 文档中对元素和属性进行遍历。

xpath提取网页内容 selector模块
XML 节点选择

表达式描述
nodename选取此节点的所有子节点。
/从根节点选取。
//从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置。
.选取当前节点。
选取当前节点的父节点。
@选取属性。
bookstore选取 bookstore 元素的所有子节点。
/bookstore选取根元素 bookstore。
bookstore/book选取属于 bookstore 的子元素的所有 book 元素。
//book选取所有 book 子元素,而不管它们在文档中的位置。
bookstore//book选择属于 bookstore 元素的后代的所有 book 元素,而不管它们位于 bookstore 之下的什么位置。
//@lang选取名为 lang 的所有属性。
谓语路径表达式结果:
/bookstore/book[1]选取属于 bookstore 子元素的第一个 book 元素。
/bookstore/book[last()]选取属于 bookstore 子元素的最后一个 book 元素。
/bookstore/book[last()-1]选取属于 bookstore 子元素的倒数第二个 book 元素。
/bookstore/book[position()❤️]选取最前面的两个属于 bookstore 元素的子元素的 book 元素。
//title[@lang]选取所有拥有名为 lang 的属性的 title 元素。
//title[@lang=‘eng’]选取所有 title 元素,且这些元素拥有值为 eng 的 lang 属性。
/bookstore/book[price>35.00]选取 bookstore 元素的所有 book 元素,且其中的price 元素的值须大于 35.00。
/bookstore/book[price>35.00]/title选取 bookstore 元素中的 book 元素的所有 title 元素,且其中的 price 元素的值须大于 35.00。
通配符描述
*匹配任何元素节点。
@*匹配任何属性节点。
node()匹配任何类型的节点。
/bookstore/*选取 bookstore 元素的所有子元素。
//*选取文档中的所有元素。
//title[@*]选取所有带有属性的 title 元素。
选取若干路径/表达式结果
//book/title / //book/price选取 book 元素的所有 title 和 price 元素。
//title / //price选取文档中的所有 title 和 price 元素。
/bookstore/book/title / //price选取属于 bookstore 元素的 book 元素的所有 title 元素,以及文档中所有的 price 元素。:

Selector.xpath(’//div[@class=“msite-main”]/div/p/text()’) 得到指定部分文本

DeBug

module 'urllib' has no attribute 'urlopen'

urllib改urllib.request

TypeError: write() argument must be str, not bytes

原因为:Python3给open函数添加了名为encoding的新参数,而这个新参数的默认值却是‘utf-8’。这样在文件句柄上进行read和write操作时,系统就要求开发者必须传入包含Unicode字符的实例,而不接受包含二进制数据的bytes实例。

解决方法:
使用二进制写入模式(‘wb’)来开启待操作文件,而不能像原来那样,采用字符写入模式(‘w’)。

TypeError: cannot use a string pattern on a bytes-like

TypeError: can’t use a string pattern on a bytes-like object.
html用decode(‘utf-8’)进行解码,由bytes变成string。
py3的urlopen返回的不是string是bytes。
解决方法是:把’html’类型调整一下:html.decode(‘utf-8’)

SyntaxError: invalid character in identifier

代码行内有夹杂中文的空格,tab等,非文字字符.

'builtin_function_or_method' object is not subscriptable

f.readline[3] -> f.readline(3)

参考资料:
https://www.cnblogs.com/Axi8/p/5757270.html Python小爬虫——贴吧图片的爬取
https://www.cnblogs.com/Axi8/p/5773269.html Python小爬虫——贴吧图片爬虫V2.0
https://blog.csdn.net/kingyuan666/article/details/81214954
https://blog.csdn.net/tzs_1041218129/article/details/52228905
https://blog.csdn.net/it_arookie/article/details/82825448

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值