scrapy css xpath 例子
如下段 目标代码,提取cnblogs首页的文章标题和连接:
==================================================
<div class="post_item_body">
<h3><a class="titlelnk" href="https://www.cnblogs.com/enjoy233/p/10298236.html" target="_blank">史上最最靠谱,又双叒叒简单的基于MSXML的XML解析指南-C++</a></h3>
<p class="post_item_summary">
<a href="https://www.cnblogs.com/enjoy233/" target="_blank"><img width="48" height="48" class="pfs" src="//pic.cnblogs.com/face/u436938.jpg?id=13124201" alt=""/></a> [TOC] 史上最最靠谱,又双叒叒简单的基于MSXML的XML解析指南 C++ 最近做C++相关的项目,遇到同时使用COM和MSXML来解析XML文件中信息的问题,这类问题如果做MFC开发也会经常用到。 在网上搜了一整圈,确实很难找到可用的code,总算自己研究出高效而简单的方法,借此机会总结一下, ...
</p>
<div class="post_item_foot">
<a href="https://www.cnblogs.com/enjoy233/" class="lightblue">Enjoy233</a>
发布于 2019-01-21 13:40
<span class="article_comment"><a href="https://www.cnblogs.com/enjoy233/p/10298236.html#commentform" title="" class="gray">
评论(0)</a></span><span class="article_view"><a href="https://www.cnblogs.com/enjoy233/p/10298236.html" class="gray">阅读(16)</a></span></div>
</div>
==================================================
css
response.css('div.post_item_body h3 a::text').extract()
response.css('div.post_item_body h3 a::attr("href")').extract()
xpath
response.xpath('//div[@class="post_item_body"]//h3//a/text()').extract()
response.xpath('//div[@class="post_item_body"]//h3//a/@href').extract()