heritrix3 伪装成GOOGLE进行爬取

最新推荐文章于 2022-08-06 11:01:04 发布

iteye_3946

最新推荐文章于 2022-08-06 11:01:04 发布

阅读量154

点赞数

文章标签： Google 搜索引擎 Bean 浏览器

伪装成搜索引擎蜘蛛google bot访问需网站, 这样能防止爬虫被封
在crawler-beans.cxml 中修改metadata成下面

 <!-- CRAWL METADATA: including identification of crawler/operator -->
 <bean id="metadata" class="org.archive.modules.CrawlMetadata" autowire="byName">
       <property name="operatorContactUrl" value="[see override above]"/>
       <property name="jobName" value="[see override above]"/>
       <property name="description" value="[see override above]"/>
  <!-- <property name="operator" value=""/> -->
  <!-- <property name="operatorFrom" value=""/> -->
  <!-- <property name="organization" value=""/> -->
  <!-- <property name="audience" value=""/> -->
      <property name="userAgentTemplate" 
         value="Mozilla/5.0 (compatible; Googlebot/2.1; +@OPERATOR_CONTACT_URL@) "/> 
 </bean>

伪装Googlebot。许多网站访问时需要注册，但用Google、Baidu等搜索引擎搜索时却可以搜索到全文。这是因为网站对访问者的 User Agent进行了判断，如果是bot，则允许其访问；如果是一般用户，则自动跳转到登陆页面。用User Agent Switcher就可以把自己伪装成Googlebot，进而不用注册也可以访问这些网站。

那么我们也可以伪装成搜索引擎来进入这些页面。我们需要的是修改浏览器的User-Agent 值。

iteye_3946

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
heritrix3 伪装成GOOGLE进行爬取

伪装成搜索引擎蜘蛛google bot访问需网站, 这样能防止爬虫被封在crawler-beans.cxml 中修改metadata成下面 &lt;!-- CRAWL METADATA: including identification of crawler/operator --&gt; &lt;bean id="metadata" class="org.archive.module...
复制链接

扫一扫