如何在18天内让Google收录超过55亿个网页

转载 2006年06月18日 16:00:00
点击看大图  今天这个新闻成为了热点,同时也让人感到非常吃惊。这也许是有史以来最成功的Spam个案,因为它成功地骗过了Google,让Google在18天内收录了它的超过55亿个网页。这是一个前所未有的例子,同时也对Google的形象造成了一定的影响。那么到底是谁这么厉害,用什么样的方法做到这一点的呢?下面我们一起来看一下实现的方法。

  根据Monetize(via digg)的报道,下面这两个网站被Google收录的网页数量达到了惊人的几十亿:

  直接点击这里看站点一的Google收录结果

  直接点击这里看站点二的Google收录结果

  要提醒一下的是,点击上面的链接时,每个人返回的结果数并不一定相同,这是因为每个人访问的Google数据中心不一定相同。但结果都是十分惊人的。为了保存记录,我截了两个图:

点击看大图
这是站点一的收录结果,接近24亿个。

点击看大图
这是站点二的收录结果,少一些,但也接近20亿个。

  根据数据中心的结果的不同,以上两个站点能查询到的Google收录数量分别最多可达55亿个和24亿个。当然,不排除这件事曝光后Google会对这个站采取行动,估计以后查询的话,结果数量会更少。

  然而更令人吃惊的是上面的两个站点的域名都只有18天历史,也就是说这两个站在3个星期内,就已经被Google收录了几十亿个网页。更不可思议的是,这两个站点的拥有者为同一个人,并且站点的每个网页上竟然都投放着Google AdSense广告!(写到这里,我再次打开这两个站点,却找不到AdSense广告了,因为站点被曝光后站长已经快速地撤走了所有广告,但之前的确是有的)可想而知这两个站点已经从Google手里赚走了多少广告费。

  那么到底这种超级Spam是怎样实现的呢?下面是大概的方法:

1.注册一个无意义的域名,域名由数字、字母及特定符号组成。注册多一些,比如100个;

2.用服务器把这些域名及相关的子域名管理起来。为域名建立尽可能多的子域名。当然,你需要一个足够强大的服务器,因为在接下来的几个星期里,它将要承受巨大的访问压力;

3.弄来尽可能多的文章数据库。不管你是采集还是用钱买的,尽量弄多一些,至于内容是什么并不重要。最好把这些数据库中的某些字符替换成相应的ASCII码,这样就不会被搜索引擎认为是重复的内容;

4.自己编写或购买一个特定的脚本。这个脚本的作用是用来返回不同关键词的相关结果,并且有效地让数据库的内容分配到不同的子域名里。这个脚本应该能应付所有的查询。并且在服务器里设置所有的子域名都自动转向域名主页,并且由这个脚本决定显示的内容。并且你还要为这些子域名创建无限多的子域名,比如abc.xyz.com,变成123.abc.xyz.com。这是为了欺骗Google,因为Google(或者MSN、Yahoo!等)都认为一个子域名是一个新站点。这一点是成功的关键,如果你自己没有这种能力,那么最好出钱叫别人做。由于某些原因,这里只写大概。

5.发动blog评论spam攻势。把你的子域名遍布尽可能多的blog或其它网站;

6.等待几个星期,你将会有惊喜。

  上面例子中的站点可谓超级垃圾站,并且Google没能成功地识别这是一种Spam行为,反而收录了它的几十亿个网页。相比国内的一些单纯通过采集数据而建立起的垃圾站而言,这两个站的站长就聪明得多了。但无论如何,这种行为都是应该要受到所有搜索引擎的惩罚才行,否则对于广大正规做站的站长而言,是极不公平的行为。同时这种行为也会极大地损害Google在用户心里的形象,破坏用户对Google的信赖感。

  我的估计是这两个站很快就会被Google处以极刑。当然,与Spam站点作斗争是所有搜索引擎共同面对的任务,这是一个漫长的过程。但作为普通用户,我们更希望的是包括Google在内的搜索引擎可以提高识别垃圾站的能力,净化搜索结果,提高准确度。

相关文章推荐

Android开发--身高体重指数(BIM)计算--查看线上内容(Uri)--打开网页--重构--使用Uri查看Google地图

/* (程序头部注释开始) * 程序的版权和版本声明部分 * Copyright (c) 2011, 烟台大学计算机学院学生 * All rights reserved. * 文件名称:查看...

网页模块拖动,Js仿Google和Windows Live的层拖拽

Js仿Google和Windows Live的拖拽,不但实现了网页模块的拖动,还可关闭、展开、收缩层窗口,自动排序,拖拽的时候自动吸附到落点上,自动把位置排列整齐

Google Map API使用详解(如何在自己的网页中嵌入地图)

Google Map API使用详解(十二)——如何在自己的网页中嵌入地图 要在自己的网页中嵌入地图,常用的方法可以归纳为以下几种: 1、  最简单的方法 ——使用谷歌地图主页的"链接" 如果...

网页上使用的输入法——Google Transliteration

简介 输入法通常是装在PC上用的,但是API有关部门的童鞋发现了专门在网页上用的输入法(见上图)。 这个插件的作用,按照官方说法: 您可以使用 Google 输入工具在网络中的任何位...

js利用google翻译接口把网页翻译成各国语言

js利用google翻译接口把网页翻译成各国语言 网页翻译为德语(Translate Page To German) 网页翻译为德语(Translate Page To German) ...

Android -关于注册Google Map Api Key 的方法和网页显示不全的问题

Android -关于注册Google Map Api Key  的方法和网页显示不全的问题   1.首先找到debug keystore路径: 打开Eclipse--->Windo...

类似google的可拖动div层网页布局,支持firefox,样式可自定义

近来还是比较流行这种应用,而且论坛的人问得也多,每次去查很麻烦,就转在这里,方便查找。原文地址在下面。   可能是我转载的那个转载的排版存在问题,不能直接运行。我进行了修改。现在的代码可以直接运行了。...

集锦——浏览器每次访问自动更新网页,不用手工设置,附Google/firefox/Ie

在做开发web开发的时候,经常要使用到浏览器来着进行调试,那么有时候自己修改了内容,可是在浏览器上还是没有显示出来,费了好久才发现是浏览器缓存的问题。还要强制刷新缓存 就是 Ctrl + F5 。所...

关于注册Google Map api key的方法和解决网页无法显示的问题

1.首先找到debug keystore路径: 打开Eclipse--->Windows--->Preferences--->Android--->Build 一般是这样的路径 C:\Us...
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:深度学习:神经网络中的前向传播和反向传播算法推导
举报原因:
原因补充:

(最多只允许输入30个字)