搜索引擎基本工作原理(转自:http://www.se-express.com/about/about2.htm)

转载 2007年09月11日 20:44:00

搜索引擎基本工作原理

了解搜索引擎的工作原理对我们日常搜索应用和网站提交推广都会有很大帮助。

........................................................................................

 ■ 全文搜索引擎

  在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立网页数据库的概念。搜索引擎的自动信息搜集功能分两种。一种是定期搜索,即每隔一段时间(比如Google一般是28天),搜索引擎主动派出“蜘蛛”程序,对一定IP地址范围内的互联网站进行检索,一旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库。

  另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内(2天到数月不等)定向向你的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库,以备用户查询。由于近年来搜索引擎索引规则发生了很大变化,主动提交网址并不保证你的网站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接,让搜索引擎有更多机会找到你并自动将你的网站收录。

  当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相符的网站,便采用特殊的算法——通常根据网页中关键词的匹配程度,出现的位置/频次,链接质量等——计算出各网页的相关度及排名等级,然后根据关联度高低,按顺序将这些网页链接返回给用户。

........................................................................................

 ■ 目录索引

  与全文搜索引擎相比,目录索引有许多不同之处。

  首先,搜索引擎属于自动网站检索,而目录索引则完全依赖手工操作。用户提交网站后,目录编辑人员会亲自浏览你的网站,然后根据一套自定的评判标准甚至编辑人员的主观印象,决定是否接纳你的网站。

  其次,搜索引擎收录网站时,只要网站本身没有违反有关的规则,一般都能登录成功。而目录索引对网站的要求则高得多,有时即使登录多次也不一定成功。尤其象Yahoo!这样的超级索引,登录更是困难。(由于登录Yahoo!的难度最大,而它又是商家网络营销必争之地,所以我们会在后面用专门的篇幅介绍登录Yahoo雅虎的技巧

  此外,在登录搜索引擎时,我们一般不用考虑网站的分类问题,而登录目录索引时则必须将网站放在一个最合适的目录(Directory)。

  最后,搜索引擎中各网站的有关信息都是从用户网页中自动提取的,所以用户的角度看,我们拥有更多的自主权;而目录索引则要求必须手工另外填写网站信息,而且还有各种各样的限制。更有甚者,如果工作人员认为你提交网站的目录、网站信息不合适,他可以随时对其进行调整,当然事先是不会和你商量的。

  目录索引,顾名思义就是将网站分门别类地存放在相应的目录中,因此用户在查询信息时,可选择关键词搜索,也可按分类目录逐层查找。如以关键词搜索,返回的结果跟搜索引擎一样,也是根据信息关联程度排列网站,只不过其中人为因素要多一些。如果按分层目录查找,某一目录中网站的排名则是由标题字母的先后顺序决定(也有例外)。

  目前,搜索引擎与目录索引有相互融合渗透的趋势。原来一些纯粹的全文搜索引擎现在也提供目录搜索,如Google就借用Open Directory目录提供分类查询。而象 Yahoo! 这些老牌目录索引则通过与Google等搜索引擎合作扩大搜索范围(注)。在默认搜索模式下,一些目录类搜索引擎首先返回的是自己目录中匹配的网站,如国内搜狐、新浪、网易等;而另外一些则默认的是网页搜索,如Yahoo。

  (注):Yahoo已于2004年2月正式推出自己的全文搜索引擎,并结束了与Google的合作。

 

相关文章推荐

Hadoop的那些事儿(转自:http://www.searchtb.com/2010/11/talk-about-hadoop.html)

在说Hadoop之前,作为一个铁杆粉丝先粉一下Google。Google的伟大之处不仅在于它建立了一个强悍的搜索引擎,它还创造了几项革命性的技术:GFS,MapReduce,BigTable,即所谓的...
  • lslxdx
  • lslxdx
  • 2011年09月29日 22:36
  • 401

浏览器的工作原理:新式网络浏览器幕后揭秘(http://www.kuqin.com/web/20121209/333935.html)

序言 这是一篇全面介绍 Webkit 和 Gecko 内部操作的入门文章,是以色列开发人员塔利·加希尔大量研究的成果。在过去的几年中,她查阅了所有公开发布的关于浏览器内部机制的数据(请参见资源)...
  • Nomius
  • Nomius
  • 2015年02月03日 13:45
  • 920

揭开正则表达式的神秘面纱(转自:http://www.regexlab.com/zh/regref.htm)

引言    正则表达式(regular expression)就是用一个“字符串”来描述一个特征,然后去验证另一个“字符串”是否符合这个特征。比如 表达式“ab+” 描述的特征是“一个 a 和 任意个...
  • lslxdx
  • lslxdx
  • 2011年06月16日 22:15
  • 422

字符,字节和编码转自http://www.regexlab.com/zh/encoding.htm]

摘要:本文介绍了字符与编码的发展过程,相关概念的正确理解。举例说明了一些实际应用中,编码的实现方法。然后,本文讲述了通常对字符与编码的几种误解,由于这些误解而导致乱码产生的原因,以及消除乱码的办法。本...

ubuntu中xen-tools安装半虚拟化的虚拟机(转自http://www.linuxidc.com/Linux/2012-04/58209.htm)

Ubuntu 11.10中可以通过apt-get安装xen-tools,其版本为4.1版本: # apt-get install -y xen-tools 由于xen-tools是xen的半虚拟化...

.net C# 反射技术使用例子(转自:http://www.programbbs.com/doc/5740.htm)

获得实例的方法1.获得同一程序集内的类型的实例。 无参数构造函数Type t = Type.GetType("AppCode.Employe");if (t == null){textBox1.Tex...
  • lslxdx
  • lslxdx
  • 2011年05月06日 18:44
  • 545

Centos6.5 mysql 5.7 主从复制 转自其他博主(http://www.linuxidc.com/Linux/2016-11/136899.htm)

主从同步是分布式mysql数据库相当重要的配置,现在我在虚拟机上完成主从配置,系统是CentOS6.5,mysql版本是5.7.13 主服务器的ip是192.168.19.139 副服务器的ip是1...

委托模式(转自:http://www.uml.org.cn/j2ee/200411036.htm)

委托模式透明 选择自 www.c-view.org 梗概委托是对一个类的功能进行扩展和复用的方法。它的做法是:写一个附加的类提供附加的功能,并使用原来的类的实例提供原有的功能。 场景扩展和复用一个类的...

python字符串连接的N种方式(转自http://www.jb51.net/article/55301.htm;http://www.cnblogs.com/huangcong/)

最原始的字符串连接方式:str1 + str2 python 新字符串连接语法:str1, str2 奇怪的字符串方式:str1 str2 % 连接字符串:‘name:%s; sex: ' % ('t...

浏览器与HTTP网络协议缓存原理分析 转自网界网:http://news.cnw.com.cn/news-china/htm2015/20151027_322909.shtml

浏览器缓存原理 文字版描述 ①浏览器第一次访问服务器资源 /index.html 在浏览器中没有缓存文件,直接向服务器发送请求。 服务器返回 200 OK,实体中返回 inde...
  • n8765
  • n8765
  • 2015年10月28日 15:28
  • 910
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:搜索引擎基本工作原理(转自:http://www.se-express.com/about/about2.htm)
举报原因:
原因补充:

(最多只允许输入30个字)