搜索引擎概述(一)

作者:孟雅婷
日期:2013/10/17 8:32:08

  搜索引擎是利用网络自动搜索技术软件或人工方式,对互联网上的信息资源进行收集、整理与组织,并提供检索服务的信息服务系统。它包括信息搜集、信息整理和用户查询三部分。随着网络技术的发展,各种搜索引擎层出不穷。

  一、搜索引擎的种类与特点

  按照工作原理的不同,可以把搜索引擎分为四个类别:全文搜索引擎、分类目录、元搜索引擎和垂直搜索引擎。

 (一)全文搜索引擎

  纯技术型的全文检索搜索引擎是依靠一个叫网络机器人或叫网络蜘蛛的软件,通过网络上的各种链接从网站自动提取信息并按一定的规则分析整理形成网页数据库供用户查询。搜索引擎的自动信息搜集功能分两种。一种是定期搜索,即每隔一段时间(比如Google一般是28天),搜索引擎主动派出“网络机器人”或“网络蜘蛛”程序,对一定IP地址范围内的网站进行检索,并沿着网络上的链接从一个网页到另一个网页,从一个网站到另一个网站采集网页资料。它为保证采集的资料最新,还会回访已抓取过的网页。一旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库。网络机器人或网络蜘蛛采集的网页,还要有其他程序进行分析,根据一定的相关度算法进行大量的计算建立网页索引,才能添加到索引数据库中。我们平时看到的全文搜索引擎,实际上只是一个搜索引擎系统的检索界面,当你输入关键词进进查询时,搜索引擎会从庞大的数据库中找到符合该关键词的所有相关网页的索引,并按一定的排名规则呈现给我们。不同的搜索引擎,网页索引数据库不同,排名规则也不尽相同,所以,当我们以同一关键词用不同的搜索引擎查询时,搜索结果也就不尽相同。

  另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内定向向你的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库,以备用户查询。由于近年来搜索引擎索引规则发生了很大变化,主动提交网址并不保证你的网站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接,让搜索引擎有更多机会找到并自动将你的网站收录。

  当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相符的网站,便采用特殊的算法——通常根据网页中关键词的匹配程度、出现的位置/频次、链接质量等——计算出各网页的相关度及排名等级,然后根据关联度高低,按顺序将这些网页链接返回给用户。Google、百度都是比较典型的全文搜索引擎系统。

分享