每个学习SEO的朋友都要按一定的套路出牌,要系统的循序渐进的学习,但是教程和书上的东西有些过于规整不好理解。而网络营销方法seo优化博客要给朋友们一步步的通俗的解读SEO学习的每个环节,本文的环节是百度搜索引擎工作原理流程。
一、搜索引擎工作原理基本分类
相信朋友们经常可以听人说做SEO就是让网站和蜘蛛谈恋爱,这形容的就是我们要让网站优化符合擎的胃口标准,让引擎喜欢上我们的网站,所以了解搜索引擎工作原理,就是去了解它喜欢什么。搜索引擎的工作原理,从大分类上看有两种:
第一种:全文搜索引擎,利用自动搜索软件获取网站连接及信息,然后按规则处理分析,这种自动软件被称为“网络机器人或网络蜘蛛”。(采用这种原理的有百度、谷歌等引擎,所以我们经常听说“百度蜘蛛(Baiduspider)”的名字)
第二种:分类目录搜索引擎,主要采取人工收集的方式来获取信息,然后按规则处理分析的搜索引擎工作原理。(采用人工分类目录搜索引擎工作原理的,例如新浪、搜狐等)
二、百度搜索引擎工作原理
不同的搜索引擎的喜好在细节上稍微会有些差别的,但是由是“**”的情况特殊在这里不做过多的解释了。所以,做太多的分析对比对于大多数想做SEO的朋友也并没有太多的帮助,因为就算了解了谷歌的原理,对于我们的实际工作操作意义和影响也并不是很大,如果以后有需要的话,我一定会第一时间的分享谷歌引擎的工作原理,下面还是言归正传 介绍一下百度搜索引擎的工作原理。
百度搜索引擎工作原理,大体上可以分为三大步骤:即,蜘蛛爬行抓取,数据处理索引,排序 。
第一步,百度派出蜘蛛在以有数据库出发,寻找新网站信息,同时跟踪访问网页上所有链接(这就是蜘蛛爬行),并回传信息到百度数据库中,这个过程将重复的进行。
第二步,百度会将这些蜘蛛抓取来的原始的网页数据,根据一定的规则进行分类索引。这些信息包括,网站程序类型、文字内容、更详细到文字字体、颜色等记录。做好这些记录以后,还要根据中文分词等技术、去判断网页的内容信息、关键词信息等判断网页内容是否有错别字,是否原创等处理,最终建立完善的索引数据库。
第三步,对索引数据库中的内容进行排序,也就是说分析判断用户在搜索某个词的时候,哪些网站信息,应该排在搜索结果的前边,哪些应该排在后边,然后按照一定的规则反回到用户搜索的页面的过程。
三、搜索引擎工作原理让我们明白了什么
让我们明白了,为什么百度会有“人工干预”。因为百度全文搜索引擎,虽然是软件自动完成搜索及数据采集,但这样的数据库信息量巨大,而且软件也并非百分百智能也会有信息不准确的情况。而分类目录形式,虽然是人工收集信息,信息数量上较小没有优势,但信息精准度高。最后,为了得到大信息量又得到精准的信息结果,所以, 百度就推出了“百度人工干预调整”一个本意很好,但经常做“坏”事的方式。
了解百度搜索引擎工作原理,还让很多SEO新手朋友明白了,为什么要做大量的外链的理由。因为蜘蛛来你网站就是靠链接来的,你的外链越多蜘蛛来的次数越多,对你的网页信任度也就越高,当然这里排除垃圾的外链。
搜索引擎基本工作原理
了解搜索引擎的工作原理对我们日常搜索应用和网站提交推广都会有很大帮助。
........................................................................................
■ 全文搜索引擎
在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立网页数据库的概念。搜索引擎的自动信息搜集功能分两种。一种是定期搜索,即每隔一段时间(比如Google一般是28天),搜索引擎主动派出“蜘蛛”程序,对一定IP地址范围内的互联网站进行检索,一旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库。
另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内(2天到数月不等)定向向你的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库,以备用户查询。由于近年来搜索引擎索引规则发生了很大变化,主动提交网址并不保证你的网站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接,让搜索引擎有更多机会找到你并自动将你的网站收录。
当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相符的网站,便采用特殊的算法——通常根据网页中关键词的匹配程度,出现的位置/频次,链接质量等——计算出各网页的相关度及排名等级,然后根据关联度高低,按顺序将这些网页链接返回给用户。
........................................................................................
■ 目录索引
与全文搜索引擎相比,目录索引有许多不同之处。
首先,搜索引擎属于自动网站检索,而目录索引则完全依赖手工操作。用户提交网站后,目录编辑人员会亲自浏览你的网站,然后根据一套自定的评判标准甚至编辑人员的主观印象,决定是否接纳你的网站。
其次,搜索引擎收录网站时,只要网站本身没有违反有关的规则,一般都能登录成功。而目录索引对网站的要求则高得多,有时即使登录多次也不一定成功。尤其象 Yahoo!这样的超级索引,登录更是困难。(由于登录Yahoo!的难度最大,而它又是商家网络营销必争之地,所以我们会在后面用专门的篇幅介绍登录 Yahoo雅虎的技巧)
此外,在登录搜索引擎时,我们一般不用考虑网站的分类问题,而登录目录索引时则必须将网站放在一个最合适的目录(Directory)。
最后,搜索引擎中各网站的有关信息都是从用户网页中自动提取的,所以用户的角度看,我们拥有更多的自主权;而目录索引则要求必须手工另外填写网站信息,而且还有各种各样的限制。更有甚者,如果工作人员认为你提交网站的目录、网站信息不合适,他可以随时对其进行调整,当然事先是不会和你商量的。
目录索引,顾名思义就是将网站分门别类地存放在相应的目录中,因此用户在查询信息时,可选择关键词搜索,也可按分类目录逐层查找。如以关键词搜索,返回的结果跟搜索引擎一样,也是根据信息关联程度排列网站,只不过其中人为因素要多一些。如果按分层目录查找,某一目录中网站的排名则是由标题字母的先后顺序决定(也有例外)。
目前,搜索引擎与目录索引有相互融合渗透的趋势。原来一些纯粹的全文搜索引擎现在也提供目录搜索,如Google就借用Open Directory目录提供分类查询。而象 Yahoo! 这些老牌目录索引则通过与Google等搜索引擎合作扩大搜索范围(注)。在默认搜索模式下,一些目录类搜索引擎首先返回的是自己目录中匹配的网站,如国内搜狐、新浪、网易等;而另外一些则默认的是网页搜索,如Yahoo。