论文: 搜索引擎排序技术研究
摘要
万维网是一个包含丰富资源的数据库,如何有效地从其中获取所需信息是网络数据挖掘的一个关键问题。从1990年开始,搜索引擎逐渐发展成为人们在互联网上搜索资源的主要方式。传统搜索引擎的工作机制基于关键字匹配,它们通常利用网页文本的内容和网络链接结构来判断网页与搜索串的相似程度。但随着越来越多的地方性资源和服务出现在因特网上,传统搜索引擎无法合理地处理包含位置信息的搜索串和返回令人满意的结果,其原因在于以下三点:(1)将地理位置当作普通关键字进行处理;(2)考虑的是网页在全球范围的受欢迎程度而不是在地方的流行度;(3)没有考虑网络资源的地理范围。因此,建立专门处理包含地理位置信息的搜索引擎是必需的。
搜索引擎优化(Seo)是网站采用对搜索引擎友好的技术手段,达到网站在搜索引擎中排名考前及收录数量增加。搜索引擎优化工作贯穿网站策划、建设、维护全过程的每个细节。
优化好的网站,从搜索引擎来的流量将会有很大的提高。
如今搜索引擎的技术越来越成熟,性能越来越好,可供选择的数量也越来越大,这更加促进了元搜索引擎的发展。
关键字:搜索引擎,关键字,排序,网络搜索,基于位置的搜索引擎
一、绪论
从1990年开始,搜索引擎逐渐发展成人们在互联网上搜索资源的主要方式,大多数搜索引擎通过基于关键字(Keyword-based)的搜索方式来获取相关网页。据估计每天大约有上亿条搜索串被提交给搜索引擎进行处理。以Google为例,Sullivan在2010年的调查显示Google每天大约需要处理超过9100万次搜索。
对用户来说搜索引擎最大的两个特点就是高召回率和低精确性。虽然搜索引擎能够覆盖相当大一部分网络资源,但缺乏有效的手段来对结果进行排序并呈现在用户面前。搜索串通常并不会很长,根据Spink Jansen 在2004年所做的调查平均长度只有2.4个单词,但搜索引擎却返回了过多的结果。工业界和学术界都提出了许多不同的索引和排序模型,试图只找出最相关的文档并以恰当的方式排序,但结果任然不尽如人意。根据Sullivan在2000年的报告,44%的用户觉得搜索结果并不理想。显然我们需要改进现有的技术来更有效地索引和表现网络资源。
此外,对于搜索引擎的用户来说,不同的人也有着不同的兴趣和需要。这些需要可能包括商业,娱乐,科学或交流等方面。因此,在网络上开始出现一些专用的搜索引擎,它们通常被用来搜索特定的网络资源,比如图片、音乐和电影等。
基于位置的搜索引擎(也称作地理搜索引擎)就是一种专用搜索引擎,近来已经受到了学术界和工业界的广泛关注。从本质上,互联网发展并开始流行就是因为它能够跨越地域的限制获取资源。但是网络上的许多服务和设施都涉及到具体的位置,比如人们可以从网络上搜索位于特定区域的饭店、宾馆和公共设施等。通过基于位置的搜索引擎,用户得到的结果都是与地理位置相关并按照地理位置来排序的。然而对于一般的搜索引擎来说,其基于关键字的检索方式在面对与位置相关的搜索时表现得十分不尽如人意,举例来说,对于“山西 宾馆”这样一个搜索串,我们的目的是找到位于山西省的宾馆,但我们却有可能得到一些不相关的结果,比如搜索引擎并没有考虑到网络资源的地理范围等。因此,面对与位置相关的搜索,建立专门的地理搜索引擎是必须的。
二、研究的目的和意义
(一)搜索引擎排序的重要性
(1)搜索引擎排序的概念:
搜索引擎(search engine)是指根据一定的策略、运用特定的计算机程序从互联网上搜集信息,在对信息进行组织和处理后,为用户提供检索服务,将用户检索相关的信息展示给用户的系统。
例如:Baidu,Google,Yahoo等搜索引擎
搜索引擎并不是真正的搜索整个互联网,它搜索的其实是已经预先整理好的网页索引数据库。也就是说,真正意义上的搜索引擎的实际上是,搜集了互联网几千万至几十亿的网页并对网页中的关键词进行索引,建立索引数据库的全文搜索引擎。当我们要查询某个关键字的时候,所有页面包含该关键字网页都会搜索出来,然后经过一定的算法进行排序,这些结果将按照与搜索关键词的相关度高低,依次排序,然后返回给用户。
(2)影响搜索引擎排序的因素:
要了解影响网页搜索引擎排名的要素,首先需要了解过滤、排名以及排名算法。
过滤:对每个搜索请求,搜索引擎决定将那些网页列传结果列表中,如果网页达到过滤标准,它就会被放到列表里。
排名:对每个搜索请求,搜索引擎根据相关程度对搜索结果排序,决定哪些网页显示在列表的顶端,网页内容越好,和搜索请求匹配,排名越高。
排名算法是搜索引擎所使用的算术公式,被用来根据搜索请求的内容给网页打分,来看哪个网页是最匹配的。如果你的网页根据排名算法的要素得到最高分,那么它就会在结果中得到第一。
影响网页搜索引擎排名的重要要素:
1.关键词突出程度(Keywordproximity)
所有的关键词在一个网页上不会有相等的重要性,在标题和文章标题的词比在文章段落中的词更重要。关键词也通过他们的位置显示价值,例如,出现在文章开始的地方通常比在稍后出现的要重要。
2.关键字密度(Keyworddensity)
关键字出现在网页上所有词中的百分比,就是关键字密度。搜索引擎通常认为有2—7%关键字密度的网页是很高质量的网页。更高关键字密度的网页会被怀疑作弊。
3.搜索请求意图
搜索引擎努力将搜索者意图与能满足这些意图的网页想匹配。例如,一个对“喷枪洗碗机手册”的搜索请求可能会返回PDF产品手册或者一个有这些手册链接的网页。搜索引擎总是在寻找新的方式来提高对搜索意图的识别和满足,因此你的内容越能够精确地显示网页的目的,你就越有优势。
4.关键词稀有程度
当搜索请求含有不只一个关键字的时候,搜索引擎想要知道哪个词对整个网站是最重要的,因为这样可以帮助搜索引擎找到最重要的网页。比如搜索请求“上海的酒店”,其中“的”出现在大多数网页,因为它不会帮助搜索引擎对搜索请求选择最好的网页,因为包含“的”的网页和没有包含“的”的网页可能都是对搜索请求匹配的网页。搜索引擎通常会使用一套公式换算,来得知对搜索请求中最稀少的关键词在哪个网页有最高的密度。
5.关键词接近程度
最好的网页包含搜索请求中所有的关键词,而且这些关键词彼此紧密相连,次序都和搜索请求中是一样的。因此在搜索“上海的酒店”时,含有“上海的酒店”的网页可能是最好的。但是搜索引擎应用了更多的评判手段,因为“的”太常见了,包含“上海酒店”的网页可能和有“上海的酒店”的网页一样好,其他没有包含这种常见词的搜索请求可能强调词的顺序,在所有的情况下,让所有关键词彼此接近是一件好事,——当然比一个很多分隔的“上海”和“酒店”的网页要好。
6.链接流行度Linkpopularity:也叫“链接广度”、“链接流行度”,是指搜索引擎对指向一个网页链接的数量和质量的衡量尺度。
链接流行度对于网站排名有非常重要的作用。搜索引擎评估网页的链接流行度有四种基本方法:
(1)链接数量
(2)链接质量
(3)锚定文本
(4)链接相关性
搜索引擎认为高搜索排名要素的是那些拥有很多高质量链接的网页,这些链接既来自于很多内容相关的站点,同时在锚定文本中还含有搜索请求关键词。
7.声望数据:搜索引擎会记忆一些关于某个词的哪些网页被更多人浏览,它会认为这个网页很重要可能是搜索者所想找寻的,搜索引擎会对这样的网页在排名上给予一些照顾。
8.域名的年龄。在最近几年SEO领域的研究中,人们发现较新的域名排名上升难度比旧的域名更大。目前,这种现象只在Google中发现。关于这种现象你可以在Google沙盒效应(Sandbox)一文中了解到更详细的内容。
9.URL长度和深度:如果动态网页带有2个以上的参数会使搜索蜘蛛躲避这样的URL以避免进入死循环,所以尽量使URL尽量离根目录近些。
10.网页的新鲜程度。如果你的网页中很长时间内容没有变化,其排名可能被降低,因为搜索引擎会怀疑内容是过时的。
11.网页风格:看网页跟看文章一样,希望看到清晰的易读的样式,分标题,段落标题等,这方面迎合了浏览者同时也就迎合了搜索引擎。还有就是网页编码问题也是很多网站常出现的,确定HTML编码没有遗漏,这里大家要知道HTML的标准是尽量正确的显示,就是说即使有编码错误它也尽量将内容显示出来,但这个时候搜索引擎却不会这样。
12.站点的组织形式:包括网站的架构,目录的分布,清晰明了的形式能够加强网页的要素。
(3)搜索引擎给网站带来的访问量:
要了解搜索引擎首先要了解他的工作原理。
a)、抓取网页
每个独立的搜索引擎都有自己的网页抓取程序(spider)。Spider顺着网页中的超链接,连续地抓取网页。被抓取的网页被称之为网页快照。由于互联网中超链接的应用很普遍,理论上,从一定范围的网页出发,就能搜集到绝大多数的网页。
b)、处理网页
搜索引擎抓到网页后,还要做大量的预处理工作,才能提供检索服务。其中,最重要的就是提取关键词,建立索引文件。其他还包括去除重复网页、分词(中文)、判断网页类型、分析超链接、计算网页的重要度/丰富度等。
c)、提供检索服务
用户输入关键词进行检索,搜索引擎从索引数据库中找到匹配该关键词的网页;为了用户便于判断,除了网页标题和URL外,还会提供一段来自网页的摘要以及其他信息。
当用户通过搜索引擎搜索自己想要查找的内容时,搜索引擎会根据查找的关键词匹配出来的搜索结果呈现给用户,如果你的网站匹配度比较高那么你就有可能被用户点击,这样就会给你网站带来流量。
(4)当前搜索引擎在网站中起到举足轻重的作用:
76%的互联网用户在2004年1月至少通过一次搜索,这意味着1.14亿互联网用户访问了搜索站点。多达64%的互联网用户首先选择使用搜索引擎来查找信息,百分之59的中国人选择每天都使用搜索。有seo公司调查表明,至少有70% - 90%的用户是通过搜索引擎访问你的网站的。经调查网站90%以上的流量来自搜索引擎,对于一个无名网站怎么脱颖而出呢?如果你的商业网站,业务全是线上业务,那么你网站的如何获得流量呢?很多方法,但是利用搜索引擎可能是最经济,有效的方法。现在网站越来越多,越来越多的网站开始重视搜索引擎的作用。如果没有搜索引擎,我们就不能像现在这样轻松地找到某些信息,如果没有搜索引擎,我们上网的乐趣可能会大为减少,甚至也不再有“时代精神”
(二)分析当前搜索引擎排序的不足
搜索引擎在信息检索方面存在的许多不足主要表现在:①查全率比较低。每个引擎的覆盖面都相当有限,据统计,没有一个搜索引擎的索引量超过整个网络网页总数的1/6。由此可见,每个搜索引擎虽然相对查全率比较高,而实际查全率则比较低。②查准率比较低。目前通过搜索引擎检索的网络信息资源相关性非常差,浪费了用户大量的相关判断时间。③每一个搜索引擎都有自己的检索规则,用户利用不同的搜索引擎需要进行不同的适应过程,增加了用户的负担。④多数搜索引擎采用关键词检索,并提供高级检索功能,但用户很难通过组配关键词来准确表达自己的信息需求,导致检索效率低下。⑤更新速度比较慢。搜索引擎机器人只能在由系统管理员确定的一定时间间隔内跟踪特定信息,不能保证信息的及时更新,导致产生错链和死链。随着网络信息数量的指数增长,引擎数据库急剧膨胀,检索速度也将会变慢。为了解决单个搜索引擎信息覆盖面小,信息收集量有限,用户需要对不同搜索引擎进行适应的缺点,人们提出了元搜索引擎的概念。
三、展望
本文所关注的排序实际上涉及了基于位置的搜索引擎的多个方面,包括位置名语义模糊性的消除、网页中地理位置的抽取、地理范围的计算等,这些方面的深入研究将有利于进一步提高排序的精确度。此外,本文将关注焦点放在排序的精确度上,并没有考虑到系统的运行时间和效率。因此本文未来的工作主要有以下几个方面:
(1)更智能地识别出网页中的地理位置,并对它们做出精确的辨析。比如可以采用机器学习与地名词典相结合的方式。
(2)设计地理信息完备并且结构良好的地名词典。地名词典对基于位置的搜索引擎是必需的,它需要尽可能详细的信息比如地名缩写、别名等,还需要具有合理的结构以方便信息读取和维护。
(3)网页的直接入链资源相对较少,需要更加合理地利用这些有限的资源并挖掘间接入链资源。
(4)提高搜索串的执行效率,并把结果以一种合理的方式展现给用户。
四、结论
随着越来越多的地方性资源和服务出现在因特网上,基于位置的网络搜索开始变得越来越流行。传统搜索引擎的工作机制基于关键字匹配,它们通常利用网页文本的内容和网络链接结构来判断网页与搜索串的相似程度。虽然传统搜索引擎在处理一般搜索串时显示出了比较好的效果,但由于它们把搜索串中的和网页中的地理位置当作普通关键字进行处理,并且由于它们考虑的是网页在全球范围内的重要程度,所以它们并不能很合理地处理包含地理位置信息的搜索串。因此,建立专门处理包含地理位置信息的搜索引擎是必需的。
与传统搜索引擎不同的是,基于位置的搜索引擎需要将地理位置信息与普通的关键字区分开,并给那些地方性的重要网页以更高的排名。因此,本文提出了以地方流行度(Local Popularity)来对网页进行排序和以入链的数量和质量来衡量地方流行度的思想,并给出了一个基于地方流行度的排序模型LPRM。
中小型网站,80-90甚至以上的流量来自搜索引擎。通过分析搜索引擎对网站,以及用户的重要性研究如何在搜索引擎获得更多的流量,获得更好的排名,根据搜索引擎的权重,对网站结构、关键字选择、网站内容规划进行调整和优化,从而提高网站在百度、Google、Yahoo!等搜索结果中的自然排名和网页收录数量。开始成为网络营销的基础。
对当前搜索引擎排序存在的各个不足的分析每个引擎的覆盖面都相当有限,据统计,没有一个搜索引擎的索引量超过整个网络网页总数的1/6。随着网络信息数量的指数增长,引擎数据库急剧膨胀,检索速度也将会变慢。为了解决单个搜索引擎信息覆盖面小,信息收集量有限,用户就需要对不同搜索引擎进行适应的调整。
五、参考文献:
[1](美)利布 《SEO必知必会51技》 人民邮电出版社 2010-6-1
[2](美)欧朝晖 《SEO智慧 》 电子工业出版社 2009-6-1
[3](美)莱特福特 《搜索引擎优化宝典》 清华大学出版社 2010-6-1
[4] 温世豪 《疯狂的站长》 清华大学出版社 2010-5-1)
[5] 昝辉 《SEO实战密码》 电子工业出版社2011-1