跟上 Web的步伐(Scaling with the Web)建立一个能够和当今web规模相适应的搜索引擎会面临许多挑战。抓网页技术必须足够快,才能跟上网页变化的速度(keep them up to date)。存储索引和文档的空间必须足够大。索引系统必须能够有效地处理上千亿的数据。处理查询必须快,达到每秒能处理成百上千个查询(hundreds to
thousands per second.)。随着Web的不断增长,这些任务变得越来越艰巨。然而硬件的执行效率和成本也在快速增长,可以部分抵消这些困难。 还有几个值得注意的因素,如磁盘的寻道时间(disk seek time),操作系统的效率(operating system robustness)。在设计Google的过程中,我们既考虑了Web的增长速度,又考虑了技术的更新。Google的设计能够很好的升级处理海量数据集。它能够有效地利用存储空间来存储索引。优化的数据结构能够快速有效地存取(参考4.2节)。进一步,我们希望,相对于所抓取的文本文件和HTML网页的数量而言,存储和建立索引的代价尽可能的小(参考附录B)。对于象Google这样的集中式系统,采取这些措施得到了令人满意的系统可升级性(scaling properties)。
1. 3设计目标
1.3.1 提高搜索质量。我们的主要目标是提高Web搜索引擎的质量。 1994 年,有人认为建立全搜索索引(a complete search index)可以使查找任何数据都变得容易。根据Best of the Web 1994 — Navigators ,“最好的导航服务可以使在Web上搜索任何信息都很容易(当时所有的数据都可以被登录)”。然而1997年的Web就迥然不同。近来搜索引擎的用户已经证实索引的完整性不是评价搜索质量的唯一标准。用户感兴趣的搜索结果往往湮没在“垃圾结果Junk result”中。实际上,到1997年11月为止,四大商业搜索引擎中只有一个能够找到它自己(搜索自己名字时返回的前十个结果中有它自己)。导致这一问题的主要原因是文档的索引数目增加了好几个数量级,但是用户能够看的文档数却没有增加。用户仍然只希望看前面几十个搜索结果。因此,当集合增大时,我们就需要工具使结果精确(在返回的前几十个结果中,有关文档的数量)。由于是从成千上万个有点相关的文档中选出几十个,实际上,相关的概念就是指最好的文档。高精确非常重要,甚至以响应(系统能够返回的有关文档的总数)为代价。令人高兴的是利用超文本链接提供的信息有助于改进搜索和其它应用。尤其是链接结构和链接文本,为相关性的判断和高质量的过滤提供了大量的信息。Google既利用了链接结构又用到了anchor文本(见2.1和2.2节)。
1.3.2 搜索引擎的学术研究随着时间的流逝,除了发展迅速,Web越来越商业化。 1993 年,只有1.5%的Web服务是来自.com域名。到1997年,超过了60%。同时,搜索引擎从学术领域走进商业。到现在大多数搜索引擎被公司所有,很少技公开术细节。这就导致搜索引擎技术很大程度上仍然是暗箱操作,并倾向做广告(见附录A)。Google的主要目标是推动学术领域在此方面的发展,和对它的了解。另一个设计目标是给大家一个实用的系统。应用对我们来说非常重要,因为现代网络系统中存在大量的有用数据(us because we think some of the most interesting research will involve
leveraging the vast amount of usage data that is available from modern web systems)。例如,每天有几千万个研究。然而,得到这些数据却非常困难,主要因为它们没有商业价值。我们最后的设计目标是建立一个体系结构能够支持新的关于海量Web数据的研究。为了支持新研究,Google以压缩的形式保存了实际所抓到的文档。设计Google 的目标之一就是要建立一个环境使其他研究者能够很快进入这个领域,处理海量Web数据,得到满意的结果,而通过其它方法却很难得到结果。系统在短时间内被建立起来,已经有几篇论文用到了Google建的数据库,更多的在起步中。我们的另一个目标是建立一个宇宙空间实验室似的环境,在这里研究者甚至学生都可以对我们的海量Web数据设计或做一些实验。
2/ 14
如 何建立一个可以深度挖掘利用超文本中信息的大规模搜索引擎?这是本文提出的...第一,Google 利用网络的链接结构来计算 每一个 Web 页面的排名。这种排名叫做 ...
超文本和Web技术 82页 免费 大规模Web超文本搜索引擎架... 14页 5财富值 ...7.1.1超文本与超媒体的概念人类的记忆是一种具有网状结构的联想式的记忆,具有...
摘要在本文中,我们将介绍 Google,一个充分利用超文本文件(译者:即 HTML 文件)结构进行搜索 的大规模搜索引擎的原型. Google 可以有 效地对互联网 (Web) 资源...
3,安全性 互联网搜索引擎的数据来源都是互联网上公开的信息,而且除了文本正文...(http://search.yahoo.com) ,AllTheWeb (http://www.alltheweb.com ) 等...
所以标准信息检索系统统计管理包含着文本下载量 管理、收支费控管理、点击率...二、web检索的架构:Web搜索引擎是Internet上非常有用的信息检索工具, 但是由于...
信息采集 ?索引技术 ?搜索服务 体系结构:信息采集 Web搜索引擎的信息采集模块 主要功能:Web上收集页面信息,即Web机器人 (爬虫)程序 基于超文本传输协议(Hypertext ...
大规模中文搜索引擎的架构和设计技术_计算机软件及应用_IT/计算机_专业资料。计...、 α , 。 图< 索 引体 系结 构图 , 我们结合了文本 自动 分类的技术...
超文本的文献模型侧重于超文本的基本特征和一般的层次性 结构的描述。(主结构和... 89页 2下载券 大规模Web超文本搜索引擎... 14页 2下载券喜欢此文档的还...
和文本中的词进行排序输出 Beihang 《信息检索原理》课程 16 8 Web搜索引擎系统...大规模的Web数据采集系统是分布式的结构,用 网络连接起多个采集器,它们之间用...
超文本标记语言与WEB程序设计 WEB WEB系统结构 WEB系统结构 www.ncepu.edu.cn ...同时使得数据搜索引擎可以简单 高效的运行; XML还具有遵循严格的语法要求、便于不...

我要评论