欢迎来到天天文库
浏览记录
ID:43724124
大小:185.90 KB
页数:67页
时间:2019-10-13
《【精品】SEO优化《大型超文本网络搜索引擎的剖析》》由会员上传分享,免费在线阅读,更多相关内容在工程资料-天天文库。
1、本文是谷歌创始人Sergey和Larry在斯坦福大学计算机系读博士时的一篇论文。发表于1997年。在网络中并没有完整的中文译本,现将原文和本人翻译的寥寥儿句和网络收集的片段(网友xfygx和雷声大雨点大的无私贡献)整理和综合到一起,翻译时借助了translate.google.com,因为是技术性的论文,文中有人量的合成的术语和较长的句了,有些进行了意译而非直译。作为Google辉煌的起始,这篇文章非常有纪念价值,但是文中提到的内容因年代久远,已经和时下最新的技术有了不少差异。但是文中的思想还是有很多借鉴价值。因本人水平有限,对文屮内容可能会佇理解不当之处,请您查阅英文原版。
2、大规模的超文本网页搜索引擎的分析SergeyBrinandLawrencePageComputerScienceDepartmentStanfordUniversity,Stanford,CA94305sergeyds・stanford・eduandpage@s.stanford・edu摘要在本文中我们讨论Google,一个充分利用超文本文件结构进行搜索的人规模搜索引擎的原型oGoogle可以有效地对网络资源进行爬行搜索和索引,比目前已经存在的系统有更令人满意的搜索结果。该原型的数据库包括2400JJ页面的全文和Z间的链接,可通过h(tp://google.Stanford,
3、edu/访问。设计一个搜索引擎是一种具挑战性的任务。搜索引擎索索引数以亿计的不同类型的网页并每天给出过千万的杳询的答案。尽管大型搜索引擎对于网站非常重要,但是已完成的、对于大型搜索引擎的学术上的研究却很少。此外,山于技术上的突飞猛进和网页的急剧增加,在当前,创建-个搜索引擎和三年前□不可同日而语。本文提供了一种深入的描述,与Web增殖快速进展今日创建视b搜索引擎是三年前很大不同。本文提供了到目前为止,对于我们大型的网页所搜引擎的深入的描述,这是笫一个这样详细的公共描述。除了如何把传统的搜索技术扩展到前所未有的海量数据,还有新的技术挑战涉及到了使用超文本中存在的其他附加信息产生
4、更好的搜索结果。本文解决这样一个问题,如何建立一个可以利用超文木屮存在的其他附加信息的实用的大型系统,同时我们也研究一下如何有效处理任何人都能发布他们想发布的包含任何信息的人量口由链接的问题。关键字:互联网,搜索引擎,文献检索,PageRank,Google1•简介(注:本文由两个版本…较长的完整版本和一个较短的印刷的版本。完整版本提供在网络上和会议的CD-ROM上)。Web给信息检索带来了新的挑战。\eb上的信息量快速增长,同时不断冇毫无经验的新用户来体验Web这门艺术。人们喜欢用超级链接来网上冲浪,通常都以象Yahoo这样重要的网页或搜索引擎开始。人工维护的网站列表能有
5、效的覆盖受欢迎的流行的站点,但是它具有主观性,建立和维护的代价高,升级慢,不能包括所有深奥的主题。基于关键词的自动搜索引擎通常返回太多的低质量的匹配。使问题更遭的是,一些广告为了赢得人们的关注想方设法误导自动搜索引擎。我们建立了一个大型搜索引擎解决了现有系统中的很多问题。应用超文本结构,提供高质量的查询结果,我们的系统命名为google,取名自googol的通俗拼法,即io的loo次方,这和我们的H标建立一个大型搜索引擎较好的符合。1.1网络搜索引擎一升级换代:1994-2000搜索引擎技术不得不快速升级跟上成倍增长的网站数So1994年,第一个Wb搜索引擎,WorIdWde
6、WebWorm(WWW)拥有110,()00个网页和网站可访问文档的索引。到1994年11月,顶级的搜索引挚声称可以检索到2力(WebCraw)er)100力个网络文件(来自搜索引擎监视)。可以预见到2000年,可检索到的网页将超过1()亿。同时,搜索引擎的访问量也会以惊人的速度增长。在1997年的三四刀份,Wor1d制deWebWorm平均每天收到1500个查询。在1997年11月,Altavista声称它每天要处理大约20'而力个查询。随着网络用户的增长,可以预见到到2000年,自动搜索引擎每天将处理上亿个查询。我们系统的设计冃标要解决许多问题,包括质量和可升级性,引入升
7、级搜索引擎技术,把它升级到如此人量的数据上。I.2Google:升级与网络建立一个能够和当今web规模相适应的搜索引擎会面临许多挑战。抓网页技术必须足够快并且保持是最新的版本。存储空间必须高效的存储索引和文档。索引系统必须能够高效地处理上百亿GB的数据。处理查询必须快,达到每秒能处理成百上千个查询□随看毗b的不断增长,这些任务变得越来越艰巨。然而硬件的性能和成本也在快速增长,可以部分抵消这些困难。然而,还有几个值得例外,如磁盘的寻道时间,操作系统的效率。在设计Google的过程中,我们既考虑了网络的增长
此文档下载收益归作者所有