曾经测试过一个叫做Inktomi的搜索引擎,这个引擎是在授予莫特万尼学位的加州大学伯克利分校开发的。他输入“Inktomi”,试试看会发生什么。结果,莫特万尼说:“它不在搜索范围,它找不到它自己。”
同时,斯坦福的博士学位申请人杨致远和大卫·费罗(David Filo)采取了一种截然不同的搜索方式。他们的工作并不仅仅依赖于技术,他们雇用了一些编辑,按字母顺序为网页目录进行排序,并从中选取网站。他们给自己的公司起名雅虎。尽管他们的办法可以帮助网络用户容易地找到有价值的信息,但信息还不够完整,而且也跟不上网络不断膨胀的步伐。布林和莫特万尼还试用了其他网页目录和搜索引擎,但是,没有哪一个可以完成这个工作。恰恰相反,一个简简单单的搜索指令会带来一长串毫不相干的结果。他们必须花几个小时人工过滤一张张网页,来找出自己想找的信息。布林和莫特万尼确信,开发出新的办法来进行搜索迫在眉睫。
与此同时,佩奇曾经花了一些时间来参加数字图书馆项目。他也开始用一种叫做AltaVista的搜索引擎来搜索网络。它反馈结果的速度要快一些,而且也比其他工具的结果更优化。但是,佩奇意识到一个全新的问题。在提供网站列表的同时,AltaVista的搜索结果还提供一种看起来无关紧要的关于“链接”的信息。链接造就了网络的活力,当计算机用户想要了解更多信息的时候,他们会找到这些突出显示的文字或者短句,点击这些链接,然后访问其指向的另外一张网页。佩奇关注的不是AltaVista提供的主要搜索结果,而是思考如何能够通过分析这些链接来收取被漏掉的果实。
书 包 网 txt小说上传分享
独特的PageRank技术(3)
佩奇的指导教师之一,赫克托 · 加西亚…莫利纳(Hector Garcia…Molina)同意他的看法,认为研究链接具有潜在的价值。看起来,AltaVista并没有对这些链接进行任何的处理,而只是把它们按原始的模样显示出来。佩奇希望深入地挖掘这些链接,研究如何更进一步地利用它们。不过,为了检验自己的理论,佩奇需要一个庞大的数据库。佩奇从来不缺乏野心,他经过简单的计算,就告诉其斯坦福大学的指导教师,他要把整个网络下载到自己的台式电脑上,这个想法把老师们吓了一跳。
从表面上来看,佩奇的想法何止是英勇无畏,简直就是可笑。他甚至宣称下载工作很简单,很快就能够完成。加西亚…莫利纳和其他教师都对此深表怀疑。然而,佩奇对此相当认真,而且拿定主意要为自己的研究做好万全准备。他有很好的合作伙伴。在1989年发明了万维网的英国科学家蒂姆·伯纳斯…李(Tim Berners…Lee)曾经提出这样的说法,认为信息饥渴的计算机用户可以点击突出显示的文本,从一个文件跳到另外一个文件。对一位富有远见的计算机专家而言,网络就是链接。
1996年慢慢过去,在此期间,佩奇和布林合作进行下载和分析网络链接的工作。获取数据的过程比佩奇预计的要长,而且他估计他们每放一个网络爬虫程序出去搜集整个网络,计算机科学系就得为此支付2万美元,但是他急于完成这项工作。他想要发现这些自动化的交叉指代的重要性。他的研究目的不但吸引了布林的注意,还吸引了布林的指导教师莫特万尼的注意。因为,这项工作有希望改进网络搜索。布林之所以加入这个项目,一是因为他很希望能够与佩奇一起工作,二是他一向对从大量随机数据中提取信息很感兴趣,而这个项目恰恰与此相关。如果布林想要发挥他数学和编程的优势,还有哪个舞台比互联网更广阔呢?
佩奇建立起了自己的理论模型——可以通过计算指向某个网站的链接的数量来确定这个网站的受欢迎程度。尽管受欢迎程度并不总是同价值相关,不过,他和布林都生长在学术世家,非常重视发表在学术期刊上引用了诸多相关文献的学术研究成果。而对佩奇来讲,在某种意义上,链接就像是文献引用。科学家会引用那些同自己的研究相关的已出版的文献,而这些引用可以帮助学术研究界确定某项研究成果的价值和影响力。“文献引用非常重要,”佩奇说,“事实证明,获得诺贝尔奖的科学家们引用了上万种不同的文献。”他还说,“如果你的成果在相关科学文献中被大量引用,就说明,你的工作非常重要,因为很多人都觉得它值得一提。”
而佩奇得出的结论是,同样的道理也适用于网站。他更进一步取得了概念上的突破:并非所有的链接都具有同样的价值,其中一些比另外一些更重要。佩奇赋予从重要的网站上发出的链接更高的权重。那么,他又如何确定哪些网站更重要呢?很简单,指向哪个网站的链接多,哪个网站就重要。换句话说,如果人气很旺的雅虎主页上有指向某个互联网网站的链接,那么这个网站马上就变得重要一些了。佩奇把自己的姓氏同自己正在处理的这些文件巧妙地结合在一起,为他的链接评级体系起名为“PageRank”(网页序列等级)。
佩奇的另外一位指导老师,斯坦福大学的特里·维诺格拉德(Terry Winograd)教授称,解决网页排序问题的学术出路,最终取决于弄明白通过追踪链接到底可以发现什么。“一开始,拉里的想法是进行随机的网络浏览,就像是在网络中漫无目的地漫步。这套算法(一系列数学方程式)是为普通的网络用户发明的。大部分时候,他们在某个网页上点击一个链接,就会到达网络上的某个目的地。对这个过程的提炼造就了PageRank。”
布林和佩奇相信,把PageRank算法应用于互联网,可以作为他们博士论文的研究方向。1997年初,佩奇打造了一个叫“BackRub”的简单的搜索引擎。这个搜索引擎之所以叫“BackRub”是因为它主要处理反向链接。佩奇一直善于精打细算,他把自己的左手平放在扫描仪上,将自己的手纹转化成了一种黑白的图片,而这就是BackRub网站的标志。布林、佩奇和莫特万尼都为这个正在形成的项目贡献了自己的创意。莫特万尼说,不久,他们就清楚地意识到,这个项目不仅仅是一个继续他们的学术研究的途径。尽管事先并没有想到,不过当这三个人把自己的排序方法应用于互联网的时候,却出其不意地解决了互联网信息搜索的一个关键问题。
txt小说上传分享
独特的PageRank技术(4)
“他们从来没有郑重其事地坐下来,然后说,‘让我们来发明下一个伟大的搜索引擎吧。’他们只是想要解决有趣的问题,又碰巧想到了一些不错的创意,”莫特万尼说,“拉里贡献了一些想法,谢尔盖贡献了一些想法,我也贡献了一些想法,我们都参与了项目的创意。渐渐我们发现自己正在建立一个完整的搜索引擎。”维诺格拉德也同意他们的想法是一天天逐渐发展成熟的,“他们一开始并没有想要成立一家公司,不过他们确实想要创造更优越的搜索方式。”
布林、佩奇和莫特万尼一起建立了一个复杂搜索引擎的雏形,供斯坦福大学内部使用。这个搜索引擎以传统的搜索引擎技术为基础,并引入了PageRank算法,因此,用它在互联网中搜索信息,得到的结果在相关性上比以往的引擎要优越得多。其他引擎主要依赖将搜索与句中的词语同网页上的词语进行比对来进行搜索,而PageRank则更进一步,将搜索结果以逻辑形式排序之后再呈现给搜索用户。这是第一次,人们可以迅速地在互联网中进行搜索并迅速地找到有用的结果。
1997年秋天,布林和佩奇决定给BackRub起一个新的名字。佩奇绞尽脑汁却还是想不出一个从来没有人用过,而且容易引起人们注意的名字,所以他请同一办公室的肖恩 · 安德森来帮忙想一个。“所以,我就走到白色书写板前面开始进行头脑风暴,写下一个又一个名字,而他不停地说‘不行,不好’。”安德森回忆说。这种情况持续了几天。“他几乎绝望了,所以我们又进行了一次头脑风暴。我坐在白色书写板前面,提出一个又一个创意,最后我问,‘Googleplex怎么样?你们不是要建立一个通过搜索和索引巨大的数据库来使人们对信息进行组织的公司。Googleplex是一个巨大的数字。’他很喜欢这个名字,说,‘那么,我们就用Google怎么样?’因为他喜欢短一点的。我在我的工作站中键入G…o…o…g…l…e,不过我把这个词拼错了,而这个词还没有被注册。拉里认为这个名字可以接受,于是当天晚上我们就用这个名字注了册,并在白板上写道:Google?郾。同雅虎和亚马逊一样,这个名字很有互联网公司的气质。第二天我一进办公室就发现塔玛拉留了一个条子说:‘你们拼错了。正确的拼写是G…o…o…g…o…l。’可是,注册已经被接受了。”
1997年,这个引擎以google?郾stanford?郾edu的网址为斯坦福大学内部的学生、教师和管理人员使用。在校园里,人们对这个引擎的性能有口皆碑,它很快就流行起来。大学的技术认证中心开始为这项技术申请专利。斯坦福的教授和学生都开始用它来在网络中搜索信息。“它很快就成为我唯一使用的搜索引擎。”斯坦福的丹尼斯 · 阿利森说。“Google很快就成为我系统默认的搜索引擎,”维诺格拉德补充说,“它很快就在斯坦福流行起来了。”
他们没有钱雇用设计师和艺术人才来设计精致的页面,所以Google的主页一直很简单。不过,从刚开始的时候起,Google干净、清新的外表就得到了寻找信息的互联网用户的青睐。Google主页以白色为背景,只使用最基本的色彩,它的纯净在这个杂乱无章的世界上具有广泛的吸引力。它简单清新的形象与大量拥挤不堪的网页形成了鲜明的对比,那些网页上到处都是闪烁的广告,塞满了图形和各种形式的文字。Google并不在其主页上兜售任何东西,所以人们自然而然地感觉到Google是他们自己的,也非常乐意使用它。“以这种方式设计主页,实在是个明智的选择。”阿利森说道,“如果你去一家网页设计公司,要求他们为你的搜索引擎设计主页的话,你肯定不会拿到这样的设计。页面上没有动画效果,没有金属质感的色彩,也没有声音和光影。它的设计直接挑战了这样一个人们普遍相信的说法:人们喜欢在一片嘈杂声中找寻自己的方向。”
随着数据库规模越来越大,用户数量越来越多,布林和佩奇的计算机不够用了。但是,他们没有足够的现金,所以他们千方百计地省钱,自己购买零部件组装机器,还在仓库里翻找没有人认领的计算机。“我们猜想,如果一台计算机的主人没有马上把它们拿走,就证明他们不急用,我们就先借来用用。”布林说。他们的导师们在得知他们到处搜寻可用之物的窘境之后,从斯坦福的数字化图书馆计划中拿出1万美元资助他们。他们在盖茨楼360室塞满了计算机之后,又把佩奇的宿舍变成了数据中心。“我们收集了一大堆五花八门的零部件。”布林说。同时,他还特别提到,他们学到了非常有益的一课:通过集成和连接便�