《网络营销知识仓库》

下载本书

添加书签

网络营销知识仓库- 第44节


按键盘上方向键 ← 或 → 可快速上下翻页,按键盘上的 Enter 键可回到本书目录页,按键盘上方向键 ↑ 可回到本页顶部!
后再选择其中的一个链接网页,继续抓取在此网页中链接的所有网页。这是最常用的方式,因为这个方法可以让网络蜘蛛并行处理,提高其抓取速度。 深度优先是指网络蜘蛛会从起始页开始,一个链接一个链接跟踪下去,处理完这条线路之后再转入下一个起始页,继续跟踪链接。这个方法有个优点是网络蜘蛛在设计的时候比较容易。 由于不可能抓取所有的网页,有些网络蜘蛛对一些不太重要的网站,设置了访问的层数。 例如上图 A为起始网页,属于 0 层,B、C、D、E、F 属于第 1 层,G、H 属于第 2 层,I属于第3 层。如果网络蜘蛛设置的访问层数为2 的话,网页I 是不会被访问到的。这也让有些网站上一部分网页能够在搜索引擎上搜索到,另外一部分不能被搜索到。对于网站设计者来说,扁平化的网站结构设计有助于搜索引擎抓取其更多的网页。 网络蜘蛛在访问网站网页的时候,经常会遇到加密数据和网页权限的问题,有些网页是需要会员权限才能访问。当然,网站的所有者可以通过协议让网络蜘蛛不去抓取,但对于一些出售报告的网站,他们希望搜索引擎能搜索到他们的报告,但又不能完全免费的让搜索者查看,这样就需要给网络蜘蛛提供相应的用户名和密码。网络蜘蛛可以通过所给的权限对这些网页进行网页抓取,从而提供搜索。而当搜索者点击查看该网页的时候,同样需要搜索者提供相应的权限验证。 二、如何辨别搜索引擎机器人身份搜索引擎派出他们的搜索机器人去访问、索引网站内容,网站管理员也默认、欢迎它们 来访。但是由于搜索引擎派机器人来访会在一定程度上影响网站性能,因此并非所有的机器 人都是无害的,有一些非法机器人伪装成主流搜索引擎漫游器对网站大量遍历,并且不遵循 robots。txt 规范,会严重拖垮网站性能而又无其它益处。因此,网站管理员需要验证每个机器人身份是否合法。在你的服务器日志文件中,可见每次访问的路径和相应的 IP 地址,如果是机器人来访, 则user…agent 会显示 Googlebot 或MSNBot 等搜索引擎漫游器名称,每个搜索引擎都有自己的user…agent,但仅有这个还不足以证明这个机器人的合法性,因为很多垃圾制造者可能将他们的机器人也命名为Googlebot,以伪装蒙混进入网站,大肆采掘内容。目前,主流搜索引擎都建议网站管理员通过这种方式来辨别真实的机器人身份:通过 DNS 反向查询找出搜索引擎机器人IP 地址对应的主机名称;用主机名查找IP 地址以确认该主机名与IP 地址匹配。 首先,使用DNS 反向查询(Reverse DNS Lookup),找出机器人IP 地址对应的主机名称。主流搜索引擎的主机名称通常情况下应是这样的:够充分利用的话,可以极大地提高检索结果的质量。超链分析技术,是新一代搜索引擎的关键技术。一、基本原理 超链分析的基本原理是:在某次搜索的所有结果中,被其他网页用超链指向得越多的网 页,其价值就越高,就越应该在结果排序中排到前面。 超链分析是一种引用投票机制,对于静态网页或者网站主页,它具有一定的合理性,因 为这样的网页容易根据其在互联网上受到的评价产生不同的超链指向量,超链分析的结果可 以反映网页的重要程度,从而给用户提供更重要、更有价值的搜索结果。 搜索引擎,并不能真正理解网页上的内容,它只能机械地匹配网页上的文字。它收集了 互联网上几千万到几十亿个网页并对网页中的每一个文字(即关键词)进行索引,建立索引 数据库的全文搜索引擎。当用户查找某个关键词的时候,所有在页面内容中包含了该关键词 的网页都将作为搜索结果被搜出来。在经过复杂的算法进行排序后,这些结果将按照与搜索 关键词的相关度高低,依次排列。搜索引擎在查询时主要根据一个站点的内容与查询词的关联程度进行排序。对于一个站 点的内容搜索引擎则是根据标题、关键词、描述、页面开始部分的内容以及这些内容本身之 间的关联程度以及一个站点在整个网络上的关联程度来确定的。 使用超链分析技术,除要分析索引网页本身的文字,还要分析索引所有指向该网页的链接的 URL、AnchorText,甚至链接周围的文字。所以,有时候,即使某个网页 A中并没有某个词,比如“软件”,但如果有别的网页B 用链接“软件”指向这个网页A,那么用户搜索“软件”时也能找到网页A 。而且,如果有越多网页(C、D、E、F……)用名为“软件”的链接指向这个网页 A,或者给出这个链接的源网页(B、C、D、E、F……)越优秀,那么网页A 在用户搜索“超链分析”时也会被认为相关度越高,排序也会越靠前。 二、工作步骤1、从互联网上抓取网页 专门用于检索信息的Robot 程序像蜘蛛一样在网络间爬来爬去,利用能够从互联网上自动收集网页的 Spider 系统程序, 自动访问互联网,并沿着任何网页中的所有 URL爬到其它网页,重复这过程,并把爬过的所有网页收集回来。随着互联网的迅速发展,检索所有新出现的网页变得越来越困难。因此,在Wan…derer 基础上,一些编程者将传统的 Spider 程序工作原理作了些改进。其设想是,既然所有网页都可能有连向其他网站的链接,那么从一个网站开始,跟踪所有网页上的所有链接,就有可能检索整个互联网。2、建立索引数据库 由分析索引系统程序对收集回来的网页进行分析,提取相关网页信息(包括网页所在 URL、编码类型、页面内容包含的所有关键词、关键词位置、生成时间、大小、与其它网页 的链接关系等),根据一定的相关度算法进行大量复杂计算,得到每一个网页针对页面文字 中及超链中每一个关键词的相关度(或重要性),然后用这些相关信息建立网页索引数据库。3、索引数据库中搜索排序 当用户输入关键词搜索后,由搜索系统程序从网页索引数据库中找到符合该关键词的所有相关网页。因为所有相关网页针对该关键词的相关度早已算好,所以只需按照现成的相关度数值排序,相关度越高,排名越靠前。最后,由页面生成系统将搜索结果的链接地址和页面内容摘要等内容组织起来返回给用户。 三、搜索效果搜索引擎 Spider 一般要定期重新访问所有网页(各搜索引擎的周期不同,可能是几天、 几周或几月,也可能对不同重要性的网页有不同的更新频率),更新网页索引数据库,以反 映出网页文字的更新情况,增加新的网页信息,去除死链接,并根据网页文字和链接关系的 变化重新排序。这样,网页的具体文字变化情况就会反映到用户查询的结果中。 互联网虽然只有一个,但各搜索引擎的能力和偏好不同,所以抓取的网页各不相同,排 序算法也各不相同。大型搜索引擎的数据库储存了互联网上几千万至几十亿的网页索引,数 据量达到几千 G 甚至几万G。但即使最大的搜索引擎建立超过20 亿网页的索引数据库,也 占不到互联网上普通网页的30%,不同搜索引擎之间的网页数据重叠率一般在70%以下。 人们使用不同搜索引擎的重要原因,就是因为它们能分别搜索到不同的网页。而互联网上有 更大量的网页,是搜索引擎无法抓取索引的,也是无法用搜索引擎搜索到的。 使用超链分析的搜索引擎未能收录的网页有:Spider 未能正确处理的网页性质及文件类型(如Flash、script、JS,某些动态网页及Frame、数据库);没有主动登录搜索引擎而且没有指向链接的孤岛网页;Spider 访问时因为某些原因正好是死链接的网页;被认为是劣质网页而不抓;因为色情、反动、spam等问题而不抓的非法网页;需要输入用户名、密码方可打开的网页;网站用robots 协议拒绝搜索引擎抓取的网页;搜索引擎还未来得及抓取的新网页;go…pher、newsgroups、Telnet、np、wais 等非http 信息的网页。 任何地址中带“?”和“&”号(及其他类似符号)的网页都会被“蜘蛛”程序挡在门外。这些网页通常由 CGL、PHP、ASP等程序产生,技术上较先进,但不适合搜索引擎的“蜘蛛”程序。虽然目前有的大型搜索引擎(如 Google)已具备检索动态网页的能力,但相当一部分引擎还是不支持它的。而且即使是能够索引动态网页的 Google,也在多个场合中明确表示不保证检索全部的动态网页。 四、超链分析技术的应用 超链分析技术已为世界各大搜索引擎普遍采用,在我国使用该项技术的搜索引擎有:百度(baidu )搜索引擎使用了高性能的“网络蜘蛛”程序自动在互联网中搜索信息,可定制、高扩展性的调度算法使得搜索器能在极短的时间内收集到最大数量的互联网信息。百度在中文互联网拥有天然优势,支持搜索 1。3 亿个中文网页,是现在最大的中文搜索引擎。并且,百度每天都在增加几十万新网页,对重要中文网页实现每天更新。百度除了用超链分析排名外还开展竞价排名。具有网页快照,相关搜索、中文人名识别、简繁体中文自动转换、网页预览等功能,还可以进行专业的MP3 搜索、Flash 搜索、新闻搜索、图片搜索、信息快递搜索。百度总裁李彦宏就是超链分析专利的唯一持有人。  引入人工智能的慧聪(huicong )行业搜索引擎对于商务人士而言尤为有用。如果在Google 上输入“化工”,搜索出相关网页有 138 万个,里面包罗万象,有用的、无用的混杂在一起,如果用户想找的网站正好排名在上千、上万个以后,无疑面对的是一个 茫茫网海,找到这个信息十分困难。而在慧聪行业搜索引擎,弹出的首先是一个分类页面,列有有机化工、石油化工、精细化工、印刷化工等43 个行业分类的条目,虽然只有 1 万多条查询结果,针对性却非常强,用户可以快速找到自己需要的信息,网站与有效用户的见面机会大大增强。模拟人类智慧,更好地使用技术来完成更具智慧的搜索,必然是下一代搜索引攀技术的发展趋势。 五、存在的缺陷用户在搜索关于某些内容的有效信息时,最大的特点是各异性。利用超链分析技术,用 户将接受一种根据某种标准进行网页排名的信息服务,从而演变成为各网站想尽办法追求网 页排名的商业活动。  海量的网页被收集回来,用姓名、电话、单位名称或网名都可以搜索到许多含有此关键词的信息,这些信息有不少侵权、侵犯隐私、泄露机密的信息,尤其是大量论坛的贴子被收录,不少贴子言论含有攻击的成分。所以如何及时处理掉这些链接又是搜索引擎急需解决的问题。  第三节 中文分词一、什么是中文分词? 英文是以词为单位的,词和词之间是靠空格隔开,而中文是以字为单位,句子中所有的 字连起来才能描述一个意思。例如,英文句子“I am a student。”,用中文则为:“我是一个 学生”。计算机可以很简单通过空格知道 student 是一个单词,但是不能很容易明白“学”、  “生”两个字合起来才表示一个词。把中文的汉字序列切分成有意义的词,就是中文分词, 有些人也称为切词。我是一个学生,�
小提示:按 回车 [Enter] 键 返回书目,按 ← 键 返回上一页, 按 → 键 进入下一页。 赞一下 添加书签加入书架