织梦CMS - 轻松建站从此开始!

澳门葡京在线娱乐_澳门新葡京官网平台_澳门新葡京国际官方网站

当前位置: 主页 > 科幻小说 >

搜索引擎原理 - hrhguanli - 博客园

时间:2018-03-24 22:26来源:未知 作者:admin 点击:
全文搜索引擎的网络机器人或网络蜘蛛是一种网络上的软件,它遍历Web空间,可以扫描一定IP地址范围内的站点,并沿着网络上的链接从一个网页到还有一个网页,从一个站点到还有一个站点採集网页资料。它为保证採集的资料最新,还会回訪已抓取过的网页。网络机器人或网络蜘蛛採集的网页,还要有其他程序进行分析,依据一定的相关度算法进行大量的计算建立网页索引,才干加入�到索引数据库中。我们平时看到的全文搜索引擎,实际上仅仅是一个搜索引擎系统的检索界面,当你输入关键词进行查询时,搜索引擎会从庞大的数据库中找到符合该关键词的全部相关网页的索引,并按一定的排名规则呈现给我们。不同的搜索引擎,网页索引数据库不同,排名规则也不尽同样,所以,当我们以同一关键词用不同的搜索引擎查询时,搜索结果也就不尽同样。和全文搜索引擎一样,分类文件夹的整个工作过程也相同分为收集信息、分析信息和查询信息三部分,仅仅只是分类文件夹的收集、分析信息两部分主要依靠人工完毕。分类文件夹一般都有专门的编辑人员,负责收集站点的信息。随着收录站点的增多,如今一般都是由站点管理者递交自己的站点信息给分类文件夹,然后由分类文件夹的编辑人员审核递交的站点,以决定是否收录该站点。假设该站点审核通过,分类文件夹的编辑人员还须要分析该站点的内容,并将该站点放在对应的类别和文件夹中。全部这些收录的站点相同被存放在一个索引数据库中。用户在查询信息时,能够选择依照关键词搜索,也可按分类文件夹逐层查找。如以关键词搜索,返回的结果跟全文搜索引擎一样,也是依据信息关联程度排列站点。须要注意的是,分类文件夹的关键词查询仅仅能在站点的名称、网址、简单介绍等内容中进行,它的查询结果也仅仅是被收录站点首页的URL地址,而不是具体的页面。分类文件夹就像一个电话号码薄一样,依照各个站点的性质,把其网址分门别类排在一起,大类以下套着小类,一直到各个站点的具体地址,一般还会提供各个站点的内容简单介绍,用户不使用关键词也可进行查询,仅仅要找到相关文件夹,就全然能够找到相关的站点(注意:是相关的站点,而不是这个站点上某个网页的内容,某一文件夹中站点的排名通常是依照标题字母的先后顺序或者收录的时间顺序决定的)。一个好的搜索引擎,不仅数据库容量要大,更新频率、检索速度要快,支持对多语言的搜索,并且随着数据库容量的不断膨胀,还要能从庞大的资料库中精确地找到正确的资料。⒈提高搜索引擎对用户检索提问的理解。  为了提高搜索引擎对用户检索提问的理解,就必须有一个好的检索提问语言。为了克服关键词检索和文件夹查询的缺点,如今已经出现了自然语言智能答询。用户能够输入简单的疑问句,比方如何能杀死计算机中的病毒,搜索引擎在对提问进行结构和内容的分析之后,或直接给出提问的答案,或引导用户从几个可选择的问题中进行再选择。自然语言的优势在于,一是使网络交流更加人性化,二是使查询变得更加方便、直接、有效。就以上面的样例来讲,假设用关键词查询,多半人会用病毒这个词来检索,结果中必定会包含各类病毒的介绍,病毒是如何产生的等等很多无用信息,而用如何能杀死计算机中的病毒检索,搜索引擎会将如何杀死病毒的信息提供给用户,提高了检索效率。⒉垂直主题搜索引擎有着极大的发展空间。  网上的信息浩如烟海,网络资源以惊人的速度增长,一个搜索引擎非常难收集全全部主题的网络信息,即使信息主题收集得比較全面,因为主题范围太宽,非常难将各主题都做得精确而又专业,使得检索结果垃圾太多。这样以来,垂直主题的搜索引擎以其高度的目标化和专业化在各类搜索引擎中占领了一席之地。眼下,一些基本的搜索引擎,都提供了新闻、Mp3、图片、Flash等的搜索,加强了检索的针对性。 (责任编辑:admin)
顶一下
(0)
0%
踩一下
(0)
0%
------分隔线----------------------------