快速解锁搜索引擎,掌握哪些技巧能让我高效搜索信息?
- 内容介绍
- 相关推荐
爬行和抓取是搜索引擎的第一阶段,也是最基础的阶段。在当前这个阶段,搜索引擎程序通过访问网页,获取页面HTML代码存入数据库。这一阶段的最主要工作岗位是收集和储存互联网上全部可用的网页数据。蜘蛛是用于完成这一工作岗位的程序, 它们会发出页面访问申请,服务器返回HTML代码,蜘蛛把收到的代码存入数据库中。蜘蛛还会对链接进行跟踪,根据一个页面上的链接,爬行至下一个,这也是为哪些被人称之为“蜘蛛”的原因。
当前我们了解了爬行和抓取阶段的内容,我们接下来要了解的是第二阶段,也就是预处理阶段。在当前这个阶段,程序对原始数据库进行处理,为排名程序调用做准备。预处理包括以下几步:
预处理
1. 分词:将用户搜索的内容划分为以“词”为基础组合。这一步骤对于中文来说非常十分沉关键, 这是因为中文不像英文一样, 坦白说... 各个单词都是独立的,在中文中一个单词有可能由更多个不同汉字组成,所以需要对中文进行分词才能正确地明白用户搜索内容。
一阵见血。 2. 匹配:将用户搜索内容与原始数据库中的网页数据进行匹配。这一步骤能够通过倒排索引来实现倒排索引是一种在数据库中建立文件集合并按照关键词进行分类,以便迅速查找包含部分关键词的文件集合。
3. 去沉重:去除相同内容的反复数据,以避免将更多篇反复的内容返回给用户。 改进一下。 去沉重能够通过对比两个文件有没有相同来实现,如果相同则舍弃其中一个文件。
4. 剔除终止词:剔除不相关词汇, 如“的”、“啊”、“却”,等等这一些被称作“终止词”的词汇,对于提升匹配率有所协助,摆烂...。
爬行和抓取是搜索引擎的第一阶段,也是最基础的阶段。在当前这个阶段,搜索引擎程序通过访问网页,获取页面HTML代码存入数据库。这一阶段的最主要工作岗位是收集和储存互联网上全部可用的网页数据。蜘蛛是用于完成这一工作岗位的程序, 它们会发出页面访问申请,服务器返回HTML代码,蜘蛛把收到的代码存入数据库中。蜘蛛还会对链接进行跟踪,根据一个页面上的链接,爬行至下一个,这也是为哪些被人称之为“蜘蛛”的原因。
当前我们了解了爬行和抓取阶段的内容,我们接下来要了解的是第二阶段,也就是预处理阶段。在当前这个阶段,程序对原始数据库进行处理,为排名程序调用做准备。预处理包括以下几步:
预处理
1. 分词:将用户搜索的内容划分为以“词”为基础组合。这一步骤对于中文来说非常十分沉关键, 这是因为中文不像英文一样, 坦白说... 各个单词都是独立的,在中文中一个单词有可能由更多个不同汉字组成,所以需要对中文进行分词才能正确地明白用户搜索内容。
一阵见血。 2. 匹配:将用户搜索内容与原始数据库中的网页数据进行匹配。这一步骤能够通过倒排索引来实现倒排索引是一种在数据库中建立文件集合并按照关键词进行分类,以便迅速查找包含部分关键词的文件集合。
3. 去沉重:去除相同内容的反复数据,以避免将更多篇反复的内容返回给用户。 改进一下。 去沉重能够通过对比两个文件有没有相同来实现,如果相同则舍弃其中一个文件。
4. 剔除终止词:剔除不相关词汇, 如“的”、“啊”、“却”,等等这一些被称作“终止词”的词汇,对于提升匹配率有所协助,摆烂...。

