
软文发稿|公关软文|软文营销|媒体传播
百度|360|搜狗搜索引擎工作原理图如下:
经过五年对搜索引擎排序算法原理的潜心研究,杨小刀对于搜索引擎优化有了些许了解和顿悟,搜索引擎排序原理的几百个影响因素。杨小刀在本子上密密麻麻的记载着一个一个微小的细节,其中最重要的几点小刀来逐一给大家讲解下。
第一篇:分词理论
搜索引擎对于抓取的信息进行无限制切割与分析,得出一批分好的关键词,再给他们按算法排序放进词库里面。
一、为什么要进行中文分词?
词是最小的能够独立活动的有意义的语言成分,英文单词之间是以空格作为自然分界符的,而汉语是以字为基本的书写单位,词语之间没有明显的区分标记,因此,中文词语分析是中文信息处理的基础与关键。
Lucene中对中文的处理是基于自动切分的单字切分,或者二元切分。除此之外,还有最大切分(包括向前、向后、以及前后相结合)、最少切分、全切分等等。
二、中文分词技术的分类
我们讨论的分词算法可分为三大类:基于字典、词库匹配的分词方法;基于词频度统计的分词方法和基于知识理解的分词方法。
第一类方法应用词典匹配、汉语词法或其它汉语语言知识进行分词,如:最大匹配法、最小分词方法等。这类方法简单、分词效率较高,但汉语语言现象复杂丰富,词典的完备性、规则的一致性等问题使其难以适应开放的大规模文本的分词处理。第二类基于统计的分词方法则基于字和词的统计信息,如把相邻字间的信息、词频及相应的共现信息等应用于分词,由于这些信息是通过调查真实语料而取得的,因而基于统计的分词方法具有较好的实用性。
下面简要介绍几种常用方法:
1).逐词遍历法。
逐词遍历法将词典中的所有词按由长到短的顺序在文章中逐字搜索,直至文章结束。也就是说,不管文章有多短,词典有多大,都要将词典遍历一遍。这种方法效率比较低,大一点的系统一般都不使用。
2).基于字典、词库匹配的分词方法(机械分词法)
我们口中说的关键词就是分词得出的海量关键词
下篇小刀给大家讲解百度等搜索引擎的倒排索引技术
软文发稿|公关软文|软文营销|媒体传播