搜索引擎系統(tǒng)講解視頻

  • 名稱:搜索引擎系統(tǒng)講解視頻
  • 分類:電腦網(wǎng)絡(luò)  
  • 觀看人數(shù):加載中
  • 時間:2015/8/27 16:36:21

           眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關(guān)的簡要過程。今天簡要介紹一下索引系統(tǒng),以億為單位的網(wǎng)頁庫中查找特定的某些關(guān)鍵詞猶如大海里面撈針,也許一定的時間內(nèi)可以完成查找,但是用戶等不起,從用戶體驗(yàn)角度我們必須在毫秒級別給予用戶滿意的結(jié)果,否則用戶只能流失。怎樣才能達(dá)到這種要求呢?

如果能知道用戶查找的關(guān)鍵詞(query切詞后)都出現(xiàn)在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內(nèi)以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:
搜索引擎索引系統(tǒng)概述
(1)頁面分析的過程實(shí)際上是將原始頁面的不同部分進(jìn)行識別并標(biāo)記,例如:title、keywords、content、link、anchor、評論、其他非重要區(qū)域等等;
(2)分詞的過程實(shí)際上包括了切詞分詞同義詞轉(zhuǎn)換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數(shù)據(jù):term文本、termid、詞類、詞性等等;
(3)之前的準(zhǔn)備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應(yīng)用【doc->term】呢?
搜索引擎索引系統(tǒng)概述
上述即是索引系統(tǒng)中的倒排索引過程,是搜索引擎實(shí)現(xiàn)毫秒級檢索非常重要的一個環(huán)節(jié)。
西昌市| 九龙县| 奉新县| 泾阳县| 芒康县| 偏关县| 莫力| 翼城县| 长白| 托里县| 兴化市| 定南县| 赤壁市| 泰和县| 洪洞县| 体育| 宝鸡市| 皋兰县| 龙里县| 牙克石市| 乾安县| 南充市| 昌都县| 九江县| 固安县| 长乐市| 黑水县| 金坛市| 时尚| 卓资县| 河西区| 察雅县| 延寿县| 沿河| 金沙县| 鄄城县| 皮山县| 乌拉特前旗| 宜城市| 长沙县| 河池市|