97午夜理论片影院在线播放,狠狠色丁香婷婷久久综合蜜芽,国产黄色小视频在线观看

170205520

眾所周知，搜索引擎的主要工作過程包括：抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關的簡要過程。今天簡要介紹一下索引系統(tǒng)，以億為單位的網頁庫中查找特定的某些關鍵詞猶如大海里面撈針，也許一定的時間內可以完成查找，但是用戶等不起，從用戶體驗角度我們必須在毫秒級別給予用戶滿意的結果，否則用戶只能流失。怎樣才能達到這種要求呢?

如果能知道用戶查找的關鍵詞(query切詞后)都出現在哪些頁面中，那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程，而檢索即變成了頁面名稱之間的比較、求交。這樣，在毫秒內以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程：

(1)頁面分析的過程實際上是將原始頁面的不同部分進行識別并標記，例如：title、keywords、content、link、anchor、評論、其他非重要區(qū)域等等;

(2)分詞的過程實際上包括了切詞分詞同義詞轉換同義詞替換等等，以對某頁面title分詞為例，得到的將是這樣的數據：term文本、termid、詞類、詞性等等;

(3)之前的準備工作完成后，接下來即是建立倒排索引，形成{termàdoc}，可以粗略的理解為如下，為什么是【term->doc】,而不是直接應用【doc->term】呢?

上述即是索引系統(tǒng)中的倒排索引過程，是搜索引擎實現毫秒級檢索非常重要的一個環(huán)節(jié)。

數字經濟的崛起與規(guī)范

潛伏在工廠的隱形“大鯨”

智慧零售全鏈路系統(tǒng)結合運營服務，「錐智科技」完成5

5G+工業(yè)互聯網技術供應商「凌犀物聯」完成1000萬天

百度站長平臺：搜索引擎索引系統(tǒng)概述

熱點推薦

行業(yè)導航

今日快訊

“運去哪”獲中信資本領投新一輪融資，D1輪融資額達1.5億美元

運去哪完成1億美元D1輪融資成國際物流數字化領域唯一中國獨角獸

詢盤云完成千萬級美元融資，持續(xù)領跑外貿私域MarTech賽道

【東經易網】完成2.5億B+輪融資，包裝產業(yè)數字化戰(zhàn)略全面提速

新一代五金供應鏈平臺「沂川商城」完成百萬美元天使輪融資

推薦文章

圓桌|第四屆中國工業(yè)品數字化高峰論壇工業(yè)品數字

第四屆中國工業(yè)品數字化高峰論壇在上海成功舉行

劉潤、衛(wèi)哲領銜托比網聯合創(chuàng)業(yè)酵母推出《創(chuàng)變：數

相關文章

SEO優(yōu)化中應理解搜索引擎的目的

8月全球搜索引擎市場

四個方法提升網站對搜索引擎的友好度

全球30大知名搜索引擎及平臺

如何利用搜索引擎找客戶