純關鍵詞搜尋
以 BM25 和倒排索引為主,精確詞匹配強。
產品編號、程式碼、法律條文Enterprise Search
企業搜尋把郵件、文件、程式碼庫、資料庫和 SaaS 應用接成統一索引,並在權限約束下用混合檢索與 RAG 返回可行動答案。
MDX 將其架構拆為攝取、索引、查詢、安全投影與生成五層,強調 ACL 安全過濾是區別於公網搜尋的根本。
以 BM25 和倒排索引為主,精確詞匹配強。
產品編號、程式碼、法律條文BM25 與 ANN 召回後用 RRF 或重排序融合。
大多數企業知識檢索場景依賴上游檢索質量,LLM 生成答案並附帶引用。
知識庫問答和政策解讀| 來源 | 類型 | 截至 |
|---|---|---|
| 企業搜尋 MDX | mdx | 2026-05-29 |
企業搜尋(Enterprise Search)是讓組織內成員能像用 Google 一樣,從一個框裡安全、精準地找到散佈在企業內部郵件、文件、程式碼庫、資料庫、SaaS 應用等所有資訊系統中的內容,並直接獲得可行動的知識,而不僅僅是文件連結。它是企業“資料石油”的開採平台,近年因大型模型(LLM)與檢索增強生成(RAG)的注入,正從傳統的“關鍵詞匹配器”進化為“企業認知大腦”。
現代企業資料高度碎片化:結構化資料在資料庫裡,非結構化文件在雲端盤、SharePoint、Slack、Confluence 裡,遺留系統可能還在本地。企業搜尋把這些孤島用聯結器打通,建立一個統一的索引,並提供跨源智慧檢索。它的本質是一套“理解-查詢-驗證-生成”的資訊管道:先理解使用者意圖(可能已是自然語言問答),從海量已清洗、分塊、嵌入化的內容中召回相關片段,再經過權限過濾(確保員工只能看到有權訪問的資訊),最後由重排序模型或大型模型合成精確答案。
產業正在經歷三重變革:① 從“列出十篇文件”變為“直接回答問題”,使用者體驗向 ChatGPT 看齊;② 從僅處理關鍵詞轉向語義與向量混合搜尋,支撐模糊探索與長尾查詢;③ 安全與合規成為核心壁壘,因為生成內容必須嚴格遵循原有文件的訪問控制列表(ACL)。這讓企業搜尋不再是“放大版網站搜尋”,而是一套融合資料治理、AI 和安全架構的基礎平台,直接嵌入員工工作流。
技術視角下,企業搜尋的架構通常拆解為 攝取(Ingestion)、索引(Indexing)、查詢(Querying)、安全投影(Security Trimming)與生成(Generation) 五層。
攝取層必須實現廣泛的企業聯結器:既包括檔案伺服器、物件儲存,也包括 Salesforce、ServiceNow、Workday 等 SaaS API,以及 Databricks、Snowflake 等資料湖。聯結器不僅要獲取內容,還要通過後設資料爬取捕捉文件級/行級的 ACL(哪些使用者/組有檢視權限),這對後續安全至關重要。
索引層決定了最終搜尋質量的上限。原始文件經解析後變成純文本和結構化欄位,然後執行分塊(chunking)策略:固定大小、重疊視窗,或更智慧的基於文件結構(標題、段落、表格)的動態切分。每個塊會生成一個向量嵌入(embeddings),通常用 768 或 1024 維模型,存入向量資料庫(如 Milvus、Weaviate)、或支援向量的全文引擎(Elasticsearch、Vespa、Solr)。同時,系統保留倒排索引做 BM25 關鍵詞匹配。這種混合索引是工業界標配,因為純語義搜尋在精準匹配(如產品編號、程式碼片段)上會失準。
查詢層執行多路召回並融合。通常先由查詢改寫(Query Rewriting)擴充套件意圖,可能用 LLM 將口語化問題轉成更豐富的關鍵詞序列;然後並行從向量路徑(ANN,如 HNSW 圖)和 BM25 路徑各召回 Top-K 個候選塊;交叉比對後,送入一個輕量級重排序模型(如 cross-encoder 或 ColBERT)做精排,輸出最終候選段落。關鍵瓶頸在於延遲:在要求 200ms 返回結果的應用中,大束召回加重排的耗時需極嚴謹控制。
安全投影是企業搜尋區別於公網搜尋的根本。檢索結果必須在呈現前與請求使用者的身份進行比對:每一個文件塊都攜帶其來源文件的 ACL 資訊,系統將 ACL 列表與使用者組展開求交,過濾掉無權限的內容。實現上通常有兩種方式:晚過濾(Late Filtering)—— 先檢索再過濾,簡單但可能召回不足(如果無權限塊擠佔 Top-K);早過濾(Early Filtering)—— 在索引時把 ACL token 嵌入向量索引的後設資料並參與過濾查詢,實現更徹底的安全,但設計複雜。
生成層是近年最大的變數。帶上通過安全過濾的權威塊作為上下文,大型模型進行摘要或回答,並附帶引用來源。此時 RAG 的挑戰在於:如何保證模型忠實於上下文、如何避免跨文件混淆權限、如何控制成本(每次查詢可能觸發大型模型呼叫)。不少廠商採用快取常用片段生成的嵌入、採用較小的微調模型處理常用查詢等方法降本。
下圖用 ASCII 描述一個完整的企業搜尋管道(邏輯流):
[資料來源群] [使用者]
│ 檔案/DB/SaaS/ACL抓取 │ 自然語言查詢
▼ ▼
[攝取管道] [查詢理解 & 改寫]
│- 解析(PDF,docx,表格) │- LLM擴充套件/實體抽取
│- 分塊(滑動視窗/結構感知) │
│- 嵌入(embedding model) ▼
▼ [混合召回器]
[索引儲存] ──────────────► ┌─ 向量ANN(HNSW/DiskANN) ─┐
│ 向量索引 │ ├─ 融合 ─► [重排序器]
│ 倒排索引(BM25) └─ 關鍵詞(BM25/Match) ──┘ │ cross-encoder
│ 權限後設資料 ▼
│ [安全過濾 ─ 身份 vs ACL 求交]
│ │
│ [上下文視窗組裝]
│ │
└────────────────────→ 提供權威塊 ┌────▼────┐
│ LLM生成 │ → 答案+引用
└─────────┘
機理細節:
M(鄰居數)和 efConstruction/efSearch 權衡精度與記憶體/延遲。2023年後 DiskANN、FAISS 等也進入生產環境以支援十億級向量。score = α * score_vector + (1-α) * score_bm25,但簡單的加權對分數尺度敏感,更有魯棒性的是倒數排名融合(RRF):score(d) = Σ 1/(k + rank_i(d)),對各路排名結果合併,不依賴原始分數的量綱。top_k 全有權限。| 路線 | 代表實現 | 查詢召回方式 | 精準度(關鍵詞) | 語義泛化能力 | 安全投影難度 | 計算成本(估算) | 可解釋性 | 適用場景 |
|---|---|---|---|---|---|---|---|---|
| 純關鍵詞搜尋 | 傳統 Elasticsearch (BM25) | 倒排索引匹配 | 極高 | 無 | 易(早過濾) | 低(CPU 密集) | 高(詞匹配) | 產品編號、程式碼、法律條文 |
| 純向量語義搜尋 | 向量庫 + 嵌入模型 (無關鍵詞) | ANN 近似搜尋 | 低(精確詞易失) | 極高 | 複雜(晚過濾) | 中高(GPU/記憶體) | 較低 | 長文搜尋、模糊探索 |
| 混合搜尋 | Elasticsearch 混合 / Vespa / Weaviate | BM25+ANN,RRF 融合 | 高 | 高 | 中等 | 中 | 中 | 大多數企業場景(主流) |
| 知識圖譜增強搜尋 | Neo4j + 圖嵌入 + LLM | 圖遍歷+向量 | 中 | 高(關係推論) | 低(實體級權限) | 高(建置成本大) | 高(圖路徑) | 供應鏈、藥物發現、組織關係 |
| 純 RAG 問答 | LangChain/LlamaIndex 流式 + LLM | 依賴上游檢索 | 依賴檢索質量 | 依賴檢索質量 | 與檢索相同 | 高(每次生成Token費) | 中(引用) | 知識庫問答、政策解讀 |
注:量化指標準確度通過範圍定性;實際部署常為混合方案,成本因規模而異。
上游 (技術供給):
下游 (應用場景):
由於無法獲取即時聯網資料,此處基於行業共識定性分析:企業搜尋市場長期以來穩定在數十億美元量級,年複合增長率在 AI 加持下預估超過 15%(據多家市場分析機構如 Gartner、IDC、Fortune Business Insights 的歷史軌跡和定性結論)。傳統市場由 Microsoft、Google、OpenText、Elastic 等主導。2023 年後生成式 AI 企業搜尋出現爆發性需求,相關初創公司融資頻現(如 Glean 在 D 輪融資後估值數十億美元級別)。供給方面,基礎模型 API 成本快速下降,向量檢索技術成熟,降低了建置企業搜尋的門檻;但深度安全整合和領域知識管理仍使高階解決方案保持較高價值。中國市場受數字化轉型和信創驅動,釘釘、飛書等平台的內建搜尋升級,以及獨立供應商(如禾觀、合合資訊等)也在發力。
資本市場對映:上市公司(Elastic、Coveo、Microsoft、Google)體現了企業搜尋的持續基本面;未上市的高估值獨角獸反映市場對 AI 驅動的企業搜尋即“企業內部回答引擎”的重塑預期。併購活躍,例如 AI 搜尋公司常被協作平台或雲端服務商收購以補齊能力。
核心敘事:企業搜尋是“企業內部資料的最後一個 AI 藍海”,是任何組織向認知智慧躍遷的剛需基礎設施。
驅動力:
風險關注:
產業視角:具備“聯結器生態+安全投影+低成本混合檢索與生成”能力的獨立平台,是企業搜尋產業鏈的重要供給方;Elastic 等老牌企業的 AI 轉型進度,會影響既有安裝基數的變現路徑。在中國市場,飛書/釘釘等超級 App 增強搜尋,也會帶動背後 AI 元件供應商的需求變化。
誤讀1:“企業搜尋就是給公司內部裝一個類似 Google 的搜尋框。”
誤讀2:“有了大型模型 RAG,企業搜尋就被顛覆了,直接用 LangChain 搭一個就行。”
企業搜尋正從“企業內部的文件查詢工具”演變為“安全、懂你、會回答的組織智慧代理”,它以檢索增強生成為技術核心,將分散的資料孤島編織成每個員工的即時知識副駕駛,是人工智慧落地的核心戰役之一。