應用層 開放閱讀

行業知識圖譜

Domain Knowledge Graph

概念 ID
domain-knowledge-graph
更新時間
2026-05-29
來源數量
待補

行業知識圖譜 (Domain Knowledge Graph)

3 秒看懂

一句話:把某個行業的專業知識——人、事、物、規則、流程——用「實體-關係-實體」的圖結構儲存起來,讓機器能”讀懂”並推論。

關鍵詞:結構化知識 | 圖資料庫 | 三元組 | 實體關係抽取 | 行業語義層

3 分鐘產業解釋

它解決什麼問題?

傳統資料庫存的是”行與列”,適合記錄交易、日誌;但行業專家腦子裡的知識是網狀的——“這個藥靶向哪個通路”、“這個晶片供應商的上游是誰”、“這筆轉賬經過了哪些殼公司”。

行業知識圖譜就是把這種網狀知識顯式地、機器可讀地建模出來。

和通用知識圖譜的區別

維度通用知識圖譜行業知識圖譜
覆蓋範圍跨領域(維基類)單一行業縱深
實體型別人物、地點、事件行業專有本體(晶片型號、臨床試驗、貿易單據等)
建置方式眾包 + 自動抽取領域專家 + 小模型 + 規則
資料敏感度公開資料常涉及商業機密、合規資料
精度要求容忍噪聲高精度、需人工稽核

落地場景(定性)

  • 金融:企業關聯圖譜、反洗錢鏈路追蹤、信貸風控
  • 醫藥:藥物-靶點-疾病關係、臨床試驗入排標準推論
  • 工業/製造:裝置-故障-維修方案關聯、供應鏈溯源
  • 政務/法律:案件要素抽取、法規適用推論

15 分鐘專家深入

1. 建置範式的演進

階段一:純人工(專家逐條錄入,成本極高)

階段二:規則 + 模板匹配(正則、依存句法)

階段三:統計NLP(CRF實體識別 + 遠端監督關係抽取)

階段四:深度學習(BERT/BiLSTM 抽取 + GNN 推論)

階段五:LLM + KG 協同(大型模型做抽取/補全,KG做事實約束)

當前主流:階段四與階段五並存。純用LLM抽取仍存在”幻覺”風險,因此高精度行業場景普遍採用”LLM抽取 + 人工稽核 + 圖資料庫儲存”的混合流程。

2. 本體設計——圖譜的骨架

行業圖譜的核心壁壘不是技術,而是本體(Ontology)設計——即”定義這個行業有哪些實體型別、關係型別、屬性”。

本體設計質量決定了圖譜的可用性上限。

示例(金融領域,定性):

實體型別:公司、自然人、基金、債券、監管機構...
關係型別:持股、擔保、關聯交易、董監高任職...
屬性:註冊資本、成立日期、實際控制人...

這一步依賴行業專家,技術手段難以完全替代。

3. 與 LLM 的競合關係

能力LLM知識圖譜
事實準確性易幻覺高(顯式儲存)
可解釋性弱(黑盒)強(路徑可追溯)
動態更新需重訓/微調即時寫入
推論泛化強(隱式)弱(需規則/嵌入)
長尾知識強(只要建了就有)

產業共識:二者互補而非替代。RAG(檢索增強生成)+ KG 是當前企業級 AI 應用的主流架構。


技術原理

核心資料結構:三元組

知識圖譜的最小單元是三元組

(頭實體, 關係, 尾實體)

示例:

(輝瑞, 研發藥物, Paxlovid)
(Paxlovid, 靶向蛋白, Mpro)
(Mpro, 所屬病毒, SARS-CoV-2)

大量三元組構成有向屬性圖(Directed Property Graph)。

建置流水線

┌─────────────────────────────────────────────────────────────────┐
│                     行業知識圖譜建置流程                          │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  [非結構化資料]        [結構化資料]         [外部知識庫]          │
│  文件/報告/網頁        資料庫/表格          Wikidata/行業詞表      │
│        │                   │                      │             │
│        ▼                   ▼                      ▼             │
│  ┌──────────┐     ┌──────────────┐      ┌──────────────┐       │
│  │ NER 命名  │     │ Schema 對映  │      │ 實體對齊     │       │
│  │ 實體識別  │     │ 結構化轉換   │      │ Entity       │       │
│  └────┬─────┘     └──────┬───────┘      │ Linking      │       │
│       │                  │              └──────┬───────┘       │
│       ▼                  ▼                     ▼               │
│  ┌──────────┐     ┌──────────────┐                            │
│  │ 關係抽取  │     │ 知識融合     │                            │
│  │ RE       │     │ 去重/消歧    │                            │
│  └────┬─────┘     └──────┬───────┘                            │
│       │                  │                                     │
│       └────────┬─────────┘                                     │
│                ▼                                                │
│  ┌──────────────────────────────┐                              │
│  │      質量評估 & 入庫          │                              │
│  │  圖資料庫(Neo4j/Nebula等)  │                              │
│  └──────────────────────────────┘                              │
│                                                                 │
└─────────────────────────────────────────────────────────────────┘

關鍵技術模組

① 命名實體識別(NER)

  • 傳統:BiLSTM-CRF
  • 當前主流:預訓練語言模型微調(BERT-NER 等)
  • 行業難點:專業術語、巢狀實體、縮寫消歧

② 關係抽取(RE)

  • 管道式:先NER再RE
  • 聯合抽取:一步到位(CasRel、TPLinker 等架構)
  • 文件級抽取:跨句關係建模(CoIn、DocRED資料集推動)

③ 實體對齊與消歧

  • 不同資料來源中同一實體的合併(如”騰訊”、“騰訊控股”、“0700.HK”指向同一節點)
  • 方法:字串相似度 + 圖嵌入 + 人工兜底

④ 圖嵌入與推論

  • 將實體/關係對映到低維向量空間
  • 經典模型(定性,非最新):TransE(翻譯模型)、RotatE(旋轉模型)、CompGCN(圖卷積)
  • 用途:連結預測(補全缺失三元組)、節點分類

⑤ 圖資料庫與查詢

  • 儲存引擎:Neo4j(屬性圖)、NebulaGraph(分散式)、TigerGraph、JanusGraph
  • 查詢語言:Cypher(Neo4j)、nGQL(Nebula)、Gremlin(Apache TinkerPop)
  • 與關係型資料庫對比:圖遍歷中單節點鄰居訪問複雜度通常為 O(d)(d 為節點的出度),但免索引鄰接使得多跳遍歷的總成本呈線性增長,而非關係表 JOIN 的指數爆炸

技術演進史

時期里程碑意義
1960s-1990s語義網路(Semantic Network)圖結構表示知識的早期探索
1998-2000s語義網(Semantic Web)、RDF/OWL 標準W3C 推動的標準化嘗試,但工業採用有限
2012Google Knowledge Graph 釋出”Things, not strings”,引爆產業關注
2013-2014TransE 提出知識圖譜嵌入研究的起點
2015-2017金融/醫療行業圖譜落地產業級應用從概念驗證走向生產
2018-2020BERT 系預訓練模型 + GNN 興起抽取與推論能力大幅提升
2021-2023GraphRAG、LLM+KG 範式討論大型模型時代下的圖譜價值重估
2023-至今LLM輔助圖譜建置、知識增強推論圖譜從”儲存工具”轉向”推論引擎”

技術路線對比

維度規則+模板統計NLP深度學習LLM+KG 混合
建置成本高(專家寫規則)中高(需標註資料)中(LLM降低標註需求)
精度(高置信)中高高(配合人工稽核)
召回率中高
可解釋性可調
領域遷移差(需重寫規則)中(微調)較好(Prompt切換)
適用階段成熟行業、小規模過渡期大規模建置當前前沿
典型工具正則/規則引擎CRF/OpenNLPHuggingFace/DeepKELangChain+Neo4j/RAG

上下游

上游

環節內容代表形態
資料供給文件、報告、資料庫、API企業內部資料、公開資料集
NLP 模型預訓練語言模型、NER/RE 模型BERT、GPT系列、開源NLP工具包
計算基礎設施GPU/算力、雲端服務公有雲端、私有化部署
領域專家本體設計、資料標註、質量稽核諮詢公司、行業研究團隊

下游

環節內容價值
智慧問答基於圖譜的事實問答提升LLM回答的準確性與可溯源性
推薦系統利用實體關係做冷啟動/解釋增強推薦的可解釋性
風控/合規關聯分析、異常路徑檢測降低金融欺詐、洗錢風險
藥物研發靶點發現、副作用預測縮短研發週期
知識管理企業知識沉澱與檢索降低人員流動帶來的知識流失

關鍵指標

指標含義行業基準(定性)
三元組數量圖譜規模大型行業圖譜通常達億級至十億級
實體型別數本體豐富度金融圖譜可達數十至上百種
關係型別數關係多樣性通常與實體型別同量級或更多
F1-score(抽取)NER/RE 準確率精心調優可達 0.85+ [視資料集]
圖譜完整度缺失三元組比例高質量圖譜需持續補全
更新延遲新知識入庫時間即時/準即時為佳
查詢延遲圖遍歷響應時間毫秒至秒級(檢視規模)
推論準確率連結預測/問答正確率場景差異大,無統一基準

供需與市場資料

市場規模

⚠️ 注意:以下資料為行業研究報告常見口徑的定性描述,具體數字因報告來源而異,需以實際報告為準。

  • 全球知識圖譜市場:處於快速增長期,多家諮詢機構預估複合年增長率(CAGR)在兩位數區間 [行業報告估算]
  • 中國市場:金融、醫藥、政務為主要落地行業,政府推動數字化轉型提供政策助力
  • 企業採購特徵:多為專案制,少數頭部廠商提供標準化產品

供需格局

供給側需求側
圖資料庫廠商(提供底層儲存)金融機構(風控、合規)
AI 解決方案商(提供建置服務)醫藥企業(研發加速)
諮詢公司(本體設計、落地)政府/公共安全(情報分析)
雲端廠商(一體化平台)製造/能源(供應鏈管理)

競爭格局(定性)

  • 圖資料庫:國際以 Neo4j、TigerGraph 為代表;國內有 NebulaGraph(開源)、創鄰科技、星環科技等
  • 解決方案:國際有 Palantir(Gotham/Foundry)、Diffbot;國內有海乂知、明略科技、百度知識圖譜等
  • 開源生態:Apache Jena、RDF4J、OpenKG 中文開放知識圖譜社群

代表公司與資本對映

領域代表公司定位資本狀態(截至知識截止)
圖資料庫Neo4j全球領先屬性圖資料庫多輪融資,估值數十億美元級 [公開報道]
圖資料庫TigerGraph分散式圖分析多輪融資 [公開報道]
圖資料庫NebulaGraph(vesoft)開源分散式圖資料庫國內多輪融資 [公開報道]
解決方案Palantir (PLTR)資料分析+知識圖譜平台紐交所上市
解決方案明略科技企業級知識圖譜+AI多輪融資 [公開報道]
解決方案海乂知知識圖譜建置平台多輪融資 [公開報道]
綜合AI百度/阿里/華為大廠內部知識圖譜能力已上市

⚠️ 以上公司資訊基於公開資料,具體估值/輪次以實際揭露為準。


投資邏輯

看多邏輯

  1. LLM 時代知識圖譜價值重估:大型模型幻覺問題推動 RAG+KG 架構普及,圖譜從”可選”變”剛需”
  2. 企業資料資產化:政策推動資料要素市場建設,知識圖譜是資料治理的核心工具
  3. 垂直行業滲透率低:除金融外,醫藥、政務、製造等行業滲透率仍處早期
  4. 國產替代需求:圖資料庫、AI 工具鏈的國產化有政策和安全驅動

風險與挑戰

  1. 商業模式驗證不充分:多數圖譜專案為定製化,難以規模化複製,毛利率受限
  2. LLM 的替代威脅:如果大型模型直接具備足夠推論能力,部分圖譜場景可能被繞過
  3. 建設週期長、ROI 難量化:企業決策者對”知識圖譜能帶來多少收益”認知不足
  4. 人才稀缺:同時懂行業和懂圖譜技術的複合型人才供給有限

關注指標

  • 圖資料庫廠商的 ARR 增速
  • 行業解決方案合同金額與復購率
  • RAG+KG 方案的企業採用率變化

常見誤讀糾偏

誤讀一:「知識圖譜已被 LLM 淘汰」

糾偏:LLM 和知識圖譜解決的是不同層次的問題。

  • LLM 擅長語言理解和生成,但對事實的精確性無法保證(幻覺問題)
  • 知識圖譜提供的是顯式、可審計、可追溯的結構化知識
  • 當前主流架構是 LLM + KG 協同(如 GraphRAG),而非二選一
  • 圖譜的價值在於”約束”和”增強”,而非”替代”

誤讀二:「知識圖譜 = 畫個關係圖」

糾偏:關係視覺化只是冰山一角。

  • 知識圖譜的核心資產是本體設計 + 質量資料 + 推論能力
  • 儲存層涉及分散式圖資料庫、索引最佳化、查詢規劃
  • 推論層涉及圖嵌入、規則引擎、路徑搜尋
  • 僅用視覺化工具畫節點-邊連線不等於”建了知識圖譜”

誤讀三:「通用大型模型不需要行業圖譜」

糾偏:通用模型在長尾、專業、合規場景仍需外部知識增強。

  • 通用 LLM 訓練資料存在時效性限制
  • 行業特有的本體關係(如藥品的臨床試驗入排標準)無法被通用模型完全覆蓋
  • 合規場景要求知識來源可審計,圖譜提供這種能力

學習路徑

入門

  1. 概念理解:閱讀 Google Knowledge Graph Blog(2012)及後續科普
  2. 動手實踐:用 Neo4j Aura 免費版跑通 Cypher 查詢,載入一個公開資料集
  3. 推薦閱讀:劉知遠等《知識圖譜與機器學習》系列教程

進階

  1. 技術棧掌握
    • NER/RE:HuggingFace Transformers + NER/RE 示例任務
    • 圖嵌入:PyKEEN 或 DGL-KE 庫,跑 TransE/RotatE
    • 圖資料庫:Neo4j 或 NebulaGraph 官方教程
  2. 論文閱讀
    • 知識表示:TransE (Bordes et al., 2013)、RotatE (Sun et al., 2019)
    • 資訊抽取:CasRel (Wei et al., 2020)、DocRED
    • 圖神經網路:GCN、GAT 基礎論文

產業認知

  1. 行業報告:關注 IDC、Gartner、艾瑞等機構的知識圖譜/圖資料庫市場報告
  2. 開源社群:OpenKG(中文開放知識圖譜社群)、NebulaGraph 社群
  3. 案例研究:閱讀 Palantir、明略科技等公司的公開案例

一句話總結

行業知識圖譜是把行業專家腦中的網狀知識顯式地、機器可讀地結構化儲存,配合推論引擎實現事實查詢與智慧決策;在 LLM 時代,它從”Nice-to-have”升級為”約束幻覺、增強可信”的關鍵基礎設施。


延伸閱讀與來源

基礎論文

  • Bordes, A. et al. (2013). Translating Embeddings for Modeling Multi-relational Data. NeurIPS.
  • Sun, Z. et al. (2019). RotatE: Knowledge Graph Embedding by Relational Rotation in Complex Space. ICLR.
  • Wei, Z. et al. (2020). A Novel Cascade Binary Tagging Framework for Relational Triple Extraction. ACL.
  • Hogan, A. et al. (2021). Knowledge Graphs. ACM Computing Surveys.

技術教程

  • Stanford CS224W: Machine Learning with Graphs(圖機器學習經典課程)
  • Neo4j GraphAcademy(圖資料庫官方教程)
  • 劉知遠團隊:知識圖譜教程系列(清華大學)

行業報告(建議檢索最新版本)

  • Gartner: Market Guide for Graph Database Management Systems
  • IDC: 中國知識圖譜市場分析
  • 艾瑞諮詢/億歐智庫:知識圖譜行業研究

開源資源


免責宣告:本頁為概念學習參考,不構成投資建議。市場資料與公司資訊基於公開資料整理,具體數字以官方揭露為準。技術事實基於截至訓練資料的行業共識,新進展請查閱最新文獻。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型