应用层 开放阅读

行业知识图谱

Domain Knowledge Graph

概念 ID
domain-knowledge-graph
更新时间
2026-05-29
来源数量
待补

行业知识图谱 (Domain Knowledge Graph)

3 秒看懂

一句话:把某个行业的专业知识——人、事、物、规则、流程——用「实体-关系-实体」的图结构存储起来,让机器能”读懂”并推理。

关键词:结构化知识 | 图数据库 | 三元组 | 实体关系抽取 | 行业语义层

3 分钟产业解释

它解决什么问题?

传统数据库存的是”行与列”,适合记录交易、日志;但行业专家脑子里的知识是网状的——“这个药靶向哪个通路”、“这个芯片供应商的上游是谁”、“这笔转账经过了哪些壳公司”。

行业知识图谱就是把这种网状知识显式地、机器可读地建模出来。

和通用知识图谱的区别

维度通用知识图谱行业知识图谱
覆盖范围跨领域(维基类)单一行业纵深
实体类型人物、地点、事件行业专有本体(芯片型号、临床试验、贸易单据等)
构建方式众包 + 自动抽取领域专家 + 小模型 + 规则
数据敏感度公开数据常涉及商业机密、合规数据
精度要求容忍噪声高精度、需人工审核

落地场景(定性)

  • 金融:企业关联图谱、反洗钱链路追踪、信贷风控
  • 医药:药物-靶点-疾病关系、临床试验入排标准推理
  • 工业/制造:设备-故障-维修方案关联、供应链溯源
  • 政务/法律:案件要素抽取、法规适用推理

15 分钟专家深入

1. 构建范式的演进

阶段一:纯人工(专家逐条录入,成本极高)
    ↓
阶段二:规则 + 模板匹配(正则、依存句法)
    ↓
阶段三:统计NLP(CRF实体识别 + 远程监督关系抽取)
    ↓
阶段四:深度学习(BERT/BiLSTM 抽取 + GNN 推理)
    ↓
阶段五:LLM + KG 协同(大模型做抽取/补全,KG做事实约束)

当前主流:阶段四与阶段五并存。纯用LLM抽取仍存在”幻觉”风险,因此高精度行业场景普遍采用”LLM抽取 + 人工审核 + 图数据库存储”的混合流程。

2. 本体设计——图谱的骨架

行业图谱的核心壁垒不是技术,而是本体(Ontology)设计——即”定义这个行业有哪些实体类型、关系类型、属性”。

本体设计质量决定了图谱的可用性上限。

示例(金融领域,定性):

实体类型:公司、自然人、基金、债券、监管机构...
关系类型:持股、担保、关联交易、董监高任职...
属性:注册资本、成立日期、实际控制人...

这一步依赖行业专家,技术手段难以完全替代。

3. 与 LLM 的竞合关系

能力LLM知识图谱
事实准确性易幻觉高(显式存储)
可解释性弱(黑盒)强(路径可追溯)
动态更新需重训/微调实时写入
推理泛化强(隐式)弱(需规则/嵌入)
长尾知识强(只要建了就有)

产业共识:二者互补而非替代。RAG(检索增强生成)+ KG 是当前企业级 AI 应用的主流架构。


技术原理

核心数据结构:三元组

知识图谱的最小单元是三元组

(头实体, 关系, 尾实体)

示例:

(辉瑞, 研发药物, Paxlovid)
(Paxlovid, 靶向蛋白, Mpro)
(Mpro, 所属病毒, SARS-CoV-2)

大量三元组构成有向属性图(Directed Property Graph)。

构建流水线

┌─────────────────────────────────────────────────────────────────┐
│                     行业知识图谱构建流程                          │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  [非结构化数据]        [结构化数据]         [外部知识库]          │
│  文档/报告/网页        数据库/表格          Wikidata/行业词表      │
│        │                   │                      │             │
│        ▼                   ▼                      ▼             │
│  ┌──────────┐     ┌──────────────┐      ┌──────────────┐       │
│  │ NER 命名  │     │ Schema 映射  │      │ 实体对齐     │       │
│  │ 实体识别  │     │ 结构化转换   │      │ Entity       │       │
│  └────┬─────┘     └──────┬───────┘      │ Linking      │       │
│       │                  │              └──────┬───────┘       │
│       ▼                  ▼                     ▼               │
│  ┌──────────┐     ┌──────────────┐                            │
│  │ 关系抽取  │     │ 知识融合     │                            │
│  │ RE       │     │ 去重/消歧    │                            │
│  └────┬─────┘     └──────┬───────┘                            │
│       │                  │                                     │
│       └────────┬─────────┘                                     │
│                ▼                                                │
│  ┌──────────────────────────────┐                              │
│  │      质量评估 & 入库          │                              │
│  │  图数据库(Neo4j/Nebula等)  │                              │
│  └──────────────────────────────┘                              │
│                                                                 │
└─────────────────────────────────────────────────────────────────┘

关键技术模块

① 命名实体识别(NER)

  • 传统:BiLSTM-CRF
  • 当前主流:预训练语言模型微调(BERT-NER 等)
  • 行业难点:专业术语、嵌套实体、缩写消歧

② 关系抽取(RE)

  • 管道式:先NER再RE
  • 联合抽取:一步到位(CasRel、TPLinker 等架构)
  • 文档级抽取:跨句关系建模(CoIn、DocRED数据集推动)

③ 实体对齐与消歧

  • 不同数据源中同一实体的合并(如”腾讯”、“腾讯控股”、“0700.HK”指向同一节点)
  • 方法:字符串相似度 + 图嵌入 + 人工兜底

④ 图嵌入与推理

  • 将实体/关系映射到低维向量空间
  • 经典模型(定性,非最新):TransE(翻译模型)、RotatE(旋转模型)、CompGCN(图卷积)
  • 用途:链接预测(补全缺失三元组)、节点分类

⑤ 图数据库与查询

  • 存储引擎:Neo4j(属性图)、NebulaGraph(分布式)、TigerGraph、JanusGraph
  • 查询语言:Cypher(Neo4j)、nGQL(Nebula)、Gremlin(Apache TinkerPop)
  • 与关系型数据库对比:图遍历中单节点邻居访问复杂度通常为 O(d)(d 为节点的出度),但免索引邻接使得多跳遍历的总成本呈线性增长,而非关系表 JOIN 的指数爆炸

技术演进史

时期里程碑意义
1960s-1990s语义网络(Semantic Network)图结构表示知识的早期探索
1998-2000s语义网(Semantic Web)、RDF/OWL 标准W3C 推动的标准化尝试,但工业采用有限
2012Google Knowledge Graph 发布”Things, not strings”,引爆产业关注
2013-2014TransE 提出知识图谱嵌入研究的起点
2015-2017金融/医疗行业图谱落地产业级应用从概念验证走向生产
2018-2020BERT 系预训练模型 + GNN 兴起抽取与推理能力大幅提升
2021-2023GraphRAG、LLM+KG 范式讨论大模型时代下的图谱价值重估
2023-至今LLM辅助图谱构建、知识增强推理图谱从”存储工具”转向”推理引擎”

技术路线对比

维度规则+模板统计NLP深度学习LLM+KG 混合
构建成本高(专家写规则)中高(需标注数据)中(LLM降低标注需求)
精度(高置信)中高高(配合人工审核)
召回率中高
可解释性可调
领域迁移差(需重写规则)中(微调)较好(Prompt切换)
适用阶段成熟行业、小规模过渡期大规模构建当前前沿
典型工具正则/规则引擎CRF/OpenNLPHuggingFace/DeepKELangChain+Neo4j/RAG

上下游

上游

环节内容代表形态
数据供给文档、报告、数据库、API企业内部数据、公开数据集
NLP 模型预训练语言模型、NER/RE 模型BERT、GPT系列、开源NLP工具包
计算基础设施GPU/算力、云服务公有云、私有化部署
领域专家本体设计、数据标注、质量审核咨询公司、行业研究团队

下游

环节内容价值
智能问答基于图谱的事实问答提升LLM回答的准确性与可溯源性
推荐系统利用实体关系做冷启动/解释增强推荐的可解释性
风控/合规关联分析、异常路径检测降低金融欺诈、洗钱风险
药物研发靶点发现、副作用预测缩短研发周期
知识管理企业知识沉淀与检索降低人员流动带来的知识流失

关键指标

指标含义行业基准(定性)
三元组数量图谱规模大型行业图谱通常达亿级至十亿级
实体类型数本体丰富度金融图谱可达数十至上百种
关系类型数关系多样性通常与实体类型同量级或更多
F1-score(抽取)NER/RE 准确率精心调优可达 0.85+ [视数据集]
图谱完整度缺失三元组比例高质量图谱需持续补全
更新延迟新知识入库时间实时/准实时为佳
查询延迟图遍历响应时间毫秒至秒级(视图规模)
推理准确率链接预测/问答正确率场景差异大,无统一基准

供需与市场数据

市场规模

⚠️ 注意:以下数据为行业研究报告常见口径的定性描述,具体数字因报告来源而异,需以实际报告为准。

  • 全球知识图谱市场:处于快速增长期,多家咨询机构预估复合年增长率(CAGR)在两位数区间 [行业报告估算]
  • 中国市场:金融、医药、政务为主要落地行业,政府推动数字化转型提供政策助力
  • 企业采购特征:多为项目制,少数头部厂商提供标准化产品

供需格局

供给侧需求侧
图数据库厂商(提供底层存储)金融机构(风控、合规)
AI 解决方案商(提供构建服务)医药企业(研发加速)
咨询公司(本体设计、落地)政府/公共安全(情报分析)
云厂商(一体化平台)制造/能源(供应链管理)

竞争格局(定性)

  • 图数据库:国际以 Neo4j、TigerGraph 为代表;国内有 NebulaGraph(开源)、创邻科技、星环科技等
  • 解决方案:国际有 Palantir(Gotham/Foundry)、Diffbot;国内有海乂知、明略科技、百度知识图谱等
  • 开源生态:Apache Jena、RDF4J、OpenKG 中文开放知识图谱社区

代表公司与资本映射

领域代表公司定位资本状态(截至知识截止)
图数据库Neo4j全球领先属性图数据库多轮融资,估值数十亿美元级 [公开报道]
图数据库TigerGraph分布式图分析多轮融资 [公开报道]
图数据库NebulaGraph(vesoft)开源分布式图数据库国内多轮融资 [公开报道]
解决方案Palantir (PLTR)数据分析+知识图谱平台纽交所上市
解决方案明略科技企业级知识图谱+AI多轮融资 [公开报道]
解决方案海乂知知识图谱构建平台多轮融资 [公开报道]
综合AI百度/阿里/华为大厂内部知识图谱能力已上市

⚠️ 以上公司信息基于公开资料,具体估值/轮次以实际披露为准。


投资逻辑

看多逻辑

  1. LLM 时代知识图谱价值重估:大模型幻觉问题推动 RAG+KG 架构普及,图谱从”可选”变”刚需”
  2. 企业数据资产化:政策推动数据要素市场建设,知识图谱是数据治理的核心工具
  3. 垂直行业渗透率低:除金融外,医药、政务、制造等行业渗透率仍处早期
  4. 国产替代需求:图数据库、AI 工具链的国产化有政策和安全驱动

风险与挑战

  1. 商业模式验证不充分:多数图谱项目为定制化,难以规模化复制,毛利率受限
  2. LLM 的替代威胁:如果大模型直接具备足够推理能力,部分图谱场景可能被绕过
  3. 建设周期长、ROI 难量化:企业决策者对”知识图谱能带来多少收益”认知不足
  4. 人才稀缺:同时懂行业和懂图谱技术的复合型人才供给有限

关注指标

  • 图数据库厂商的 ARR 增速
  • 行业解决方案合同金额与复购率
  • RAG+KG 方案的企业采用率变化

常见误读纠偏

误读一:「知识图谱已被 LLM 淘汰」

纠偏:LLM 和知识图谱解决的是不同层次的问题。

  • LLM 擅长语言理解和生成,但对事实的精确性无法保证(幻觉问题)
  • 知识图谱提供的是显式、可审计、可追溯的结构化知识
  • 当前主流架构是 LLM + KG 协同(如 GraphRAG),而非二选一
  • 图谱的价值在于”约束”和”增强”,而非”替代”

误读二:「知识图谱 = 画个关系图」

纠偏:关系可视化只是冰山一角。

  • 知识图谱的核心资产是本体设计 + 质量数据 + 推理能力
  • 存储层涉及分布式图数据库、索引优化、查询规划
  • 推理层涉及图嵌入、规则引擎、路径搜索
  • 仅用可视化工具画节点-边连线不等于”建了知识图谱”

误读三:「通用大模型不需要行业图谱」

纠偏:通用模型在长尾、专业、合规场景仍需外部知识增强。

  • 通用 LLM 训练数据存在时效性限制
  • 行业特有的本体关系(如药品的临床试验入排标准)无法被通用模型完全覆盖
  • 合规场景要求知识来源可审计,图谱提供这种能力

学习路径

入门

  1. 概念理解:阅读 Google Knowledge Graph Blog(2012)及后续科普
  2. 动手实践:用 Neo4j Aura 免费版跑通 Cypher 查询,加载一个公开数据集
  3. 推荐阅读:刘知远等《知识图谱与机器学习》系列教程

进阶

  1. 技术栈掌握
    • NER/RE:HuggingFace Transformers + NER/RE 示例任务
    • 图嵌入:PyKEEN 或 DGL-KE 库,跑 TransE/RotatE
    • 图数据库:Neo4j 或 NebulaGraph 官方教程
  2. 论文阅读
    • 知识表示:TransE (Bordes et al., 2013)、RotatE (Sun et al., 2019)
    • 信息抽取:CasRel (Wei et al., 2020)、DocRED
    • 图神经网络:GCN、GAT 基础论文

产业认知

  1. 行业报告:关注 IDC、Gartner、艾瑞等机构的知识图谱/图数据库市场报告
  2. 开源社区:OpenKG(中文开放知识图谱社区)、NebulaGraph 社区
  3. 案例研究:阅读 Palantir、明略科技等公司的公开案例

一句话总结

行业知识图谱是把行业专家脑中的网状知识显式地、机器可读地结构化存储,配合推理引擎实现事实查询与智能决策;在 LLM 时代,它从”Nice-to-have”升级为”约束幻觉、增强可信”的关键基础设施。


延伸阅读与来源

基础论文

  • Bordes, A. et al. (2013). Translating Embeddings for Modeling Multi-relational Data. NeurIPS.
  • Sun, Z. et al. (2019). RotatE: Knowledge Graph Embedding by Relational Rotation in Complex Space. ICLR.
  • Wei, Z. et al. (2020). A Novel Cascade Binary Tagging Framework for Relational Triple Extraction. ACL.
  • Hogan, A. et al. (2021). Knowledge Graphs. ACM Computing Surveys.

技术教程

  • Stanford CS224W: Machine Learning with Graphs(图机器学习经典课程)
  • Neo4j GraphAcademy(图数据库官方教程)
  • 刘知远团队:知识图谱教程系列(清华大学)

行业报告(建议检索最新版本)

  • Gartner: Market Guide for Graph Database Management Systems
  • IDC: 中国知识图谱市场分析
  • 艾瑞咨询/亿欧智库:知识图谱行业研究

开源资源


免责声明:本页为概念学习参考,不构成投资建议。市场数据与公司信息基于公开资料整理,具体数字以官方披露为准。技术事实基于截至训练数据的行业共识,新进展请查阅最新文献。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型