应用层 开放阅读

数据湖仓

Lakehouse

概念 ID
lakehouse
更新时间
2026-05-29
来源数量
待补

数据湖仓

1. 3 秒看懂

一句话概括: 数据湖仓(Lakehouse)是一种将数据湖的灵活性、低成本与数据仓库的管理性、高性能结合在一起的统一数据管理架构。 核心图标: 🏞️(数据湖) + 🏢(数据仓库) = 🏠(数据湖仓) 关键价值: 在同一份数据上,既能支撑 BI 分析与报表,也能支持 AI/ML 与实时应用,无需数据冗余移动。

2. 3 分钟产业解释

问题起源: 传统企业数据架构长期存在“两层皮”问题。数据仓库(Teradata、Vertica、Exadata 等)擅长结构化数据分析,提供完整 ACID 事务和高并发查询,但成本高昂,处理半结构化/非结构化数据能力弱,扩容弹性有限。数据湖(基于 Hadoop 或云对象存储)能以极低成本存储任意格式的数据,却缺乏事务管理、模式强制与治理能力,极易退化为“数据沼泽”,无法直接支持高质量 BI 报表和实时分析。企业被迫在两套系统之间构建昂贵的 ETL/ELT 管道,导致数据延时、冗余存储、口径不一致和高额运维成本。

产业解法: 数据湖仓应运而生。它直接在低成本的对象存储(如 Amazon S3、Azure Data Lake Storage、Google Cloud Storage)之上,增加了一层结构化管理和开放表格式层(Delta Lake、Apache Iceberg、Apache Hudi 等)。这一层提供数据库级的 ACID 事务、模式演进、数据版本控制、高效查询优化与统一元数据管理。

产业角色变化:

  • 对企业: 简化数据架构,降低总拥有成本(TCO),消除多副本冗余,实现统一治理,加速从数据到决策的周期。
  • 对开发者: 通过 SQL、Python、Spark 等统一接口即可访问全部数据,大幅提升人效。
  • 对云厂商与平台商: 湖仓已成为云数据平台的核心战场。Databricks、Snowflake、AWS、Azure、Google Cloud 及众多开源社区在此激烈角逐,推动开放格式与引擎性能快速演进。

3. 技术原理

数据湖仓的核心技术基石是开放表格式统一元数据管理。以下为简化架构层次示意:

graph TD
    subgraph “消费层 (计算引擎)”
        A[BI/SQL 引擎]
        B[数据科学/ML]
        C[流处理引擎]
    end

    subgraph “湖仓核心层 (软件定义)”
        D[统一元数据目录
(表定义、血缘、权限)]
        E[开放表格式引擎
(Delta/Iceberg/Hudi)
(事务日志、 ACID、 时间旅行)]
    end

    subgraph “存储层 (原始数据)”
        F[(低成本对象存储
(S3/ADLS/GCS)
(Parquet/ORC文件))]
    end

    A & B & C --> D & E;
    D & E --> F;

写入路径: 写入引擎先将数据文件写入对象存储,再原子性地提交事务日志(如 _delta_log/ 下的 JSON 文件,或 Iceberg 的 manifest 文件)。只有日志更新成功,本次写入才对所有读取可见。 读取路径: 查询到来时,元数据目录解析表名,表格式引擎读取最新事务日志确定需扫描的数据文件列表,然后利用列统计信息进行数据跳过,再将下推的计划交给高性能引擎(如 Photon、Trino)执行。 关键机制:

  • ACID 事务: 采用乐观并发控制,支持串行隔离,保证多用户读写下的数据一致性。
  • 模式演进: 安全地增删或重命名列,无需重写全量数据。
  • 时间旅行与版本回溯: 通过快照,可查询历史数据或进行回滚,满足审计与实验需求。
  • 下推优化: 利用 Parquet/ORC 文件级别的列统计信息(min/max)跳过无关文件,显著降低扫描成本。

4. 关键参数

评估一个湖仓实现是否成熟,可参考下表的关键参数。表中尽可能给出量化边界或典型值,并标注口径与来源。

参数定义与衡量典型值/目标来源
交互式查询延迟对 PB 级数据执行标准 BI 查询的 P95 延迟< 2 秒(对仪表板查询);TPC-DS 10 TB 基准下 Photon 引擎可比传统 Spark SQL 快 10–20 倍Databricks 2023 年性能博客
写入并发并发写入的同时保持 ACID 的能力Delta Lake 实测支持每秒数千次小文件提交;Iceberg 支持数万次写入并发的元数据合并社区基准,2023
存储成本存储层每 GB/月成本(不包含计算)云对象存储约 0.02–0.03 美元/GB/月(如 AWS S3 标准存储,美国东部地区)AWS S3 定价页,2024
元数据扩展能力单一表可管理的文件上限Iceberg 单表可管理数十亿文件量级的元数据,已用于 Netflix 等生产环境Netflix 技术博客,2022
时间旅行深度默认保留的历史快照天数企业部署常见为 7–30 天,可依据合规要求延长公开资料整理
开放可移植性表格式被不同工具、引擎集成的广度Apache Iceberg 被 10+ 主流引擎原生支持(Spark、Trino、Flink、Presto、Dremio、Snowflake、BigQuery 等)各引擎官方文档,2024
治理粒度支持列/行级安全与动态脱敏Unity Catalog、Amazon Lake Formation 支持列级别细粒度访问控制产品文档,2023–2024

5. 技术路线

湖仓的概念落地依赖三条不同起点的技术路线,它们的演进正趋于收敛。

  1. 从数据湖向上生长(湖原生路线): 以 Databricks 为代表,基于 Apache Spark 和大规模对象存储,推出 Delta Lake,在数据湖上直接叠加事务、管理与性能层,形成一站式 Lakehouse Platform。开源 Delta Lake 治理层 Unity Catalog 也于 2022 年开源。
  2. 从数据仓库向外延展(仓原生路线): 以 Snowflake 为代表,从高性能弹性数仓出发,逐步支持读取外部湖存储(External Tables)、引入 Iceberg 表格式,并推出开源 Polaris Catalog(2024 年)来管理跨引擎的 Iceberg 表。
  3. 云厂商组合式路线: AWS、Azure、Google Cloud 通过原生服务组合(对象存储 + 元数据目录 + 分布式查询引擎 + 数仓服务)构建湖仓解决方案,例如 AWS 的 S3 + Glue + Athena/Redshift Spectrum,Azure 的 Microsoft Fabric(2024 年 5 月正式 GA),GCP 的 BigLake 等。该路线强调生态兼容,但易导致架构碎片化。

此外,开放表格式自身的路线竞争也对湖仓有决定性影响。截至 2024 年中,Apache Iceberg 因设计简洁、引擎中立,获得最广泛的多厂商支持,正向事实标准演进。Apache Hudi 在增量实时处理、数据变更捕获场景仍占有独特优势。

6. 上游

湖仓的上游由数据源与云基础设施构成。

  • 数据源:

    • 关系型数据库: MySQL、PostgreSQL、Oracle、SQL Server,通过 CDC 工具(如 Debezium)实时流入湖仓。
    • 事件流与日志: Kafka、Pulsar、Amazon Kinesis 提供实时流数据,是湖仓实时分析层的主要输入。Confluent(Kafka 商业化公司)2023 年总收入为 7.77 亿美元(来源:Confluent 2023 10-K)。
    • SaaS 与 API: Salesforce、Workday 等应用的数据经由 Fivetran、Airbyte 等集成工具批量或近实时加载。
    • IoT/设备: 工业传感器、车联网设备产生的时序海量数据。
  • 基础设施:

    • 云对象存储: Amazon S3、Azure Data Lake Storage、Google Cloud Storage 占据绝大部分湖仓存储市场。据 Synergy Research Group 2023 年第四季度数据,全球公有云 IaaS 市场中 AWS 占比 32%,Azure 23%,Google Cloud 11%(来源:Synergy Research Group, Q4 2023)。
    • 容器与编排: Kubernetes 为自建湖仓提供弹性计算和存算分离底座。
    • 网络与安全: 跨区域数据同步、私有连接及加密密钥管理构成上游安全基础。

7. 下游

湖仓的服务对象覆盖数据分析、机器学习与实时应用三大领域。

  • 商业智能(BI)与可视分析: Tableau、Microsoft Power BI、Looker、ThoughtSpot 等通过标准 SQL 访问湖仓。据 Gartner 2023 年分析与商业智能平台魔力象限,微软、Salesforce(Tableau)和 Qlik 位于领导者象限,湖仓兼容性已成为 BI 选型重要指标。
  • 数据科学与机器学习: Jupyter Notebook、Databricks Runtime for ML、Amazon SageMaker、Google Vertex AI 等直接读取湖仓数据,进行特征工程、训练与模型管理。MLflow 已成为链接湖仓与实验管理的桥梁,2023 年被 Linux 基金会接纳为托管项目,社区活跃度持续攀升。
  • 实时运营与数据服务: 流处理引擎(如 Apache Flink、Spark Structured Streaming)消费湖仓中的增量数据,驱动实时推荐、反欺诈、供应链监控等场景。湖仓还可通过 REST API 将数据产品化,嵌入业务应用。

8. 受益公司

以下公司或项目因湖仓架构普及而在业务或生态上受益。此处仅描述事实与公开财务数据,不构成任何投资建议。

  • Databricks: 湖仓范式的核心倡导者,提供统一 Lakehouse Platform。2023 年 9 月,公司宣布年度经常性收入(ARR)超过 15 亿美元,同比增长超 50%(来源:Databricks 新闻稿,2023 年 9 月)。投资方在 2023 年给予的估值约为 430 亿美元(来源:Bloomberg 报道,2023 年 9 月)。
  • Snowflake: 从云数仓向湖仓方向演进,支持 Iceberg 表与外部湖存储。2024 财年(截至 2024 年 1 月 31 日)产品收入 26.65 亿美元,同比增长 38%(来源:Snowflake FY2024 10-K)。截至 2024 年 6 月,市值约 500 亿美元(来源:YCharts)。
  • 云厂商(AWS、Azure、GCP): 湖仓消耗对象存储、计算与数据服务,推动整体云消费。三大厂商均把湖仓相关的数据与分析服务列为核心增长引擎。
  • Confluent: 实时数据流基础设施提供者,Kafka 是湖仓流式写入的关键组件。2023 年总收入 7.77 亿美元(来源:Confluent 2023 10-K)。
  • dbt Labs: 数据转换与建模工具 dbt 是湖仓 ELT 流水线的核心环节,受益于湖仓 SQL 化趋势。2023 年完成融资,估值约 42 亿美元(来源:TechCrunch,2023 年 2 月),但未公开营收数据。
  • 开源项目(Apache Iceberg、Hudi、Delta Lake、Trino): 虽不直接产生收入,但其采用率攀升间接推动了商业支撑厂商(如 Tabular、Onehouse、Starburst)的兴起,并降低了企业在湖仓上的总拥有成本。

9. 市场规模

湖仓直接对应的市场尚无独立统一定义,但涵盖数据湖、数据仓库、数据治理与分析平台等多个细分领域。下列数字均标注年份、口径与来源:

  • 数据湖市场: 据 Fortune Business Insights 2023 年 9 月发布的报告,全球数据湖市场 2022 年规模为 92.9 亿美元,预计到 2029 年将增长至 396.4 亿美元,复合年增长率(CAGR)23.0%(来源:Fortune Business Insights, Report Code FBI106590, 2023)。
  • 数据库管理系统(DBMS)市场: Gartner 在 2024 年 4 月预测,2024 年全球 DBMS 市场收入将达 1012 亿美元,同比增长 12.5%,其中云数据库服务是主要增量(来源:Gartner, April 2024)。
  • 云数据平台市场: 据 IDC 2023 年发布的《全球大数据与分析软件市场预测》,大数据与分析软件市场规模在 2027 年将超过 3000 亿美元。湖仓作为支撑分析、AI 的统一底座,被视为该市场增长的核心牵引力之一。
  • 整体数据集成与完整性市场: IDC 曾预测 2026 年该市场将达 128 亿美元,但 2024 年后公开更新的准确数字未见。

综合来看,湖仓架构所对应的云数据管理市场(包含存储、计算、查询、治理)整体规模在 2024 年已超过千亿美元,且持续高速增长。

10. 玩家对比

下面对比主要湖仓相关方案,信息截至 2024 年中,来源于公开产品文档、公司公告和行业报告。

维度Databricks LakehouseSnowflakeAWS 原生服务Microsoft FabricGoogle Cloud BigLake
定位统一湖仓平台,从湖原生角度构建从云数仓向外延展至湖组合式,模块化,适合技术能力强团队SaaS 化的一体化数据平台统一存储层 + BigQuery Omni
核心表格式Delta Lake(默认),兼容 IcebergIceberg(外部表)偏好 Iceberg,Glue Catalog 支持多种格式Delta(Fabric 内默认),兼容 IcebergIceberg 原生支持
元数据/治理Unity Catalog(2022 年开源)Horizon Catalog/Polaris Catalog(2024 年开源)AWS Glue Catalog + Lake FormationOneLake 统一元数据层 + PurviewDataplex(治理)
开放程度较开放,Unity Catalog 开源,但深度集成自有平台中等,Polaris Catalog 开源,存储与计算引擎仍为闭源高,服务组合基于开源引擎(Trino/Presto/Spark)中,Fabric 闭源,底层 OneLake 格式开放较高,BigLake 兼容开放格式
近期财务/规模ARR 超 15 亿美元(2023 年 9 月);员工约 6000 人2024 财年产品收入 26.65 亿美元;员工约 7000 人未单独披露数据服务收入,AWS 年收入超 900 亿美元未单独披露 Fabric 营收,Azure 收入增长强劲未单独披露,GCP 年收入超 330 亿美元
代表客户Shell、AT&T、WalgreensCapital One、Novartis、JetBlue广泛,Vanguard、Nielsen 等毕马威、普华永道Vodafone、Cisco

重要补充: 开源方案(如 Iceberg + Trino/Spark + Nessie/Project Nessie 元数据)正在被中小企业与追求多云自由的企业采用,虽然缺乏单厂商支持,但灵活性与成本优势显著。

11. 风险

湖仓虽代表融合方向,但在实际落地与投资决策中需正视以下风险:

  • 供应商锁定风险: 采用特定厂商一体化平台(如 Databricks 或 Snowflake)虽能加速交付,但在格式、元数据和治理层可能形成事实锁定。虽然 Iceberg 等开放格式降低了数据层锁定,但上层工具、安全和运维流程的迁移成本依然很高。
  • 技术复杂性: 自建湖仓(如组合 Iceberg、Trino、Flink、Spark 等)要求团队具备较强的分布式系统运维与调优能力,否则容易出现小文件膨胀、元数据性能瓶颈、并发冲突等问题,导致实际 TCO 不降反升。
  • 数据治理落地难度: 统一元数据目录的建立需要打破部门壁垒,推动全企业统一数据标准与权限模型,组织变革成本常被低估。
  • 实时与批处理融合挑战: 实时写入、增量读取与大规模批处理共享同一份表时,可能出现性能抖动、读写冲突,需要精细配置并发控制策略,缺乏全自动化方案。
  • 安全与合规: 湖仓统一了所有数据资产,也变相放大了安全事件的波及面。细粒度访问控制(列、行级)的实现和审计复杂性远高于传统单系统架构。
  • 成本不可预见性: 存算分离架构下,查询高峰期的计算资源弹性扩张可能带来超预期的账单,需要精细的成本监控与优化机制。

12. 误读纠偏

误读一:“湖仓就是要淘汰数据仓库和数据湖。” 纠偏: 湖仓不是替代,而是融合与升级。它保留了数据湖的存储低成本和多模态优势,吸收了数据仓库的事务和管理能力。多数企业是在现有湖和仓基础上逐步演进,而非彻底推倒重来。最终形态是互补的“湖仓一体”环境,而非“只留其一”。

误读二:“湖仓是一个可以‘开箱即用’的产品。” 纠偏: 湖仓本质上是一种架构设计模式。虽有 Databricks Lakehouse Platform、Microsoft Fabric 这类一体化产品,但更多自建湖仓是拼合开放表格式(如 Iceberg)、元数据目录(如 Glue Catalog、Nessie)、计算引擎(如 Trino、Spark)与治理工具的成果,需要较强的架构设计与工程能力。

误读三:“采用了 Delta 或 Iceberg 就等于建成了湖仓。” 纠偏: 开放表格式只是湖仓的关键组成部分。完整的湖仓还需涵盖统一元数据管理、细粒度安全和访问控制、引擎优化层(如 Photon、Velox)、AI/ML 与流处理的原生集成。只解决事务问题,不等于解决了数据孤岛、性能与治理。

误读四:“湖仓天然比数据仓库便宜。” 纠偏: 存储层面确实便宜,但如果不能有效进行查询优化和资源治理,计算成本可能极高。在重度、持续高并发的 BI 场景下,商业数仓的专有优化和预留实例模式有时总体成本更低。需要根据工作负载特性综合评估。

13. 最新事件

以下为 2023–2024 年行业重要里程碑,展示湖仓领域的加速收敛:

  • 2024 年 6 月 – Databricks 收购 Tabular: Databricks 宣布收购由 Apache Iceberg 核心作者创立的 Tabular,旨在弥合 Iceberg 与 Delta Lake 的兼容性鸿沟,推动跨格式统一体验(来源:Databricks 新闻,2024 年 6 月 4 日)。
  • 2024 年 6 月 – Snowflake 开源 Polaris Catalog: Snowflake 在 2024 年峰会上发布并开源面向 Apache Iceberg 的目录服务 Polaris Catalog,成为中立的元数据管理层,被多家引擎集成(来源:Snowflake 新闻,2024 年 6 月)。
  • 2024 年 5 月 – Microsoft Fabric 正式通用: 微软宣布 Fabric 对所有客户 GA,将数据湖 OneLake、数据工厂、Synapse 数据仓库、Power BI 等统一为 SaaS 产品,直接推动湖仓在企业中低代码化(来源:微软新闻,2024 年 5 月)。
  • 2023 年 10 月 – Apache Iceberg 1.3 发布: 增强了对加密、性能下推和视图的支持,稳固了其作为企业级标准表格式的地位(来源:Apache Iceberg 博客)。
  • 2023 年 7 月 – Databricks 发布 LakehouseIQ: 利用大语言模型(LLM)理解数据语义,用户可用自然语言进行数据发现与查询,进一步降低湖仓使用门槛(来源:Databricks 博客)。
  • 2023 年 3 月 – dbt Labs 推出 dbt Mesh: 支持跨团队、跨项目的湖仓数据建模协作,标志着数据转换层在湖仓生态中走向规模化治理(来源:dbt Labs 博客)。

上述事件共同指向一个趋势:湖仓正从“多格式、多协议”的混乱竞争走向“ Iceberg 为中心,多引擎协作”的标准化时代,同时融入 AI/LLM 能力。

14. 跟踪指标

建议持续跟踪以下指标,以监控湖仓架构的成熟度与市场变化。数字均标注时间与来源,不确定处写“公开资料未见”。

  • 格式采用度:
    • Apache Iceberg GitHub Star 数:截至 2024 年 6 月,约 6200(来源:GitHub)。
    • Apache Hudi GitHub Star 数:约 5500(来源:GitHub)。
    • 主流引擎对 Iceberg 的支持情况:超过 15 个引擎原生支持 Iceberg 读写(来源:iceberg.apache.org 官网,2024)。
  • 平台业绩增速:
    • Databricks ARR 增速:2023 年 9 月宣布 ARR 超 15 亿美元,年增长 50%+。(来源:Databricks 新闻)。
    • Snowflake 产品收入增速:2024 财年 38%(来源:10-K),并关注其下一财年指引。
  • 查询引擎性能基准: TPC-DS 10 TB/100 TB 基准测试排名,关注 Trino、Spark、Starburst、Databricks SQL 及专有引擎的最新公开结果(如每年 Data+AI Summit 披露)。
  • 开源元数据服务 Activity: Nessie、Apache Gravitino(2024 年毕业为顶级项目)等项目的 GitHub 活跃贡献者数、发布频率,反映多云治理的成熟度。
  • 企业案例数: 云厂商(AWS/Azure/GCP)每年公布的湖仓客户数量与大客户迁移案例。Microsoft Fabric 自 GA 以来尚未公布详细数量(公开资料未见),需关注其财年电话会。
  • 人才需求: LinkedIn、Indeed 等平台与“Lakehouse”、“Iceberg”、“Delta Lake
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型