應用層 開放閱讀

資料湖倉

Lakehouse

概念 ID
lakehouse
更新時間
2026-05-29
來源數量
待補

資料湖倉

1. 3 秒看懂

一句話概括: 資料湖倉(Lakehouse)是一種將資料湖的靈活性、低成本與資料倉儲的管理性、高效能結合在一起的統一資料管理架構。 核心圖示: 🏞️(資料湖) + 🏢(資料倉儲) = 🏠(資料湖倉) 關鍵價值: 在同一份資料上,既能支撐 BI 分析與報表,也能支援 AI/ML 與即時應用,無需資料冗餘移動。

2. 3 分鐘產業解釋

問題起源: 傳統企業資料架構長期存在“兩層皮”問題。資料倉儲(Teradata、Vertica、Exadata 等)擅長結構化資料分析,提供完整 ACID 事務和高併發查詢,但成本高昂,處理半結構化/非結構化資料能力弱,擴容彈性有限。資料湖(基於 Hadoop 或雲端物件儲存)能以極低成本儲存任意格式的資料,卻缺乏事務管理、模式強制與治理能力,極易退化為“資料沼澤”,無法直接支援高質量 BI 報表和即時分析。企業被迫在兩套系統之間建置昂貴的 ETL/ELT 管道,導致資料延時、冗餘儲存、口徑不一致和高額運維成本。

產業解法: 資料湖倉應運而生。它直接在低成本的物件儲存(如 Amazon S3、Azure Data Lake Storage、Google Cloud Storage)之上,增加了一層結構化管理和開放表格式層(Delta Lake、Apache Iceberg、Apache Hudi 等)。這一層提供資料庫級的 ACID 事務、模式演進、資料版本控制、高效查詢最佳化與統一後設資料管理。

產業角色變化:

  • 對企業: 簡化資料架構,降低總擁有成本(TCO),消除多副本冗餘,實現統一治理,加速從資料到決策的週期。
  • 對開發者: 通過 SQL、Python、Spark 等統一介面即可訪問全部資料,大幅提升人效。
  • 對雲端廠商與平台商: 湖倉已成為雲端資料平台的核心戰場。Databricks、Snowflake、AWS、Azure、Google Cloud 及眾多開源社群在此激烈角逐,推動開放格式與引擎效能快速演進。

3. 技術原理

資料湖倉的核心技術基石是開放表格式統一後設資料管理。以下為簡化架構層次示意:

graph TD
    subgraph “消費層 (計算引擎)”
        A[BI/SQL 引擎]
        B[資料科學/ML]
        C[流處理引擎]
    end

    subgraph “湖倉核心層 (軟體定義)”
        D[統一後設資料目錄
(表定義、血緣、權限)]
        E[開放表格式引擎
(Delta/Iceberg/Hudi)
(事務日誌、 ACID、 時間旅行)]
    end

    subgraph “儲存層 (原始資料)”
        F[(低成本物件儲存
(S3/ADLS/GCS)
(Parquet/ORC檔案))]
    end

    A & B & C --> D & E;
    D & E --> F;

寫入路徑: 寫入引擎先將資料檔案寫入物件儲存,再原子性地提交事務日誌(如 _delta_log/ 下的 JSON 檔案,或 Iceberg 的 manifest 檔案)。只有日誌更新成功,本次寫入才對所有讀取可見。 讀取路徑: 查詢到來時,後設資料目錄解析表名,表格式引擎讀取最新事務日誌確定需掃描的資料檔案列表,然後利用列統計資訊進行資料跳過,再將下推的計劃交給高效能引擎(如 Photon、Trino)執行。 關鍵機制:

  • ACID 事務: 採用樂觀併發控制,支援序列隔離,保證多使用者讀寫下的資料一致性。
  • 模式演進: 安全地增刪或重新命名列,無需重寫全量資料。
  • 時間旅行與版本回溯: 通過快照,可查詢歷史資料或進行回滾,滿足審計與實驗需求。
  • 下推最佳化: 利用 Parquet/ORC 檔案級別的列統計資訊(min/max)跳過無關檔案,顯著降低掃描成本。

4. 關鍵引數

評估一個湖倉實現是否成熟,可參考下表的關鍵引數。表中儘可能給出量化邊界或典型值,並標註口徑與來源。

引數定義與衡量典型值/目標來源
互動式查詢延遲對 PB 級資料執行標準 BI 查詢的 P95 延遲< 2 秒(對儀表板查詢);TPC-DS 10 TB 基準下 Photon 引擎可比傳統 Spark SQL 快 10–20 倍Databricks 2023 年效能部落格
寫入併發併發寫入的同時保持 ACID 的能力Delta Lake 實測支援每秒數千次小檔案提交;Iceberg 支援數萬次寫入併發的後設資料合併社群基準,2023
儲存成本儲存層每 GB/月成本(不包含計算)雲端物件儲存約 0.02–0.03 美元/GB/月(如 AWS S3 標準儲存,美國東部地區)AWS S3 定價頁,2024
後設資料擴充套件能力單一表可管理的檔案上限Iceberg 單表可管理數十億檔案量級的後設資料,已用於 Netflix 等生產環境Netflix 技術部落格,2022
時間旅行深度預設保留的歷史快照天數企業部署常見為 7–30 天,可依據合規要求延長公開資料整理
開放可移植性表格式被不同工具、引擎整合的廣度Apache Iceberg 被 10+ 主流引擎原生支援(Spark、Trino、Flink、Presto、Dremio、Snowflake、BigQuery 等)各引擎官方文件,2024
治理粒度支援列/行級安全與動態脫敏Unity Catalog、Amazon Lake Formation 支援列級別細粒度訪問控制產品文件,2023–2024

5. 技術路線

湖倉的概念落地依賴三條不同起點的技術路線,它們的演進正趨於收斂。

  1. 從資料湖向上生長(湖原生路線): 以 Databricks 為代表,基於 Apache Spark 和大規模物件儲存,推出 Delta Lake,在資料湖上直接疊加事務、管理與效能層,形成一站式 Lakehouse Platform。開源 Delta Lake 治理層 Unity Catalog 也於 2022 年開源。
  2. 從資料倉儲向外延展(倉原生路線): 以 Snowflake 為代表,從高效能彈性數倉出發,逐步支援讀取外部湖儲存(External Tables)、引入 Iceberg 表格式,並推出開源 Polaris Catalog(2024 年)來管理跨引擎的 Iceberg 表。
  3. 雲端廠商組合式路線: AWS、Azure、Google Cloud 通過原生服務組合(物件儲存 + 後設資料目錄 + 分散式查詢引擎 + 數倉服務)建置湖倉解決方案,例如 AWS 的 S3 + Glue + Athena/Redshift Spectrum,Azure 的 Microsoft Fabric(2024 年 5 月正式 GA),GCP 的 BigLake 等。該路線強調生態相容,但易導致架構碎片化。

此外,開放表格式自身的路線競爭也對湖倉有決定性影響。截至 2024 年中,Apache Iceberg 因設計簡潔、引擎中立,獲得最廣泛的多廠商支援,正向事實標準演進。Apache Hudi 在增量即時處理、資料變更捕獲場景仍佔有獨特優勢。

6. 上游

湖倉的上游由資料來源與雲端基礎設施構成。

  • 資料來源:

    • 關係型資料庫: MySQL、PostgreSQL、Oracle、SQL Server,通過 CDC 工具(如 Debezium)即時流入湖倉。
    • 事件流與日誌: Kafka、Pulsar、Amazon Kinesis 提供即時流資料,是湖倉即時分析層的主要輸入。Confluent(Kafka 商業化公司)2023 年總營收為 7.77 億美元(來源:Confluent 2023 10-K)。
    • SaaS 與 API: Salesforce、Workday 等應用的資料經由 Fivetran、Airbyte 等整合工具批次或近即時載入。
    • IoT/裝置: 工業感測器、車聯網裝置產生的時序海量資料。
  • 基礎設施:

    • 雲端物件儲存: Amazon S3、Azure Data Lake Storage、Google Cloud Storage 佔據絕大部分湖倉儲存市場。據 Synergy Research Group 2023 年第四季度資料,全球公有雲端 IaaS 市場中 AWS 佔比 32%,Azure 23%,Google Cloud 11%(來源:Synergy Research Group, Q4 2023)。
    • 容器與編排: Kubernetes 為自建湖倉提供彈性計算和存算分離底座。
    • 網路與安全: 跨區域資料同步、私有連線及加密金鑰管理構成上游安全基礎。

7. 下游

湖倉的服務物件覆蓋資料分析、機器學習與即時應用三大領域。

  • 商業智慧(BI)與可視分析: Tableau、Microsoft Power BI、Looker、ThoughtSpot 等通過標準 SQL 訪問湖倉。據 Gartner 2023 年分析與商業智慧平台魔力象限,微軟、Salesforce(Tableau)和 Qlik 位於領導者象限,湖倉相容性已成為 BI 選型重要指標。
  • 資料科學與機器學習: Jupyter Notebook、Databricks Runtime for ML、Amazon SageMaker、Google Vertex AI 等直接讀取湖倉資料,進行特徵工程、訓練與模型管理。MLflow 已成為連結湖倉與實驗管理的橋樑,2023 年被 Linux 基金會接納為託管專案,社群活躍度持續攀升。
  • 即時運營與資料服務: 流處理引擎(如 Apache Flink、Spark Structured Streaming)消費湖倉中的增量資料,驅動即時推薦、反欺詐、供應鏈監控等場景。湖倉還可通過 REST API 將資料產品化,嵌入業務應用。

8. 受益公司

以下公司或專案因湖倉架構普及而在業務或生態上受益。此處僅描述事實與公開財務資料,不構成任何投資建議。

  • Databricks: 湖倉範式的核心倡導者,提供統一 Lakehouse Platform。2023 年 9 月,公司宣佈年度經常性營收(ARR)超過 15 億美元,年增率增長超 50%(來源:Databricks 新聞稿,2023 年 9 月)。投資方在 2023 年給予的估值約為 430 億美元(來源:Bloomberg 報道,2023 年 9 月)。
  • Snowflake: 從雲端數倉向湖倉方向演進,支援 Iceberg 表與外部湖儲存。2024 財年(截至 2024 年 1 月 31 日)產品營收 26.65 億美元,年增率增長 38%(來源:Snowflake FY2024 10-K)。截至 2024 年 6 月,市值約 500 億美元(來源:YCharts)。
  • 雲端廠商(AWS、Azure、GCP): 湖倉消耗物件儲存、計算與資料服務,推動整體雲端消費。三大廠商均把湖倉相關的資料與分析服務列為核心增長引擎。
  • Confluent: 即時資料流基礎設施提供者,Kafka 是湖倉流式寫入的關鍵元件。2023 年總營收 7.77 億美元(來源:Confluent 2023 10-K)。
  • dbt Labs: 資料轉換與建模工具 dbt 是湖倉 ELT 流水線的核心環節,受益於湖倉 SQL 化趨勢。2023 年完成融資,估值約 42 億美元(來源:TechCrunch,2023 年 2 月),但未公開營收資料。
  • 開源專案(Apache Iceberg、Hudi、Delta Lake、Trino): 雖不直接產生營收,但其採用率攀升間接推動了商業支撐廠商(如 Tabular、Onehouse、Starburst)的興起,並降低了企業在湖倉上的總擁有成本。

9. 市場規模

湖倉直接對應的市場尚無獨立統一定義,但涵蓋資料湖、資料倉儲、資料治理與分析平台等多個細分領域。下列數字均標註年份、口徑與來源:

  • 資料湖市場: 據 Fortune Business Insights 2023 年 9 月釋出的報告,全球資料湖市場 2022 年規模為 92.9 億美元,預計到 2029 年將增長至 396.4 億美元,複合年增長率(CAGR)23.0%(來源:Fortune Business Insights, Report Code FBI106590, 2023)。
  • 資料庫管理系統(DBMS)市場: Gartner 在 2024 年 4 月預測,2024 年全球 DBMS 市場營收將達 1012 億美元,年增率增長 12.5%,其中雲端資料庫服務是主要增量(來源:Gartner, April 2024)。
  • 雲端資料平台市場: 據 IDC 2023 年釋出的《全球大數據與分析軟體市場預測》,大數據與分析軟體市場規模在 2027 年將超過 3000 億美元。湖倉作為支撐分析、AI 的統一底座,被視為該市場增長的核心牽引力之一。
  • 整體資料整合與完整性市場: IDC 曾預測 2026 年該市場將達 128 億美元,但 2024 年後公開更新的準確數字未見。

綜合來看,湖倉架構所對應的雲端資料管理市場(包含儲存、計算、查詢、治理)整體規模在 2024 年已超過千億美元,且持續高速增長。

10. 玩家對比

下面對比主要湖倉相關方案,資訊截至 2024 年中,來源於公開產品文件、公司公告和行業報告。

維度Databricks LakehouseSnowflakeAWS 原生服務Microsoft FabricGoogle Cloud BigLake
定位統一湖倉平台,從湖原生角度建置從雲端數倉向外延展至湖組合式,模組化,適合技術能力強團隊SaaS 化的一體化資料平台統一儲存層 + BigQuery Omni
核心表格式Delta Lake(預設),相容 IcebergIceberg(外部表)偏好 Iceberg,Glue Catalog 支援多種格式Delta(Fabric 內預設),相容 IcebergIceberg 原生支援
後設資料/治理Unity Catalog(2022 年開源)Horizon Catalog/Polaris Catalog(2024 年開源)AWS Glue Catalog + Lake FormationOneLake 統一後設資料層 + PurviewDataplex(治理)
開放程度較開放,Unity Catalog 開源,但深度整合自有平台中等,Polaris Catalog 開源,儲存與計算引擎仍為閉源高,服務組合基於開源引擎(Trino/Presto/Spark)中,Fabric 閉源,底層 OneLake 格式開放較高,BigLake 相容開放格式
近期財務/規模ARR 超 15 億美元(2023 年 9 月);員工約 6000 人2024 財年產品營收 26.65 億美元;員工約 7000 人未單獨揭露資料服務營收,AWS 年營收超 900 億美元未單獨揭露 Fabric 營收,Azure 營收增長強勁未單獨揭露,GCP 年營收超 330 億美元
代表客戶Shell、AT&T、WalgreensCapital One、Novartis、JetBlue廣泛,Vanguard、Nielsen 等畢馬威、普華永道Vodafone、Cisco

重要補充: 開源方案(如 Iceberg + Trino/Spark + Nessie/Project Nessie 後設資料)正在被中小企業與追求多雲端自由的企業採用,雖然缺乏單廠商支援,但靈活性與成本優勢顯著。

11. 風險

湖倉雖代表融合方向,但在實際落地與投資決策中需正視以下風險:

  • 供應商鎖定風險: 採用特定廠商一體化平台(如 Databricks 或 Snowflake)雖能加速交付,但在格式、後設資料和治理層可能形成事實鎖定。雖然 Iceberg 等開放格式降低了資料層鎖定,但上層工具、安全和運維流程的遷移成本依然很高。
  • 技術複雜性: 自建湖倉(如組合 Iceberg、Trino、Flink、Spark 等)要求團隊具備較強的分散式系統運維與調優能力,否則容易出現小檔案膨脹、後設資料效能瓶頸、併發衝突等問題,導致實際 TCO 不降反升。
  • 資料治理落地難度: 統一後設資料目錄的建立需要打破部門壁壘,推動全企業統一資料標準與權限模型,組織變革成本常被低估。
  • 即時與批處理融合挑戰: 即時寫入、增量讀取與大規模批處理共享同一份表時,可能出現效能抖動、讀寫衝突,需要精細配置併發控制策略,缺乏全自動化方案。
  • 安全與合規: 湖倉統一了所有資料資產,也變相放大了安全事件的波及面。細粒度訪問控制(列、行級)的實現和審計複雜性遠高於傳統單系統架構。
  • 成本不可預見性: 存算分離架構下,查詢高峰期的計算資源彈性擴張可能帶來超預期的賬單,需要精細的成本監控與最佳化機制。

12. 誤讀糾偏

誤讀一:“湖倉就是要淘汰資料倉儲和資料湖。” 糾偏: 湖倉不是替代,而是融合與升級。它保留了資料湖的儲存低成本和多模態優勢,吸收了資料倉儲的事務和管理能力。多數企業是在現有湖和倉基礎上逐步演進,而非徹底推倒重來。最終形態是互補的“湖倉一體”環境,而非“只留其一”。

誤讀二:“湖倉是一個可以‘開箱即用’的產品。” 糾偏: 湖倉本質上是一種架構設計模式。雖有 Databricks Lakehouse Platform、Microsoft Fabric 這類一體化產品,但更多自建湖倉是拼合開放表格式(如 Iceberg)、後設資料目錄(如 Glue Catalog、Nessie)、計算引擎(如 Trino、Spark)與治理工具的成果,需要較強的架構設計與工程能力。

誤讀三:“採用了 Delta 或 Iceberg 就等於建成了湖倉。” 糾偏: 開放表格式只是湖倉的關鍵組成部分。完整的湖倉還需涵蓋統一後設資料管理、細粒度安全和訪問控制、引擎最佳化層(如 Photon、Velox)、AI/ML 與流處理的原生整合。只解決事務問題,不等於解決了資料孤島、效能與治理。

誤讀四:“湖倉天然比資料倉儲便宜。” 糾偏: 儲存層面確實便宜,但如果不能有效進行查詢最佳化和資源治理,計算成本可能極高。在重度、持續高併發的 BI 場景下,商業數倉的專有最佳化和預留例項模式有時總體成本更低。需要根據工作負載特性綜合評估。

13. 最新事件

以下為 2023–2024 年行業重要里程碑,展示湖倉領域的加速收斂:

  • 2024 年 6 月 – Databricks 收購 Tabular: Databricks 宣佈收購由 Apache Iceberg 核心作者創立的 Tabular,旨在彌合 Iceberg 與 Delta Lake 的相容性鴻溝,推動跨格式統一體驗(來源:Databricks 新聞,2024 年 6 月 4 日)。
  • 2024 年 6 月 – Snowflake 開源 Polaris Catalog: Snowflake 在 2024 年峰會上釋出並開源面向 Apache Iceberg 的目錄服務 Polaris Catalog,成為中立的後設資料管理層,被多家引擎整合(來源:Snowflake 新聞,2024 年 6 月)。
  • 2024 年 5 月 – Microsoft Fabric 正式通用: 微軟宣佈 Fabric 對所有客戶 GA,將資料湖 OneLake、資料工廠、Synapse 資料倉儲、Power BI 等統一為 SaaS 產品,直接推動湖倉在企業中低程式碼化(來源:微軟新聞,2024 年 5 月)。
  • 2023 年 10 月 – Apache Iceberg 1.3 釋出: 增強了對加密、效能下推和檢視的支援,穩固了其作為企業級標準表格式的地位(來源:Apache Iceberg 部落格)。
  • 2023 年 7 月 – Databricks 釋出 LakehouseIQ: 利用大語言模型(LLM)理解資料語義,使用者可用自然語言進行資料發現與查詢,進一步降低湖倉使用門檻(來源:Databricks 部落格)。
  • 2023 年 3 月 – dbt Labs 推出 dbt Mesh: 支援跨團隊、跨專案的湖倉資料建模協作,標誌著資料轉換層在湖倉生態中走向規模化治理(來源:dbt Labs 部落格)。

上述事件共同指向一個趨勢:湖倉正從“多格式、多協議”的混亂競爭走向“ Iceberg 為中心,多引擎協作”的標準化時代,同時融入 AI/LLM 能力。

14. 追蹤指標

建議持續追蹤以下指標,以監控湖倉架構的成熟度與市場變化。數字均標註時間與來源,不確定處寫“公開資料未見”。

  • 格式採用度:
    • Apache Iceberg GitHub Star 數:截至 2024 年 6 月,約 6200(來源:GitHub)。
    • Apache Hudi GitHub Star 數:約 5500(來源:GitHub)。
    • 主流引擎對 Iceberg 的支援情況:超過 15 個引擎原生支援 Iceberg 讀寫(來源:iceberg.apache.org 官網,2024)。
  • 平台業績增速:
    • Databricks ARR 增速:2023 年 9 月宣佈 ARR 超 15 億美元,年增長 50%+。(來源:Databricks 新聞)。
    • Snowflake 產品營收增速:2024 財年 38%(來源:10-K),並關注其下一財年展望。
  • 查詢引擎效能基準: TPC-DS 10 TB/100 TB 基準測試排名,關注 Trino、Spark、Starburst、Databricks SQL 及專有引擎的最新公開結果(如每年 Data+AI Summit 揭露)。
  • 開源後設資料服務 Activity: Nessie、Apache Gravitino(2024 年畢業為頂級專案)等專案的 GitHub 活躍貢獻者數、釋出頻率,反映多雲端治理的成熟度。
  • 企業案例數: 雲端廠商(AWS/Azure/GCP)每年公佈的湖倉客戶數量與大客戶遷移案例。Microsoft Fabric 自 GA 以來尚未公佈詳細數量(公開資料未見),需關注其財年電話會。
  • 人才需求: LinkedIn、Indeed 等平台與“Lakehouse”、“Iceberg”、“Delta Lake
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型