應用層 開放閱讀

本地 RAG

Local RAG

本地 RAG 把向量資料庫和大語言模型完整部署在使用者裝置或內網伺服器上,讓敏感資料不出域也能完成檢索增強生成。

概念 ID
local-rag
更新時間
2026-05-29
來源數量
待補
Compassing AI 上下文 評估本地 RAG 的硬體路線、隱私價值和部署邊界。
4900萬臺
AI PC 出貨
IDC 2024 年全球 AI PC 出貨量, MDX 引用
本地 RAG MDX · 2026-05-29
1.5億臺
2025 預測
IDC Worldwide AI PC Forecast, 2025-01
本地 RAG MDX · 2026-05-29
120萬臺
邊緣 AI 伺服器
Counterpoint 2024 年出貨口徑, MDX 引用
本地 RAG MDX · 2026-05-29
產業信號
  • AI PC、邊緣工作站和輕量向量庫同步成熟,降低本地 RAG 門檻。
  • 資料主權和行業合規需求推動金融、法律、醫療等場景採用私有部署。
口徑風險
  • 本地 RAG 不能完全替代雲端端方案,高併發和大型模型能力仍受硬體約束。
  • 硬體達標不等於效果達標,仍需知識庫治理、分塊、檢索和評測。

本地 RAG 位於哪條鏈?

本地 RAG MDX · 2026-05-29
應用層 / 私有知識問答與邊緣推論

MDX 強調其全程在企業防火牆內執行,核心價值是資料不出域和合規。

上游依賴
  • 本地 GPU/NPU/CPU 和統一記憶體
  • 本地向量資料庫與嵌入模型
  • Ollama、llama.cpp、vLLM 等推論引擎
下游承接
  • 金融、法律、醫療、政務和製造業內網知識系統
  • AI PC 和邊緣工作站
  • 資料主權要求高的企業問答

相關公司

MDX 提及的產業參與者
  • NVIDIA RTX/Jetson 與 TensorRT-LLM
  • Intel Core Ultra / Xeon
  • AMD Ryzen AI / GPU
  • Qualcomm 驍龍 X Elite NPU
  • Apple M 系列統一記憶體
  • Zilliz Milvus Lite

本地部署路線怎麼分?

本地 RAG MDX · 2026-05-29

GPU 工作站/小型伺服器

RTX 4080/4090 或專業 GPU 搭配 vLLM、Ollama 和輕量向量庫。

中小團隊和高合規部門

AI PC 原生方案

Core Ultra、Ryzen AI、驍龍 X Elite、Apple M 系列結合本地執行時。

個人高隱私和輕量任務

純 CPU/統一記憶體

Apple Silicon、APU 或含 HBM CPU 跑量化模型和大知識庫。

低併發、大記憶體場景

相鄰概念鏈

便於橫向跳轉

來源台賬

數字與判斷口徑
來源類型截至
本地 RAG MDX mdx 2026-05-29
source: concept-rich schema · as_of 2026-05-29 富區塊僅用於產業鏈學習、信息檢索和研究輔助;不構成投資建議。

本地 RAG

3 秒看懂

本地 RAG(Local Retrieval-Augmented Generation)是將檢索增強生成系統的兩個核心——向量資料庫大語言模型(LLM)——完整部署在使用者自有裝置或內網伺服器上執行的技術範式。它讓企業敏感資料在不離開本地網路的前提下,完成“檢索相關文件→基於文件生成答案”的閉環,從根本上解決資料外洩與合規風險。

3 分鐘產業解釋

一家投資銀行或律所內部沉澱了海量盡調報告、合同與客戶隱私資料。若使用雲端端 RAG 服務,這些檔案必須上傳至第三方伺服器進行向量化和推論,在金融監管和跨境資料流動規則下幾乎不可行。

本地 RAG 的解法是把流水線封裝在企業防火牆之內。員工在內網提問,查詢首先由本地部署的嵌入模型轉化為向量,再向本地向量資料庫執行相似度搜索,抽取出最相關的段落;這些片段與原始問題組合成提示詞,交給本地執行的 LLM 產出答案。全程資料不出域,天然滿足《資料安全法》、GDPR 等法規要求。

這催生了一個軟硬體交叉的新市場:能流暢執行 70 億–130 億引數模型和向量索引的高記憶體頻寬工作站、邊緣伺服器,為本地部署最佳化的輕量級向量資料庫,以及專為消費級硬體設計的量化小模型

技術原理

本地 RAG 技術棧自底向上分為三層,每一層都需針對本地資源約束做專門最佳化。

[本地使用者查詢]

[查詢理解/重寫層] (可由引數量<1B 的小模型或規則完成)

[1. 本地嵌入與檢索]
   - 本地嵌入模型(BGE、GTE 等量化版)將查詢向量化
   - 在本地向量索引中執行近似最近鄰搜尋(ANN)
   - 返回 Top‑K 相關片段

[2. 上下文建置]
   - 拼接檢索片段與系統提示詞、歷史對話
   - 裁剪至模型上下文視窗上限以內

[3. 本地 LLM 推論]
   - 量化後的模型在 GPU/NPU/CPU 上推論
   - 僅基於提供上下文生成答案

[輸出給使用者]

關鍵適配機制

  1. 嵌入模型本地化
    查詢和文件的向量化必須在本地完成,不能呼叫雲端端 API。要求嵌入模型本身輕量化,並與下游檢索的向量維度、歸一化方式嚴格一致。
  2. 本地向量索引的單機最佳化
    與雲端端分散式向量資料庫不同,本地方案受限於單機 DRAM 與 SSD。常用手段包括記憶體對映(mmap)、磁碟索引(如 DiskANN、乘積量化索引 PQ),並結合 CPU 友好的 ANN 演算法 HNSW 或 ScaNN,在召回率與延遲之間取得平衡。
  3. 模型量化與推論加速
    千億引數模型無法在單臺裝置執行,需使用 INT4/INT8 量化(GPTQ、AWQ、bitsandbytes),並輔以運算元融合、Flash Attention、Speculative Decoding 等技術,使消費級 GPU 或 NPU 可達到 20–50 tokens/s 的可用速度。
  4. 記憶體與儲存協同
    向量索引、模型權重、KV 快取三類實體競爭記憶體。系統需要在 DRAM、視訊記憶體(VRAM)與高速 NVMe SSD 之間做精細化分層,例如將注意力快取交換到 VRAM、非熱點索引落在 SSD。

關鍵引數

以下引數是衡量本地 RAG 方案能否滿足生產級需求的核心錨點。所有數值均為截至 2025 年中的行業參照,具體受硬體配置、模型選擇及知識庫規模影響。

引數定義典型量化目標(2025 年)說明/口徑
端到端首 Token 延遲使用者傳送請求至首 Token 返回的時間≤2 秒(單併發,7B 模型,RTX 4070 級別)含網路(本地環路)與檢索耗時;來源:多家架構社群基準(2024–2025)
生成吞吐量每秒可生成的 Token 數量30–60 tokens/s(7B INT4,單 GPU)受量化演算法、上下文長度影響;來源:NVIDIA TensorRT‑LLM 白皮書(2024)及第三方實測
檢索召回率@5前 5 個返回片段中包含正確答案的比例≥90%(針對 10 萬文件級知識庫)依賴於嵌入模型與索引演算法;來源:MTEB 基準各模型評測(2024)
記憶體佔用峰值執行時索引 + 模型權重 + KV 快取的總記憶體≤16 GB(7B INT4 + 百萬向量級索引)衡量日常硬體成本門檻;來源:開源架構部署指南綜合
知識庫更新延遲新增文件到可被檢索的時間視窗≤5 分鐘(增量更新,不重建全索引)包含分塊、嵌入、索引 upsert 等步驟;來源:Milvus Lite、Chroma 技術文件
最大知識庫容量單節點可穩定承載的向量總數500 萬–2000 萬條(768 維,有壓縮)超過上限需分庫或分層;來源:廠商最佳實踐及實測報告(2025)

技術路線

本地 RAG 的實現並非只有一種路徑,當前主流路線圍繞 硬體平台模型生態 分化,並決定效能邊界與適用場景。

路線一:異構算力工作站 / 小型伺服器(主流)

  • 硬體核心:NVIDIA RTX 4080/4090 或專業 GPU,輔以 AMD EPYC 或 Intel Xeon 處理器,192–256 GB 系統記憶體。
  • 軟體棧:vLLM、llama.cpp、Ollama 等推論引擎 + 嵌入式向量資料庫(Chroma、Milvus Lite)。
  • 適用:中小型團隊、合規要求高的企業部門。可承載單使用者高吞吐或 2–5 併發訪問。

路線二:AI PC 原生方案

  • 硬體核心:Intel Core Ultra(整合 NPU)、AMD Ryzen AI、高通驍龍 X Elite NPU、Apple M3/M4。
  • 軟體棧:作業系統級 AI 引擎(Windows DirectML、Apple Core ML、高通 AI Engine)+ ONNX Runtime 或 GGUF 模型。
  • 適用:個人極客、律師、醫生等單人高隱私場景。主打功耗敏感、無風扇可用的輕量任務。

路線三:純 CPU / 統一記憶體方案

  • 硬體核心:Apple Silicon 統一記憶體架構 Mac、AMD Instinct APU、Intel 下一代至強(含 HBM)。
  • 軟體棧:llama.cpp (Metal/CPU)、MLX。利用超大統一記憶體可執行 70B+ 量化模型。
  • 適用:低併發但需大知識庫、大型模型的場景,如法律文書審查。

技術趨勢:硬體 NPU 算力正從 10 TOPS 向 40–100 TOPS 快速攀升;模型側 4‑bit 量化技術的成熟使 13B 模型能在 16 GB 記憶體裝置上流暢執行;向量資料庫從雲端原生轉向 embeddable,支援完整 CRUD 和毫秒級檢索。預計 2025–2026 年,三大路線將在軟體抽象層走向收斂,使用者可“一次編譯、隨處推論”。

上游

本地 RAG 產業鏈上游聚焦在提供基礎算力、儲存和基礎軟體的環節。

  • 算力晶片
    GPU:NVIDIA(GeForce RTX 系列、Jetson 系列);AMD(Radeon RX、Instinct)。
    NPU/CPU:Intel(Core Ultra 整合 NPU)、高通(驍龍 X Elite)、Apple(M 系列 Neural Engine)、國內廠商(瑞芯微、算能等)。
    這些晶片廠商在 2024–2025 年將 AI 引擎視為核心賣點,推動本地推論能效比顯著提升。

  • 儲存與記憶體
    高速 DRAM(DDR5/LPDDR5X)、HBM(用於高階伺服器)及 NVMe SSD,決定向量索引的駐留能力與訪問延遲。據 TrendForce 2024 年 10 月報告,AI PC 推動的 DRAM 容量升級(16 GB→24 GB/32 GB)使行業需求年增率增長超 15%。

  • 基礎軟體與中介軟體
    作業系統內建的推論執行時(Windows Copilot Runtime、Apple Core ML、Linux 核心支援的異構記憶體管理)為本地 RAG 提供了底層介面。此外,編譯架構(ONNX、MLX、MLIR)將模型轉換並最佳化到不同硬體後端,成為關鍵“柔韌層”。上游不存在單一集中供應商,呈現“硬體+執行時”耦合的特點。

下游

下游應用由合規與效能需求驅動,行業分佈高度集中。

  • 金融業
    投資研究、反洗錢調查、內部合規問答。所有資料流水須在機構內部完成,系統審計日誌完整。(來源:中國人民銀行《金融資料安全 分級指南》及券商內部實踐調研,2024 年)

  • 法律與智慧財產權
    合同審查、判例檢索、智慧財產權分析。律所多采用內網部署的 RAG 一體機,避免客戶資料上傳至雲端。某國際律所 IT 顧問公開表示 2025 年本地 AI 預算增加 30% 以上(來源:Legaltech News, 2025 年 1 月)。

  • 醫療與製藥
    臨床病例分析、藥物副作用檢索。患者隱私法(HIPAA、國內《個人資訊保護法》)要求資料不動模型動。

  • 政府與國防
    涉密檔案問答、政策條文檢索。幾乎不採用任何雲端端 AI 服務,完全依賴本地或私有雲端部署。

  • 高階製造業
    產品設計文件、維修手冊的智慧助手,需要在無網路的生產線環境中執行。據公開資料,西門子、博世等企業已試點本地 RAG。

下游客戶的需求特點是安全 > 成本 > 絕對效能,並且希望以軟硬一體機(Appliance)形式獲得開箱即用體驗。

受益公司

以下公司處於本地 RAG 產業鏈關鍵環節,其業務可能因該趨勢而獲得增量機會。此處僅為產業參與方列示,不構成任何投資建議。

  • 輝達(NVIDIA):消費級 RTX 40/50 系列 GPU 和 TensorRT‑LLM 推論軟體棧是本地 RAG 的事實標準硬體之一。其 Jetson Orin 系列鎖定邊緣端。
  • 英特爾(Intel):Core Ultra NPU 推動 AI PC 概念,同時至強伺服器 CPU 適用純 CPU 推論場景。IDC 資料顯示英特爾在 2024 年 AI PC 處理器出貨中佔比領先(來源:IDC Quarterly PC Tracker, 2024Q4)。
  • AMD:銳龍 8040/8050 系列整合 Ryzen AI NPU;Radeon GPU 在中小規模本地推論中具備價效比。ROCm 生態逐步完善。
  • 高通(Qualcomm):驍龍 X Elite/Plus 平台 NPU 算力突出,已在多款 Windows on Arm 筆記本中部署本地推論能力。
  • Apple(Apple):M 系列晶片統一記憶體架構天然適合大型模型本地推論,開發者工具 MLX 吸引開源社群遷移。
  • 微軟:Phi 系列小模型、Windows Copilot Runtime 以及 Azure 本地邊緣方案(Azure Stack)提供端到端工具鏈。
  • Meta:開源 Llama 3.1 8B、70B 等模型,成為本地部署的主流基座之一。
  • 阿里巴巴:通義千問系列(Qwen)提供 1.8B–72B 多尺寸開源模型,部分預置量化版本可用於本地。
  • 深鑑求索(DeepSeek,未上市):DeepSeek‑V2/V3 等 MoE 模型雖引數總量大,但啟用引數少,社群已出現本地化部署嘗試。
  • Zilliz(未上市):Milvus 向量資料庫推出輕量版 Milvus Lite,可嵌入 Python 應用離線執行。

市場規模

本地 RAG 自身並未形成獨立品類的統計,但其價值可通過 AI PC、邊緣 AI 伺服器和本地推論軟體 等鄰近市場間接估量。

  • AI PC 出貨量:IDC 在 2025 年 1 月釋出的資料顯示,2024 年全球 AI PC(帶有專用 NPU 處理器)出貨量約為 4900 萬臺,預計 2025 年將達到 1.5 億臺(來源:IDC, Worldwide AI PC Forecast, 2025‑01)。其中支援本地執行 7B 級模型的“高階 AI PC”佔比約 15%,對應約 2250 萬臺裝置具備完整本地 RAG 潛力。
  • 邊緣 AI 伺服器/工作站:據 Counterpoint Research 2025 年 4 月報告,2024 年全球邊緣 AI 伺服器出貨約 120 萬臺,面向本地推論的專用工作站增長最快,涵蓋金融、醫療等領域。預計 2025 年該細分市場保持 40%+ 年增率增長。
  • 向量資料庫市場:嵌入式/輕量級向量資料庫是本地 RAG 的關鍵元件。Mordor Intelligence 2024 年報告預測全球向量資料庫市場將從 2024 年的 19 億美元增至 2029 年的 98 億美元(年複合增長率 39%),其中“本地部署許可”佔比約 25%(來源:Mordor Intelligence, Vector Database Market Report, 2024)。這意味本地化向量資料庫相關營收 2024 年約 4.7 億美元。
  • 私有化大型模型部署服務:據多家系統整合商調研,2024 年中國金融、政務行業本地化模型部署專案金額合計超 50 億元人民幣,30%+ 專案包含 RAG 能力(來源:公開招標資訊綜合,2024 年)。全球範圍內,該領域缺乏統一統計,公開資料暫未見精確彙總數字。

整體看,本地 RAG 直接拉動的硬體、軟體和服務市場在 2024 年已達數十億美元級別,並隨 AI PC 普及和企業資料主權意識提升而高速擴張。

玩家對比

按照技術陣營與產品形態,產業玩家可分為以下五類,各具特點和短板。

玩家類別代表公司/專案核心優勢關鍵弱點典型產品/服務
GPU 硬體巨頭輝達 (NVDA)、AMD (AMD)推論效能絕對領先、軟體棧成熟 (CUDA/ROCm)成本高、功耗大、專用 NPU 生態較弱RTX 4090 工作站、TensorRT‑LLM
AI PC 晶片平台Intel、高通、Apple、AMD (APU)大規模出貨、NPU 低功耗、AI PC 生態聚合算力有限(10–50 TOPS),暫時難以承載 13B+ 模型驍龍 X Elite PC、MacBook Air M4
開源大型模型提供商Meta (Llama)、阿里 (Qwen)、Mistral模型質量快速追趕閉源,社群量化版本豐富沒有自研推論硬體,依賴第三方硬體生態Llama 3.1 8B GGUF、Qwen2.5 量化
向量資料庫/工具公司Zilliz (Milvus Lite)、Chroma、LanceDB提供嵌入式、零依賴的本地檢索方案市場教育不足,很多企業仍不瞭解純本地部署Milvus Lite、Chroma 嵌入式模式
系統整合商與一體機戴爾、聯想、HPE、本地 OEM提供開箱即用的軟硬一體機,縮短部署週期溢價高、易受硬體更新週期拖累戴爾 PowerEdge 本地 AI 一體機

對比可見,本地 RAG 市場缺少“全棧壟斷者”,生態呈現 晶片-模型-資料庫-整合商 的多層協作結構。競爭的關鍵在於能否降低使用門檻(模型開箱最佳化)、降低總擁有成本(TCO)並快速響應行業合規需求。

風險

本地 RAG 在快速發展的同時,也面臨多重結構性風險。

  1. 模型能力缺口
    本地可執行的開源模型(7B–13B)在知識廣度、複雜推論和多語言能力上與雲端端頂級模型(GPT‑4o、Claude 3.5)存在代差。若本地模型無法通過微調/檢索彌補該差距,可能導致使用者放棄本地方案,迴歸雲端端。

  2. 工程化複雜性與隱性成本
    雖然“資料不出域”是核心賣點,但本地系統需要自行處理模型更新、索引維護、向量資料庫調優、安全補丁等。據多家企業 IT 部門估算,同等功能下本地 RAG 的運維人力成本是雲端方案的 2–3 倍(來源:Forrester Consulting 調研,2024 年 11 月)。若 TCO 超出預期,可能抑制中型企業採用。

  3. 硬體迭代風險
    NPU 算力、模型量化方法迭代極快。2024 年購買的頂級 AI PC 可能在 2026 年就已無法執行最新一代輕量化模型,導致資產提前貶值。企業可能因此推遲投入。

  4. 安全邊界模糊化
    模型一旦部署在本地,可能面臨內部越權訪問、推論 API 無鑑權等新安全問題。本地不代表絕對安全,缺乏雲端廠商的安全運營能力可能帶來新的資料洩漏敞口(來源:Gartner, “DevSecOps for Edge AI”, 2024)。

  5. 生態碎片化
    目前不同晶片平台的驅動、推論執行時互不相容,開發者需要適配多套工具鏈。標準化程序(如 ExecuTorch、QNN)尚在早期,可能延緩生態繁榮。

誤讀糾偏

  • 誤讀一:“本地 RAG 就是離線版聊天機器人,效能差,只適合玩具專案。”
    糾偏:本地 RAG 是面向企業關鍵業務的隱私增強架構。其效能在限定知識庫內可以達到或超過通用雲端模型。價值核心不是“效能第一”,而是“在資料絕對不外洩下的最佳可用性”。金融、法律等領域的本地 RAG 系統已承擔正式工作負載,絕非玩具。

  • 誤讀二:“本地 RAG 不用向量資料庫,直接開大上下文視窗即可。”
    糾偏:大語言模型的上下文視窗即使擴充套件至 128K tokens,也無法容納大型知識庫(如 10 萬份文件)。向量資料庫的職責是精確召回與問題最相關的幾條片段,避免噪聲淹沒有效資訊。沒有高效檢索,模型會因為上下文冗餘而生成不準確答案。本地 RAG 中,輕量向量資料庫是不可或缺的元件。

  • 誤讀三:“本地 RAG 能完全替代雲端端方案。”
    糾偏:二者並非替代關係,而是互補。本地 RAG 主要覆蓋合規剛需和高頻固定知識庫場景,雲端端 RAG 則適用於需要最新全球知識、超大型模型能力和彈性擴充套件的場景。混合部署(本地檢索 + 雲端端稽核推論)正在成為新趨勢。

  • 誤讀四:“只要硬體達標,部署本地 RAG 無需模型調優。”
    糾偏:通用模型直接用於本地特定知識問答,往往會出現幻覺或格式不符。仍需通過指令微調、提示詞工程甚至模型對齊來適配業務語境。硬體只是第一關,模型適配與資料工程才是決定成敗的關鍵。

最新事件

(統計節點:2024 年 1 月 至 2025 年 6 月)

  • 2024 年 5 月:微軟 Build 大會公佈 Phi‑3 家族,包含可在本地執行的視覺小模型 Phi‑3‑vision,並展示了在驍龍 X Elite NPU 上的執行影片。
  • 2024 年 6 月:Apple在 WWDC 推出 Apple Intelligence,明確強調所有個人資料理解均在裝置端完成,只有必要時才使用私有雲端運算。這直接推動了本地 RAG 理念走入消費級視野。
  • 2024 年 9 月:輝達釋出 RTX AI PC 套件,整合 TensorRT‑LLM 與本地向量搜尋示例,聯手聯想、華碩等 OEM 推廣本地 RAG 解決方案。
  • 2024 年 10 月:高通推出驍龍 8 Elite 移動平台,NPU 算力較上代提升 45%,支援直接執行量化後 10B 級模型,手機端本地 RAG 能力初現。
  • 2024 年 12 月:Meta 釋出 Llama 3.3 70B,並同時提供多種量化版本,社群在 24 小時內即實現基於 Mac Studio 的 70B 本地 RAG 部署。
  • 2025 年 2 月:阿里雲端開源 Qwen2.5-13B 及其輕量化版本,多家國內系統整合商推出基於該模型的本地 RAG 一體機,面向政務與製造業。
  • 2025 年 4 月:微軟宣佈 Windows Copilot Runtime 全面開放 NPU 程式設計介面,允許第三方向量資料庫在 NPU 上解除安裝 ANN 檢索計算,顯著降低延遲。
  • 2025 年 6 月:歐洲資料保護委員會(EDPB)釋出關於 AI 與資料本地化的指導意見,首次明確本地 RAG 架構在 GDPR 第 25 條“資料保護設計”中的合規優勢,推動歐洲企業加速評估本地方案。

(以上事件來自各公司官網新聞釋出、行業媒體 The Verge、Ars Technica、IT 之家等公開報道。)

追蹤指標

要把握本地 RAG 產業的脈動,需持續監測以下定量與定性指標。

技術指標

  1. 開源社群模型月度平均量化版本下載量:反映本地推論熱度。可追蹤 Hugging Face 模型卡上 GGUF/AWQ 檔案下載量。
  2. AI PC 季度出貨量及 NPU 算力中位數:來源為 IDC、Canalys 季度報告,算力可參考各晶片廠釋出引數。
  3. 主流推論架構(Ollama、llama.cpp)星數、外掛生態及新增硬體後端數量:表徵開發者普適性。
  4. STARV2 / MTEB 等基準中 7B 級模型檢索增強準確率:衡量模型+檢索適配水平。
  5. 本地向量資料庫的嵌入式版本效能基準:如 Chroma 在 10 萬量級知識庫的 QPS 與召回率。

產業與需求指標

  1. 企業招標檔案中明確要求“資料不出域”的比例:可從中國政府採購網、TED 歐盟招標等擷取關鍵詞。
  2. 主要雲端廠商私有化部署專案數量與營收佔比:雲端廠商財報中“本地部署/混合雲端”分項,間接體現需求向本地遷移。
  3. 法規動向:如各國資料安全立法對“模型訓練/推論必須本地”的強制條款數量。
  4. 關鍵零部件價格:高階 DRAM、NVMe SSD 現貨價格,影響本地裝置總擁有成本。
  5. 人才市場:求職平台“本地推論”“向量資料庫”技能標籤的出現頻率與薪資,反映行業擴產強度。

市場情緒指標

  1. 社交媒體 / Reddit / 知乎上 “本地 RAG” 話題討論量
  2. ArXiv 有關 “local RAG”“on‑device retrieval” 的論文月度提交數量

建議每季度統計以上資料,並結合頭部公司(NVIDIA、英特爾、微軟)季度業績釋出會管理層講話進行交叉驗證。

信源

  1. 行業分析

    • IDC, “Worldwide AI PC Forecast, 2025‑01”
    • Counterpoint Research, “Edge AI Server Tracker, 2025‑04”
    • Mordor Intelligence, “Vector Database Market Report, 2024”
    • Grand View Research, “Edge AI Market Analysis, 2024”
    • Forrester Consulting, “Operational Costs of Local AI,” 2024‑11
    • Gartner, “DevSecOps for Edge AI,” 2024
  2. 技術架構與模型

    • LangChain 官方文件 (docs.langchain.com)
    • LlamaIndex Local Deployment Guide (docs.llamaindex.ai)
    • NVIDIA TensorRT‑LLM 白皮書 (developer.nvidia.com, 2024)
    • Hugging Face 模型卡及量化指南 (huggingface.co)
    • MTEB Leaderboard (huggingface.co/spaces/mteb/leaderboard)
  3. 硬體平台

    • Intel Core Ultra NPU 技術白皮書 (intel.com, 2024)
    • AMD Ryzen AI 開發者指南 (amd.com)
    • 高通 AI Engine Direct 文件 (qualcomm.com)
    • Apple統一記憶體與 MLX 架構 (github.com/ml-explore/mlx)
  4. 法規與標準

    • 中國《資料安全法》全文 (全國人大網)
    • GDPR Regulation (EU) 2016/679
    • EDPB Guidelines 07/2025 on Local AI Compliance
  5. 公司公開資訊

    • 輝達、英特爾、AMD、高通、Apple季度財報與投資者會議紀要 (2024‑2025)
    • 微軟 Build 2024 官方新聞稿
    • Meta AI 部落格 (ai.meta.com) 釋出 Llama 3.1/3.3 相關博文
    • 阿里雲端通義千問開源模型釋出部落格

(注:以上信源均基於公開可查的官方釋出或權威第三方機構,具體數字口徑已在正文各小節標註。)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型