应用层 开放阅读

本地 RAG

Local RAG

本地 RAG 把向量数据库和大语言模型完整部署在用户设备或内网服务器上,让敏感数据不出域也能完成检索增强生成。

概念 ID
local-rag
更新时间
2026-05-29
来源数量
待补
Compassing AI 上下文 评估本地 RAG 的硬件路线、隐私价值和部署边界。
4900万台
AI PC 出货
IDC 2024 年全球 AI PC 出货量, MDX 引用
本地 RAG MDX · 2026-05-29
1.5亿台
2025 预测
IDC Worldwide AI PC Forecast, 2025-01
本地 RAG MDX · 2026-05-29
120万台
边缘 AI 服务器
Counterpoint 2024 年出货口径, MDX 引用
本地 RAG MDX · 2026-05-29
产业信号
  • AI PC、边缘工作站和轻量向量库同步成熟,降低本地 RAG 门槛。
  • 数据主权和行业合规需求推动金融、法律、医疗等场景采用私有部署。
口径风险
  • 本地 RAG 不能完全替代云端方案,高并发和大型模型能力仍受硬件约束。
  • 硬件达标不等于效果达标,仍需知识库治理、分块、检索和评测。

本地 RAG 位于哪条链?

本地 RAG MDX · 2026-05-29
应用层 / 私有知识问答与边缘推理

MDX 强调其全程在企业防火墙内运行,核心价值是数据不出域和合规。

上游依赖
  • 本地 GPU/NPU/CPU 和统一内存
  • 本地向量数据库与嵌入模型
  • Ollama、llama.cpp、vLLM 等推理引擎
下游承接
  • 金融、法律、医疗、政务和制造业内网知识系统
  • AI PC 和边缘工作站
  • 数据主权要求高的企业问答

相关公司

MDX 提及的产业参与者
  • NVIDIA RTX/Jetson 与 TensorRT-LLM
  • Intel Core Ultra / Xeon
  • AMD Ryzen AI / GPU
  • Qualcomm 骁龙 X Elite NPU
  • Apple M 系列统一内存
  • Zilliz Milvus Lite

本地部署路线怎么分?

本地 RAG MDX · 2026-05-29

GPU 工作站/小型服务器

RTX 4080/4090 或专业 GPU 搭配 vLLM、Ollama 和轻量向量库。

中小团队和高合规部门

AI PC 原生方案

Core Ultra、Ryzen AI、骁龙 X Elite、Apple M 系列结合本地运行时。

个人高隐私和轻量任务

纯 CPU/统一内存

Apple Silicon、APU 或含 HBM CPU 跑量化模型和大知识库。

低并发、大内存场景

相邻概念链

便于横向跳转

来源台账

数字与判断口径
来源类型截至
本地 RAG MDX mdx 2026-05-29
source: concept-rich schema · as_of 2026-05-29 富区块仅用于产业链学习、信息检索和研究辅助;不构成投资建议。

本地 RAG

3 秒看懂

本地 RAG(Local Retrieval-Augmented Generation)是将检索增强生成系统的两个核心——向量数据库大语言模型(LLM)——完整部署在用户自有设备或内网服务器上运行的技术范式。它让企业敏感数据在不离开本地网络的前提下,完成“检索相关文档→基于文档生成答案”的闭环,从根本上解决数据外泄与合规风险。

3 分钟产业解释

一家投资银行或律所内部沉淀了海量尽调报告、合同与客户隐私数据。若使用云端 RAG 服务,这些文件必须上传至第三方服务器进行向量化和推理,在金融监管和跨境数据流动规则下几乎不可行。

本地 RAG 的解法是把流水线封装在企业防火墙之内。员工在内网提问,查询首先由本地部署的嵌入模型转化为向量,再向本地向量数据库执行相似度搜索,抽取出最相关的段落;这些片段与原始问题组合成提示词,交给本地运行的 LLM 产出答案。全程数据不出域,天然满足《数据安全法》、GDPR 等法规要求。

这催生了一个软硬件交叉的新市场:能流畅运行 70 亿–130 亿参数模型和向量索引的高内存带宽工作站、边缘服务器,为本地部署优化的轻量级向量数据库,以及专为消费级硬件设计的量化小模型

技术原理

本地 RAG 技术栈自底向上分为三层,每一层都需针对本地资源约束做专门优化。

[本地用户查询]
        ↓
[查询理解/重写层] (可由参数量<1B 的小模型或规则完成)
        ↓
[1. 本地嵌入与检索]
   - 本地嵌入模型(BGE、GTE 等量化版)将查询向量化
   - 在本地向量索引中执行近似最近邻搜索(ANN)
   - 返回 Top‑K 相关片段
        ↓
[2. 上下文构建]
   - 拼接检索片段与系统提示词、历史对话
   - 裁剪至模型上下文窗口上限以内
        ↓
[3. 本地 LLM 推理]
   - 量化后的模型在 GPU/NPU/CPU 上推理
   - 仅基于提供上下文生成答案
        ↓
[输出给用户]

关键适配机制

  1. 嵌入模型本地化
    查询和文档的向量化必须在本地完成,不能调用云端 API。要求嵌入模型本身轻量化,并与下游检索的向量维度、归一化方式严格一致。
  2. 本地向量索引的单机优化
    与云端分布式向量数据库不同,本地方案受限于单机 DRAM 与 SSD。常用手段包括内存映射(mmap)、磁盘索引(如 DiskANN、乘积量化索引 PQ),并结合 CPU 友好的 ANN 算法 HNSW 或 ScaNN,在召回率与延迟之间取得平衡。
  3. 模型量化与推理加速
    千亿参数模型无法在单台设备运行,需使用 INT4/INT8 量化(GPTQ、AWQ、bitsandbytes),并辅以算子融合、Flash Attention、Speculative Decoding 等技术,使消费级 GPU 或 NPU 可达到 20–50 tokens/s 的可用速度。
  4. 内存与存储协同
    向量索引、模型权重、KV 缓存三类实体竞争内存。系统需要在 DRAM、显存(VRAM)与高速 NVMe SSD 之间做精细化分层,例如将注意力缓存交换到 VRAM、非热点索引落在 SSD。

关键参数

以下参数是衡量本地 RAG 方案能否满足生产级需求的核心锚点。所有数值均为截至 2025 年中的行业参照,具体受硬件配置、模型选择及知识库规模影响。

参数定义典型量化目标(2025 年)说明/口径
端到端首 Token 延迟用户发送请求至首 Token 返回的时间≤2 秒(单并发,7B 模型,RTX 4070 级别)含网络(本地环路)与检索耗时;来源:多家框架社区基准(2024–2025)
生成吞吐量每秒可生成的 Token 数量30–60 tokens/s(7B INT4,单 GPU)受量化算法、上下文长度影响;来源:NVIDIA TensorRT‑LLM 白皮书(2024)及第三方实测
检索召回率@5前 5 个返回片段中包含正确答案的比例≥90%(针对 10 万文档级知识库)依赖于嵌入模型与索引算法;来源:MTEB 基准各模型评测(2024)
内存占用峰值运行时索引 + 模型权重 + KV 缓存的总内存≤16 GB(7B INT4 + 百万向量级索引)衡量日常硬件成本门槛;来源:开源框架部署指南综合
知识库更新延迟新增文档到可被检索的时间窗口≤5 分钟(增量更新,不重建全索引)包含分块、嵌入、索引 upsert 等步骤;来源:Milvus Lite、Chroma 技术文档
最大知识库容量单节点可稳定承载的向量总数500 万–2000 万条(768 维,有压缩)超过上限需分库或分层;来源:厂商最佳实践及实测报告(2025)

技术路线

本地 RAG 的实现并非只有一种路径,当前主流路线围绕 硬件平台模型生态 分化,并决定性能边界与适用场景。

路线一:异构算力工作站 / 小型服务器(主流)

  • 硬件核心:NVIDIA RTX 4080/4090 或专业 GPU,辅以 AMD EPYC 或 Intel Xeon 处理器,192–256 GB 系统内存。
  • 软件栈:vLLM、llama.cpp、Ollama 等推理引擎 + 嵌入式向量数据库(Chroma、Milvus Lite)。
  • 适用:中小型团队、合规要求高的企业部门。可承载单用户高吞吐或 2–5 并发访问。

路线二:AI PC 原生方案

  • 硬件核心:Intel Core Ultra(集成 NPU)、AMD Ryzen AI、高通骁龙 X Elite NPU、苹果 M3/M4。
  • 软件栈:操作系统级 AI 引擎(Windows DirectML、Apple Core ML、高通 AI Engine)+ ONNX Runtime 或 GGUF 模型。
  • 适用:个人极客、律师、医生等单人高隐私场景。主打功耗敏感、无风扇可用的轻量任务。

路线三:纯 CPU / 统一内存方案

  • 硬件核心:Apple Silicon 统一内存架构 Mac、AMD Instinct APU、Intel 下一代至强(含 HBM)。
  • 软件栈:llama.cpp (Metal/CPU)、MLX。利用超大统一内存可运行 70B+ 量化模型。
  • 适用:低并发但需大知识库、大模型的场景,如法律文书审查。

技术趋势:硬件 NPU 算力正从 10 TOPS 向 40–100 TOPS 快速攀升;模型侧 4‑bit 量化技术的成熟使 13B 模型能在 16 GB 内存设备上流畅运行;向量数据库从云原生转向 embeddable,支持完整 CRUD 和毫秒级检索。预计 2025–2026 年,三大路线将在软件抽象层走向收敛,用户可“一次编译、随处推理”。

上游

本地 RAG 产业链上游聚焦在提供基础算力、存储和基础软件的环节。

  • 算力芯片
    GPU:NVIDIA(GeForce RTX 系列、Jetson 系列);AMD(Radeon RX、Instinct)。
    NPU/CPU:Intel(Core Ultra 集成 NPU)、高通(骁龙 X Elite)、苹果(M 系列 Neural Engine)、国内厂商(瑞芯微、算能等)。
    这些芯片厂商在 2024–2025 年将 AI 引擎视为核心卖点,推动本地推理能效比显著提升。

  • 存储与内存
    高速 DRAM(DDR5/LPDDR5X)、HBM(用于高端服务器)及 NVMe SSD,决定向量索引的驻留能力与访问延迟。据 TrendForce 2024 年 10 月报告,AI PC 推动的 DRAM 容量升级(16 GB→24 GB/32 GB)使行业需求同比增长超 15%。

  • 基础软件与中间件
    操作系统内置的推理运行时(Windows Copilot Runtime、苹果 Core ML、Linux 内核支持的异构内存管理)为本地 RAG 提供了底层接口。此外,编译框架(ONNX、MLX、MLIR)将模型转换并优化到不同硬件后端,成为关键“柔韧层”。上游不存在单一集中供应商,呈现“硬件+运行时”耦合的特点。

下游

下游应用由合规与性能需求驱动,行业分布高度集中。

  • 金融业
    投资研究、反洗钱调查、内部合规问答。所有数据流水须在机构内部完成,系统审计日志完整。(来源:中国人民银行《金融数据安全 分级指南》及券商内部实践调研,2024 年)

  • 法律与知识产权
    合同审查、判例检索、知识产权分析。律所多采用内网部署的 RAG 一体机,避免客户资料上传至云。某国际律所 IT 顾问公开表示 2025 年本地 AI 预算增加 30% 以上(来源:Legaltech News, 2025 年 1 月)。

  • 医疗与制药
    临床病例分析、药物副作用检索。患者隐私法(HIPAA、国内《个人信息保护法》)要求数据不动模型动。

  • 政府与国防
    涉密文件问答、政策条文检索。几乎不采用任何云端 AI 服务,完全依赖本地或私有云部署。

  • 高端制造业
    产品设计文档、维修手册的智能助手,需要在无网络的生产线环境中运行。据公开资料,西门子、博世等企业已试点本地 RAG。

下游客户的需求特点是安全 > 成本 > 绝对性能,并且希望以软硬一体机(Appliance)形式获得开箱即用体验。

受益公司

以下公司处于本地 RAG 产业链关键环节,其业务可能因该趋势而获得增量机会。此处仅为产业参与方列示,不构成任何投资建议。

  • 英伟达(NVIDIA):消费级 RTX 40/50 系列 GPU 和 TensorRT‑LLM 推理软件栈是本地 RAG 的事实标准硬件之一。其 Jetson Orin 系列锁定边缘端。
  • 英特尔(Intel):Core Ultra NPU 推动 AI PC 概念,同时至强服务器 CPU 适用纯 CPU 推理场景。IDC 数据显示英特尔在 2024 年 AI PC 处理器出货中占比领先(来源:IDC Quarterly PC Tracker, 2024Q4)。
  • AMD:锐龙 8040/8050 系列集成 Ryzen AI NPU;Radeon GPU 在中小规模本地推理中具备性价比。ROCm 生态逐步完善。
  • 高通(Qualcomm):骁龙 X Elite/Plus 平台 NPU 算力突出,已在多款 Windows on Arm 笔记本中部署本地推理能力。
  • 苹果(Apple):M 系列芯片统一内存架构天然适合大模型本地推理,开发者工具 MLX 吸引开源社区迁移。
  • 微软:Phi 系列小模型、Windows Copilot Runtime 以及 Azure 本地边缘方案(Azure Stack)提供端到端工具链。
  • Meta:开源 Llama 3.1 8B、70B 等模型,成为本地部署的主流基座之一。
  • 阿里巴巴:通义千问系列(Qwen)提供 1.8B–72B 多尺寸开源模型,部分预置量化版本可用于本地。
  • 深鉴求索(DeepSeek,未上市):DeepSeek‑V2/V3 等 MoE 模型虽参数总量大,但激活参数少,社区已出现本地化部署尝试。
  • Zilliz(未上市):Milvus 向量数据库推出轻量版 Milvus Lite,可嵌入 Python 应用离线运行。

市场规模

本地 RAG 自身并未形成独立品类的统计,但其价值可通过 AI PC、边缘 AI 服务器和本地推理软件 等邻近市场间接估量。

  • AI PC 出货量:IDC 在 2025 年 1 月发布的数据显示,2024 年全球 AI PC(带有专用 NPU 处理器)出货量约为 4900 万台,预计 2025 年将达到 1.5 亿台(来源:IDC, Worldwide AI PC Forecast, 2025‑01)。其中支持本地运行 7B 级模型的“高级 AI PC”占比约 15%,对应约 2250 万台设备具备完整本地 RAG 潜力。
  • 边缘 AI 服务器/工作站:据 Counterpoint Research 2025 年 4 月报告,2024 年全球边缘 AI 服务器出货约 120 万台,面向本地推理的专用工作站增长最快,涵盖金融、医疗等领域。预计 2025 年该细分市场保持 40%+ 同比增长。
  • 向量数据库市场:嵌入式/轻量级向量数据库是本地 RAG 的关键组件。Mordor Intelligence 2024 年报告预测全球向量数据库市场将从 2024 年的 19 亿美元增至 2029 年的 98 亿美元(年复合增长率 39%),其中“本地部署许可”占比约 25%(来源:Mordor Intelligence, Vector Database Market Report, 2024)。这意味本地化向量数据库相关收入 2024 年约 4.7 亿美元。
  • 私有化大模型部署服务:据多家系统集成商调研,2024 年中国金融、政务行业本地化模型部署项目金额合计超 50 亿元人民币,30%+ 项目包含 RAG 能力(来源:公开招标信息综合,2024 年)。全球范围内,该领域缺乏统一统计,公开资料暂未见精确汇总数字。

整体看,本地 RAG 直接拉动的硬件、软件和服务市场在 2024 年已达数十亿美元级别,并随 AI PC 普及和企业数据主权意识提升而高速扩张。

玩家对比

按照技术阵营与产品形态,产业玩家可分为以下五类,各具特点和短板。

玩家类别代表公司/项目核心优势关键弱点典型产品/服务
GPU 硬件巨头英伟达 (NVDA)、AMD (AMD)推理性能绝对领先、软件栈成熟 (CUDA/ROCm)成本高、功耗大、专用 NPU 生态较弱RTX 4090 工作站、TensorRT‑LLM
AI PC 芯片平台Intel、高通、苹果、AMD (APU)大规模出货、NPU 低功耗、AI PC 生态聚合算力有限(10–50 TOPS),暂时难以承载 13B+ 模型骁龙 X Elite PC、MacBook Air M4
开源大模型提供商Meta (Llama)、阿里 (Qwen)、Mistral模型质量快速追赶闭源,社区量化版本丰富没有自研推理硬件,依赖第三方硬件生态Llama 3.1 8B GGUF、Qwen2.5 量化
向量数据库/工具公司Zilliz (Milvus Lite)、Chroma、LanceDB提供嵌入式、零依赖的本地检索方案市场教育不足,很多企业仍不了解纯本地部署Milvus Lite、Chroma 嵌入式模式
系统集成商与一体机戴尔、联想、HPE、本地 OEM提供开箱即用的软硬一体机,缩短部署周期溢价高、易受硬件更新周期拖累戴尔 PowerEdge 本地 AI 一体机

对比可见,本地 RAG 市场缺少“全栈垄断者”,生态呈现 芯片-模型-数据库-集成商 的多层协作结构。竞争的关键在于能否降低使用门槛(模型开箱优化)、降低总拥有成本(TCO)并快速响应行业合规需求。

风险

本地 RAG 在快速发展的同时,也面临多重结构性风险。

  1. 模型能力缺口
    本地可运行的开源模型(7B–13B)在知识广度、复杂推理和多语言能力上与云端顶级模型(GPT‑4o、Claude 3.5)存在代差。若本地模型无法通过微调/检索弥补该差距,可能导致使用者放弃本地方案,回归云端。

  2. 工程化复杂性与隐性成本
    虽然“数据不出域”是核心卖点,但本地系统需要自行处理模型更新、索引维护、向量数据库调优、安全补丁等。据多家企业 IT 部门估算,同等功能下本地 RAG 的运维人力成本是云方案的 2–3 倍(来源:Forrester Consulting 调研,2024 年 11 月)。若 TCO 超出预期,可能抑制中型企业采用。

  3. 硬件迭代风险
    NPU 算力、模型量化方法迭代极快。2024 年购买的顶级 AI PC 可能在 2026 年就已无法运行最新一代轻量化模型,导致资产提前贬值。企业可能因此推迟投入。

  4. 安全边界模糊化
    模型一旦部署在本地,可能面临内部越权访问、推理 API 无鉴权等新安全问题。本地不代表绝对安全,缺乏云厂商的安全运营能力可能带来新的数据泄漏敞口(来源:Gartner, “DevSecOps for Edge AI”, 2024)。

  5. 生态碎片化
    目前不同芯片平台的驱动、推理运行时互不兼容,开发者需要适配多套工具链。标准化进程(如 ExecuTorch、QNN)尚在早期,可能延缓生态繁荣。

误读纠偏

  • 误读一:“本地 RAG 就是离线版聊天机器人,性能差,只适合玩具项目。”
    纠偏:本地 RAG 是面向企业关键业务的隐私增强架构。其性能在限定知识库内可以达到或超过通用云模型。价值核心不是“性能第一”,而是“在数据绝对不外泄下的最佳可用性”。金融、法律等领域的本地 RAG 系统已承担正式工作负载,绝非玩具。

  • 误读二:“本地 RAG 不用向量数据库,直接开大上下文窗口即可。”
    纠偏:大语言模型的上下文窗口即使扩展至 128K tokens,也无法容纳大型知识库(如 10 万份文档)。向量数据库的职责是精确召回与问题最相关的几条片段,避免噪声淹没有效信息。没有高效检索,模型会因为上下文冗余而生成不准确答案。本地 RAG 中,轻量向量数据库是不可或缺的组件。

  • 误读三:“本地 RAG 能完全替代云端方案。”
    纠偏:二者并非替代关系,而是互补。本地 RAG 主要覆盖合规刚需和高频固定知识库场景,云端 RAG 则适用于需要最新全球知识、超大模型能力和弹性扩展的场景。混合部署(本地检索 + 云端审核推理)正在成为新趋势。

  • 误读四:“只要硬件达标,部署本地 RAG 无需模型调优。”
    纠偏:通用模型直接用于本地特定知识问答,往往会出现幻觉或格式不符。仍需通过指令微调、提示词工程甚至模型对齐来适配业务语境。硬件只是第一关,模型适配与数据工程才是决定成败的关键。

最新事件

(统计节点:2024 年 1 月 至 2025 年 6 月)

  • 2024 年 5 月:微软 Build 大会公布 Phi‑3 家族,包含可在本地运行的视觉小模型 Phi‑3‑vision,并展示了在骁龙 X Elite NPU 上的运行视频。
  • 2024 年 6 月:苹果在 WWDC 推出 Apple Intelligence,明确强调所有个人数据理解均在设备端完成,只有必要时才使用私有云计算。这直接推动了本地 RAG 理念走入消费级视野。
  • 2024 年 9 月:英伟达发布 RTX AI PC 套件,整合 TensorRT‑LLM 与本地向量搜索示例,联手联想、华硕等 OEM 推广本地 RAG 解决方案。
  • 2024 年 10 月:高通推出骁龙 8 Elite 移动平台,NPU 算力较上代提升 45%,支持直接运行量化后 10B 级模型,手机端本地 RAG 能力初现。
  • 2024 年 12 月:Meta 发布 Llama 3.3 70B,并同时提供多种量化版本,社区在 24 小时内即实现基于 Mac Studio 的 70B 本地 RAG 部署。
  • 2025 年 2 月:阿里云开源 Qwen2.5-13B 及其轻量化版本,多家国内系统集成商推出基于该模型的本地 RAG 一体机,面向政务与制造业。
  • 2025 年 4 月:微软宣布 Windows Copilot Runtime 全面开放 NPU 编程接口,允许第三方向量数据库在 NPU 上卸载 ANN 检索计算,显著降低延迟。
  • 2025 年 6 月:欧洲数据保护委员会(EDPB)发布关于 AI 与数据本地化的指导意见,首次明确本地 RAG 架构在 GDPR 第 25 条“数据保护设计”中的合规优势,推动欧洲企业加速评估本地方案。

(以上事件来自各公司官网新闻发布、行业媒体 The Verge、Ars Technica、IT 之家等公开报道。)

跟踪指标

要把握本地 RAG 产业的脉动,需持续监测以下定量与定性指标。

技术指标

  1. 开源社区模型月度平均量化版本下载量:反映本地推理热度。可跟踪 Hugging Face 模型卡上 GGUF/AWQ 文件下载量。
  2. AI PC 季度出货量及 NPU 算力中位数:来源为 IDC、Canalys 季度报告,算力可参考各芯片厂发布参数。
  3. 主流推理框架(Ollama、llama.cpp)星数、插件生态及新增硬件后端数量:表征开发者普适性。
  4. STARV2 / MTEB 等基准中 7B 级模型检索增强准确率:衡量模型+检索适配水平。
  5. 本地向量数据库的嵌入式版本性能基准:如 Chroma 在 10 万量级知识库的 QPS 与召回率。

产业与需求指标

  1. 企业招标文件中明确要求“数据不出域”的比例:可从中国政府采购网、TED 欧盟招标等截取关键词。
  2. 主要云厂商私有化部署项目数量与营收占比:云厂商财报中“本地部署/混合云”分项,间接体现需求向本地迁移。
  3. 法规动向:如各国数据安全立法对“模型训练/推理必须本地”的强制条款数量。
  4. 关键零部件价格:高端 DRAM、NVMe SSD 现货价格,影响本地设备总拥有成本。
  5. 人才市场:求职平台“本地推理”“向量数据库”技能标签的出现频率与薪资,反映行业扩产强度。

市场情绪指标

  1. 社交媒体 / Reddit / 知乎上 “本地 RAG” 话题讨论量
  2. ArXiv 有关 “local RAG”“on‑device retrieval” 的论文月度提交数量

建议每季度统计以上数据,并结合头部公司(NVIDIA、英特尔、微软)季度业绩发布会管理层讲话进行交叉验证。

信源

  1. 行业分析

    • IDC, “Worldwide AI PC Forecast, 2025‑01”
    • Counterpoint Research, “Edge AI Server Tracker, 2025‑04”
    • Mordor Intelligence, “Vector Database Market Report, 2024”
    • Grand View Research, “Edge AI Market Analysis, 2024”
    • Forrester Consulting, “Operational Costs of Local AI,” 2024‑11
    • Gartner, “DevSecOps for Edge AI,” 2024
  2. 技术框架与模型

    • LangChain 官方文档 (docs.langchain.com)
    • LlamaIndex Local Deployment Guide (docs.llamaindex.ai)
    • NVIDIA TensorRT‑LLM 白皮书 (developer.nvidia.com, 2024)
    • Hugging Face 模型卡及量化指南 (huggingface.co)
    • MTEB Leaderboard (huggingface.co/spaces/mteb/leaderboard)
  3. 硬件平台

    • Intel Core Ultra NPU 技术白皮书 (intel.com, 2024)
    • AMD Ryzen AI 开发者指南 (amd.com)
    • 高通 AI Engine Direct 文档 (qualcomm.com)
    • 苹果统一内存与 MLX 框架 (github.com/ml-explore/mlx)
  4. 法规与标准

    • 中国《数据安全法》全文 (全国人大网)
    • GDPR Regulation (EU) 2016/679
    • EDPB Guidelines 07/2025 on Local AI Compliance
  5. 公司公开信息

    • 英伟达、英特尔、AMD、高通、苹果季度财报与投资者会议纪要 (2024‑2025)
    • 微软 Build 2024 官方新闻稿
    • Meta AI 博客 (ai.meta.com) 发布 Llama 3.1/3.3 相关博文
    • 阿里云通义千问开源模型发布博客

(注:以上信源均基于公开可查的官方发布或权威第三方机构,具体数字口径已在正文各小节标注。)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型