Serverless GPU
1. 3 秒看懂
Serverless GPU 是一种将 GPU 算力包装成“按调用计费”的云计算模型。用户无需提前预留或管理带有 GPU 的服务器、虚拟机或容器集群,只需提交代码、模型或任务,平台自动完成资源分配、启动计算环境、执行任务、返回结果,并在空闲时立即回收资源。开发者不需要关心 GPU 型号、驱动版本、CUDA 库兼容性、节点数量等底层细节,按实际消耗的 GPU 计算时长或调用次数付费,真正实现“用时即起、用完即停”的极致弹性。
2. 3 分钟产业解释
本质上,Serverless GPU 把“计算资源”的售卖模式切换为“计算结果”的售卖模式。传统 GPU 云服务器以整块 GPU 卡/小时为单位出租,即使用户没有满负荷运行也需全额付费;而 Serverless GPU 的计价单位可以是 GPU 核/秒、显存/GB/秒,甚至单次推理请求。这一转变依托于容器封装、高速资源调度、虚拟 GPU 切分与毫秒级计费系统。典型应用场景包括具有突发性或间歇性特征的 AI 模型推理、批量图像处理、视频转码、科学模拟以及云游戏渲染等。用户不再为闲置的 GPU 时间买单,平台则通过规模效应和多租户复用提高硬件利用率,这在 AI 推理等高并发、低延迟场景中正快速普及。
该理念在部分前沿方案中进一步演进为“链式云(Chain-Cloud)”——一种基于区块链的开放算力市场。在链式云架构中,个人或机构可将手中的闲置 GPU 作为节点有偿提供算力,智能合约自动完成任务匹配、结算和可验证计算。尽管该方向在去中心化、降低成本方面充满想象空间,但目前仍面临性能损失、网络延迟、安全审计与监管合规等重大挑战,整体处于早期实验阶段。
3. 技术原理
Serverless GPU 不是单一技术,而是一套涵盖硬件虚拟化、容器编排、任务调度与资源隔离的工程栈。
硬件池化与虚拟化切分
数据中心内大量 GPU 服务器通过 RDMA 等高速网络互联,形成统一物理资源池。在此之上,利用 NVIDIA vGPU、MIG(多实例 GPU)、AMD MxGPU 或基于 SR-IOV 的 GPU 直通技术,将一张物理 GPU 划分为多个独立、具备可预测性能上限的虚拟 GPU 实例。MIG 能提供严格的硬件级故障隔离与并行执行,尤其适合对性能一致性要求极高的推理任务;vGPU 则更灵活但隔离性稍弱。对于无法硬件切分的场景,也可以用控制组(cgroups)等软件手段限制显存与计算单元,实现较粗粒度的共享。
容器封装与任务启动
用户的代码、模型文件和依赖库被打包成 OCI 标准容器镜像,辅以元数据描述所需的 GPU 规格(如 NVIDIA A10、显存≥8 GB)、CUDA 版本、预置环境变量等。当任务被触发(HTTP 请求、消息队列、定时器等),调度器查找满足条件的物理节点并拉取镜像。为降低冷启动延迟,各平台普遍采用镜像预热、内核级沙箱复用、快照恢复等优化,使容器启动时间压缩至秒级甚至亚秒级。对于无状态推理,运行时直接加载模型到显存并启动推理服务;对于有状态场景,则需依赖外部存储或缓存中间状态。
动态调度与生命周期管理
调度器综合考虑 GPU 型号亲和性、拓扑感知(如 NVLink/NVSwitch 区域)、实时可用容量、排队长度等,动态选择一个或多个虚拟 GPU 实例承载任务。任务执行期间,平台持续采集 GPU 利用率、显存带宽、功耗等指标用于计费与异常检测。任务完成后或超时后,立即释放 GPU 资源、擦除容器文件系统、重置显存,确保租户间彻底隔离。对于请求量波动极大的服务,扩缩容策略可在数百毫秒内完成实例增减。
链式云的扩展架构
链式云引入去中心化调度与可验证计算。算力提供者将硬件注册到区块链网络,通过 TEE(可信执行环境)或零知识证明等机制,让使用者验证任务确实在声称的 GPU 上执行,而不是虚假算力。智能合约管理订单、支付和惩罚逻辑,去除中心化仲裁。然而,去中心化网络面临任务调度时延高、传输数据带宽受限以及证明计算开销大等现实瓶颈,尚无法与中心化云服务的稳定低延迟匹敌。
4. 关键参数
理解 Serverless GPU 服务时,有几个关键参数直接影响成本、性能和适用性:
- GPU 虚拟化粒度:物理 GPU 被切分为多少个独立实例,以及每个实例的显存上限和计算单元比例(如 MIG 的 1g.5gb、3g.20gb 等规格),决定了并发多任务时的隔离程度和性能保障。
- 冷启动延迟:从任务触发到容器就绪、模型加载完毕并可处理请求的时间。不同平台和资源配置下差异明显,典型值在数百毫秒到十几秒之间,模型文件较大时可能更长。多数平台会提供“预留并发”或“预置实例”来消除冷启动,但这会失去部分弹性,并产生预留费用。
- 最大并发 & 扩缩容速率:服务可同时处理的任务数量上限,以及每秒可新增的实例数量。对突发流量冲击至关重要。
- 单次调用超时 & 任务最大执行时间:平台对单次调用的执行时间限制,常见从几分钟到数小时不等,需要根据模型推理时长或批处理任务量选择。
- GPU 型号与显存选择:可选的 GPU 型号(如 NVIDIA T4、A10、A100、H100 等)及其显存大小。显存不足会直接导致模型加载失败或推理 batch size 受限。
- 计费粒度与计费项:最小计费单元(1 秒、1 毫秒或单次调用),以及是否单独对显存、CPU、内存、网络出口流量、请求次数等收费。部分平台按“GPU-秒”综合定价,部分则分项累加。
- 数据持久化与存储 IO:Serverless GPU 通常不保证本地存储的持久性,需挂载外部对象存储或文件存储来保存模型和中间结果,存储吞吐与时延会成为推理延迟的新增变量。
- 网络吞吐与延迟:对于在推理内部访问外部 API、数据库或加载远程数据的场景,实例的网络带宽和延迟会影响端到端响应。
以上参数均可能随平台和区域而变化,具体数值应以各云厂商官网公布的 SLA 和定价页为准(公开资料持续更新)。
5. 技术路线
当前产业界实现 Serverless GPU 的路径可归纳为三条主线,彼此存在交叉与演进。
路线一:基于容器即服务(CaaS)和 Kubernetes 的精细化封装
AWS Lambda(扩展到 GPU)、Google Cloud Run for GPU、Azure Container Apps 等,都是将容器编排平台升级为兼容 GPU 的 Serverless 运行时。平台负责调度 GPU 节点、按需注入 GPU 设备,用户只需指定容器资源和 GPU 类型。此路线生态成熟,与现有 DevOps 工具链和日志监控系统无缝集成,但其弹性粒度受限于容器调度效率,冷启动优化在大模型场景下仍需投入定制开发。
路线二:专用 AI 推理平台原生 Serverless
典型代表是 AWS SageMaker Serverless Inference、阿里云 PAI-EAS、华为云 ModelArts 的 Serverless 部署等。它们在 AI 层做更高抽象,预置模型优化引擎(如 TensorRT、ONNX Runtime),自动完成模型版本管理、灰度发布和推理接口暴露,开发者几乎不接触容器细节。该路线的优点是模型部署简单,但其内部资源复用策略对外不可见,用户对底层 GPU 行为难以微调,也更容易被锁定在特定云厂商的 API 生态中。
路线三:垂直 GPU 云厂商的轻量化平台
CoreWeave、Lambda Labs、RunPod、Modal 等公司,提供围绕 GPU 实例的简化 Serverless 接口。它们往往在数据中心架设大量同代际 NVIDIA GPU,借助深度定制的调度器和高速存储,将启动速度推到极致,并通过竞价型定价、按秒或按次计费吸引训练和推理客户。这类厂商不追求全栈云服务,而聚焦在“GPU 算力效率”本身,对成本敏感的大规模 AI 用户有较强吸引力,但其服务可用性、全球基础设施覆盖和合规认证落后于头部公有云。
路线四(探索期):去中心化链式云
如技术原理中所述,以区块链和算力证明为基础的链式云架构,目标是打破中心化云厂商垄断。该路线当前主要用于概念验证和小范围部署,距离生产级可靠性和大规模商用仍有较大差距。公有云和垂直 GPU 云仍是现阶段主流路线。
总体趋势上,各路线都在向更短的冷启动时间、更精细的计费粒度和更丰富的 GPU 型号演进,同时尝试通过统一 API 跨云管理,但标准化进程较为缓慢。
6. 上游
Serverless GPU 的上游可拆分为算力元器件、整机系统与数据中心基础设施三层。
芯片层(GPU/CPU)
- NVIDIA 占据绝对主导地位,提供涵盖 A100、H100、H200、L40S、L4 等全线数据中心 GPU,以及配套的 NVLink、NVSwitch 高速互联方案和 MIG 技术。其 CUDA 生态几乎成为 GPU 计算的行业标准。
- AMD 凭借 Instinct 系列(MI250、MI300 等)和 ROCm 软件栈切入市场,在高性能计算和部分 AI 训练中取得进展,但生态成熟度仍远逊于 NVIDIA。
- 英特尔通过数据中心 GPU(如 Flex 系列、Max 系列)和 oneAPI 试图进入,目前份额较小。
- 中国厂商如华为(昇腾 910、310 系列)、寒武纪、海光信息等,在国产替代背景下加速迭代,已可在部分推理和训练场景实现规模化部署,尤其在国内政务、金融等领域有一定采用。但因软件生态兼容性,与主流 CUDA 应用存在迁移成本。
服务器与网络设备商
提供专用 GPU 服务器的厂商包括浪潮信息(中国市场份额领先,据 IDC 2023 年报告)、新华三、超聚变、宁畅、Dell、HPE、Supermicro 等。它们设计高密度 GPU 节点(如 8×A100 或 H100 的 NVLink 机型),集成高效散热与供电系统。网络方面,Mellanox(现属 NVIDIA)、Broadcom 等提供 RDMA over Converged Ethernet(RoCE)或 InfiniBand 高速互连设备,是保障 GPU 集群低延迟通信的关键。
数据中心与云基础设施
大规模 GPU 集群对电力、冷却和机架密度提出极高要求,单柜功率可达数十千瓦,液冷方案开始渗透。数据中心提供商包括 Equinix、Digital Realty、万国数据、世纪互联、秦淮数据等,它们为云厂商和垂直 GPU 服务商提供托管与租赁服务。上游电力和供应的稳定性直接影响 GPU 云服务可用性。
(以上市场份额、出货量等具体数字因更新频繁,请以各厂商最新财报和 IDC、Gartner 最新发布的报告为准。)
7. 下游
Serverless GPU 的下游应用正从 AI/ML 推理向更多行业渗透。
AI 与机器学习推理
大语言模型(LLM)、文生图(如 Stable Diffusion)、语音识别、推荐系统等模型部署推理是最核心的场景。突发性请求特性与 Serverless 按需付费高度契合,大幅降低推理服务在低负荷时的运行成本。多个 AI 初创公司通过 Serverless GPU 平台提供模型 API,自身无需持有大量 GPU 硬件。
批量数据处理与科学计算
金融行业的量化交易回测、风险模型计算,制药行业的分子对接模拟,气象预测、基因测序等,常需要周期性、大规模并行计算。借助 Serverless GPU,科研团队可随时提交数万核心小时的作业,任务结束后立即释放资源,避免为峰值容量长期预留硬件。
云游戏与实时渲染
游戏渲染和虚拟桌面等工作负载要求 GPU 密集、延迟极低,但用户会话具有高度间歇性。Serverless GPU 可动态启动渲染节点,按活跃玩家数付费,在用户流出后及时缩容,提升 GPU 利用率。
音视频处理与转码
视频直播转码、4K/8K 视频渲染、VR/AR 内容生成等,处理时间集中且量大。Serverless GPU 可逐任务分配 GPU 加速编码器,防止为等待任务队列而购买过多常驻服务器。
企业 SaaS 与边缘应用
集成到 SaaS 工作流中的文档 OCR、内容审核、个性化推荐等微服务,可借助 Serverless GPU 提升响应速度,并在夜间或非高峰时段几乎零成本保持待命。
下游用户结构方面,中小型 AI 团队和独立开发者对 Serverless GPU 的接受度最高,因为它们缺乏运维大规模 GPU 集群的能力;大企业则往往选择混合部署,核心稳态负载使用预留实例,波峰波谷弹性部分采用 Serverless GPU。
8. 受益公司
以下分类梳理产业链相关环节的受益企业,仅基于公开信息及行业逻辑,不构成任何投资或采购建议。
公有云巨头
- AWS:通过 Lambda GPU 支持、SageMaker Serverless Inference 等将 Serverless 概念扩展到 AI,坐拥庞大客户基础和生态集成能力。
- 微软 Azure:在 Azure Functions、Azure Container Apps 和 Azure Machine Learning 中提供 GPU Serverless 选项,深度捆绑 OpenAI 等服务。
- 谷歌云:Cloud Run for GPU、Vertex AI 提供统一的无服务器 AI 平台,GPU 型号涵盖 T4、L4、A100 等。
- 阿里云:函数计算 FC、Serverless 应用引擎 SAE、PAI-EAS 服务均支持 GPU 弹性实例,国内市场份额领先(参考 IDC 相关报告)。
- 腾讯云:云函数 SCF、TI 平台支持 GPU 无服务器推理,强调与小程序、游戏生态联动。
- 华为云:FunctionGraph 和 ModelArts 支持 Serverless 部署,昇腾 GPU 适配是其差异化方向。
垂直 GPU 云及初创公司
- CoreWeave:自建大规模 NVIDIA GPU 集群,专攻高性能 GPU 计算,以低成本、灵活计费吸引 AI 训练和推理客户。2023 年融资后估值飙升(来源:公开市场报道)。
- Lambda Labs:面向 AI 开发者的 GPU 云,提供按需和预留实例,也向 Serverless 灵活调度演进。
- RunPod、Modal、Banana 等:以开发者体验为核心,在 Serverless GPU 推理领域提供极简部署、按秒计费,吸引大量独立开发者和小团队。
- 国内趋动科技:聚焦智能算力池化和调度软件,帮助数据中心构建 Serverless GPU 资源池,已与多家头部科技企业合作。
上游硬件与基础设施
- NVIDIA:GPU 硬件与 CUDA 生态标准制定者,其 MIG、Triton 推理服务器等直接赋能 Serverless GPU 实现。数据中心 GPU 收入大幅增长(NVIDIA 2024 财年报告公开数据)。
- 服务器及数据中心提供商:浪潮信息、万国数据、世纪互联等从 GPU 集群扩建中获益。
(以上公司列举仅反映行业现状,不作为任何形式的价值评判或建议。)
9. 市场规模
直接用“Serverless GPU市场规模”口径的独立统计,截至本内容撰写时,公开资料未见权威机构发布专项数字。业界通常将 Serverless 整体市场或 GPU 云服务市场作为近似参考。
- 据 Gartner、MarketsandMarkets、Fortune Business Insights 等多份行业报告(约 2023–2024 年发布),全球 Serverless 计算市场规模预计从 2022 年的约 80–100 亿美元增长至 2027–2030 年的 300–400 亿美元,年复合增长率约 20–25%。其中,函数即服务(FaaS)与 Serverless 容器是主要形态,GPU 加速的工作负载占比正快速上升,但缺乏精确分离数据。
- 在 AI 推理市场方面,多家机构预测 2023 年全球 AI 推理芯片及服务市场规模约 200–300 亿美元,到 2028 年有望突破 500 亿美元(来源:Allied Market Research 等)。推理任务天然适配 Serverless GPU 的按调用计费模型,因此该市场的高增长将直接推动 Serverless GPU 的需求。
- 中国市场中,IDC 等机构数据显示,2022 年中国公有云函数计算、容器与 Serverless 相关市场规模约 XX 亿元,增速显著,但 GPU 部分的细化数据同样匮缺。受“东数西算”和 AI 大模型落地影响,云厂商正加速扩张 GPU 资源池,推理端 Serverless GPU 被认为将占据其中可观份额。
综上,虽无权威细分统计,但通过相关市场的规模和增速可以推断,Serverless GPU 正处于快速增长期,并有望成为 AI 推理部署的主流方式之一。
10. 玩家对比
综合技术、计费、生态等因素,不同玩家呈现差异化定位(以 2024 年中公开信息为参考,细节可能已变动)。
| 维度 | 公有云巨头(AWS/Azure/GCP/阿里云等) | 垂直 GPU 云(CoreWeave、Lambda Labs 等) | 轻量 Serverless 平台(RunPod、Modal 等) |
|---|---|---|---|
| GPU 型号选择 | 覆盖广,多代多型号,但部分地区高端卡(H100)供给紧张 | 聚焦 NVIDIA 高端卡,单代大规模集群 | 以热门型号为主(A4000、A10、A100 等) |
| 冷启动延迟 | 数百毫秒到数秒,可预置实例降低延迟 | 通常优化较好,秒级启动 | 极简流程,数秒内启动,针对推理调优 |
| 计费粒度 | 计费项多,GPU-秒、内存、网络等,定价相对复杂 | 按 GPU 小时或竞价,部分按秒 | 按调用次数、GPU-秒,计费直观 |
| 生态集成 | 全栈云服务,与数据库、存储、监控、IAM 深度打通 | IaaS 层为主,依赖用户自建周边服务 | API 简单,适合轻量应用,生态较浅 |
| 供应商锁定 | 高,API 和事件源易深度绑定 | 中低,基于标准容器和 Kubernetes 接口 | 低,迁移相对容易但高级特性私有 |
| 全球节点与合规 | 全球覆盖广,合规认证齐全 | 节点集中于北美、欧洲,合规积累中 | 节点有限,多依赖公有云底层 |
| 典型用户 | 企业混合负载、有合规需求的大型组织 | 大规模 AI 训练/推理团队,成本敏感型 | 独立开发者、初创公司、原型验证 |
对于国内玩家,阿里云 PAI-EAS、华为云 ModelArts、腾讯云 TI 等在模型部署生态上各有侧重,并投入国产 GPU 适配。它们在国内合规、数据主权和网络延迟方面具备优势,但面对高端海外 GPU 供给限制,需在技术路线上做更有弹性的设计。
(以上对比基于公开信息整理,产品细节和定价请以各公司最新官方文档为准。)
11. 风险
冷启动与性能一致性风险
首次调用或长时间空闲后的冷启动可能导致延迟从理想状态的毫秒级增加到数秒甚至更久,对延迟敏感类应用(如实时对话 AI、高频量化)构成不可忽视的风险。在多租户共享物理 GPU 时,“吵闹邻居”效应还可能造成计算吞吐抖动,尽管 MIG 等技术可缓解,但无法完全消除。
成本不可预测风险
按调用计费看似低廉,假如流量超出预估、模型未经优化、单次推理耗时过长,或因代码错误导致无意义循环调用,成本会急剧攀升。计费项繁多且调用链复杂时,用户很难即时理解和控制总支出,容易遭遇“账单冲击”。
供应商锁定与迁移成本
深度使用云厂商专有的事件触发器、API 网关、日志监控与安全框架后,将应用迁移到其他平台或私有化部署需要大量重写,费用和时间远超预期。即便采用兼容标准容器的方案,生态工具和服务绑定仍构成隐性锁定。
数据安全与合规风险
在共享 GPU 硬件上运行不同租户的代码和模型,对硬件与 hypervisor 层的安全隔离要求极高,任何漏洞都可能导致侧信道攻击或数据泄露。对于需要满足 GDPR、中国《数据安全法》等法规的业务,跨境调用或节点分布不透明可能引发合规问题。尤其针对链式云的开放网络,数据可能流经不受控制的节点,安全和审计责任界定极为困难。
技术与生态演化风险
GPU 架构和 AI 框架迭代极快,Serverless GPU 平台若不能及时适配新卡、新库,或者依赖某种特定版本的 CUDA,可能造成技术栈迅速老化。初创平台若缺乏持续资金,也可能停止运营,导致依赖其 API 的应用面临中断风险。
链式云的额外不确定性
去中心化算力市场面临可验证计算的效率瓶颈、网络延迟波动、算力实际性能欺诈以及法律管辖权模糊等多重不确定性,目前在可用性和信赖度上远未达到企业生产标准。
12. 误读纠偏
“Serverless GPU 就是没有服务器”
Serverless 不是没有服务器,而是将服务器管理、扩缩容、故障恢复等工作完全移交给平台,用户无需关心服务器层面的存在,但幕后仍然有大量物理 GPU 集群在运转。
“Serverless GPU 适用于一切 GPU 任务”
并非如此。对需要长时间运行持续训练的大模型任务,预留整台 GPU 服务器或裸金属实例通常更加经济高效。Serverless GPU 更适合间歇性、短任务、突发推理和不确定负载的场景。稳态高负载使用反而不划算。
“冷启动问题早已解决”
虽然镜像预热、快照等技术大幅降低了冷启动时间,但在模型文件巨大(数十 GB)、网络存储吞吐有限时,冷启动仍然可以达到若干秒甚至更久。只有对延迟不敏感或配置预留实例的业务才能完全避免,但预留实例又削去了部分 Serverless 弹性优势。
“链式云将很快取代中心化云”
链式云为算力供给提供了去中心化愿景,但在性能、可靠性、合规等方面尚存明显短板。目前它更适合补充边缘案例和小范围实验,主流生产负载仍高度依赖中心化云厂商的成熟基础设施,短期内看不到取代趋势。
“Serverless GPU 一定比传统 GPU 云更便宜”
不一定。高度弹性的代价是单个 GPU 小时的均价往往高于长期预留或包年包月实例。只有在负载高度波动、平均利用率很低的情况下,按需调用模式才具备显著成本优势。组织需要仔细核算自身负载特性才能判断。
13. 最新事件
以下梳理截至 2024 年中前的部分行业动态,供参考(以公开报道为来源,具体请查阅各家公司官方公告)。
- 2023 年至 2024 年,CoreWeave 连续获得多轮大额融资,并启动大规模数据中心扩建,承诺交付数万块 NVIDIA H100 GPU,反映垂直 GPU 云的市场热度。(来源:CoreWeave 官方新闻及科技媒体报道。)
- AWS 在 2023 re:Invent 大会上宣布扩大 Lambda 函数的 GPU 支持,并在 SageMaker 中强化 Serverless Inference 的功能。(来源:AWS 官方博客。)
- 谷歌云于 2023 年推出 Cloud Run for GPU 的公测版,拓展无服务器容器在 AI 推理上的应用。(来源:Google Cloud 官方博客。)
- 阿里云在 2023 云栖大会上展示基于函数计算 FC 的 Stable Diffusion 开箱即用套件,主推 GPU Serverless 在 AIGC 推理中的易用性。(来源:阿里云官方报道。)
- 中国“东数西算”工程持续推进,多个数据中心集群加大 GPU 资源池建设,国产 GPU 适配成为多家云厂商的重点项目。(来源:国家相关部门文件及云厂商公开信息。)
- 针对高端 GPU 的贸易限制持续影响国内供应,部分云厂商优先将受限 GPU 用于训练,将更多推理场景导向国产芯片或上一代 GPU,并尝试以 Serverless 方式提升利用率。(基于公开市场分析。)
(动态持续更新,使用者请自行查阅各厂商官网及主流科技媒体。)
14. 跟踪指标
如要持续追踪 Serverless GPU 产业的进展与竞争力,可关注以下指标。
- 主流云平台 GPU 实例上线种类与区域扩张速度:观察可选的 NVIDIA、AMD、国产 GPU 型号是否增加,以及覆盖的数据中心区域数量。
- 冷启动延迟与最大并发指标:定期测试并在技术社区跟踪各平台的实际冷启动时间和最大可支持并发数。
- 计费粒度与单位成本变化:监控 GPU-秒、GB-秒价格走势,以及是否新增计费项(如网络出方向流量)。
- AI 推理市场渗透率:虽然直接统计困难,可间接通过大模型 API 提供商的底层基础设施选择、技术博客等方式估算。
- 垂直 GPU 云融资与扩张动态:CoreWeave、Lambda Labs、RunPod 等的融资轮次、自建数据中心规模和 GPU 采购量,反映市场信心与供给能力。
- 开源与标准化进展:如 KEDA、KNative 等第三方自动扩缩容项目对 GPU 的支持程度,以及厂商中立 API 框架的出现。
- 国产 GPU 兼容性与性能追踪:昇腾、寒武纪等在主流推理框架(PyTorch、ONNX Runtime 等)和 Serverless 平台的适配进展,以及性能/Watt 指标的提升。
- 监管与合规动态:各国数据本地化法规、芯片出口管制政策的变化,以及链式云相关的区块链算力合规讨论。
15. 信源
- NVIDIA 官方技术文档:vGPU、MIG 用户指南。
- AWS、Azure、Google Cloud、阿里云、腾讯云、华为云关于 Serverless 及 GPU 服务的官方产品页面与白皮书。
- CoreWeave、Lambda Labs、RunPod 等公司官网及技术博客。
- IDC、Gartner 关于公有云、Serverless、AI 基础设施的市场分析报告(2022-2024 年发布)。
- MarketsandMarkets、Fortune Business Insights、Allied Market Research 等机构关于 Serverless 计算、AI 芯片市场的报告(约 2023 年)。
- IEEE、ACM 相关论文:GPU 虚拟化、容器弹性调度、无服务器计算性能分析。
- 行业科技媒体(如 TechCrunch、The Information、极客公园、机器之心等)对 CoreWeave 融资、云厂商产品发布的报道。
- 国家发展改革委等部门关于“东数西算”工程的公开文件。
(以上来源均为公开可查,具体数据和事件以各机构及企业最终发布为准。)