数字人
3 秒看懂
数字人是以计算机图形学、语音合成、自然语言处理、大语言模型与AI生成内容等技术为核心,构建的具备人类外观、行为特征与交互能力的虚拟实体。其核心价值在于以可编程、高保真、低边际成本的方式,在虚拟或现实中替代、辅助或延伸人类进行服务、交互与内容创造,成为AI与现实世界之间“最后一公里”的具身化接口。
3 分钟产业解释
数字人并非单一产品,而是一个技术栈深度融合的系统性工程。其产业链从底层到应用可解构为三个核心层:
- 技术层(基础引擎与模型):提供底层算力(GPU)、图形渲染引擎(Unreal Engine、Unity)、动作捕捉硬件、语音合成(TTS)与识别(ASR)SDK、自然语言处理(NLP)框架以及预训练大语言模型(LLM)与视频生成模型。该层决定数字人的智力上限与视觉效果极限。
- 制作层(资产管理平台):将技术能力转化为可交互的虚拟资产,包括3D建模、骨骼绑定、面部驱动、动画制作、声音克隆与多模态合成。制作层的核心矛盾在于品质、成本与生产周期的不可能三角;目前行业正从手动精修向AI辅助生成乃至全自动生成迁移。
- 应用层(场景落地):将数字人投入具体业务流,典型场景包括虚拟偶像与直播、企业数字员工(客服、营销、培训)、金融理财顾问、医疗导诊、文旅导览、教育虚拟讲师、个人数字分身等。该层检验数字人能否实现可量化的商业价值。
产业逻辑当前正处于关键转折期:从“手工作坊式摄影棚生产”转向“AI工业化流水线实时交互”。驱动力由传统美术与动捕团队,变为以大语言模型+多模态生成模型为核心的自主交互智能体,数字人正从“会动的皮囊”升级为“有灵魂的助手”。
技术原理
数字人的完整技术栈可以看作是“感知—认知—表达—呈现”的闭环系统,其模块协作关系如下:
[用户输入] → [感知层] → [认知层/AI大脑] → [表达决策]
(语音/文本/图像) (ASR/NLP/情感识别) (LLM+RAG+记忆) (文本/情绪/动作指令)
│
▼
[驱动与生成层] ← [模型资产库]
(面部/肢体/语音) (3D/2D资产)
│
▼
[渲染呈现层]
(实时引擎/AI合成)
- 感知层:负责将多模态输入转化为结构化语义。语音识别(ASR)将语音转为文本,自然语言理解(NLU)提取意图与实体,情感识别模块则分析用户语气、表情与姿态。准确率与延迟是核心指标,微软、百度、阿里等云服务商的ASR准确率在标准环境下已达97%以上(2023年公开测试数据)。
- 认知层:以LLM为核心,结合检索增强生成(RAG)技术与领域知识库,实现有逻辑、有上下文记忆、符合角色设定的对话。长短期记忆管理、多轮对话一致性、拒绝不当请求的安全能力,直接决定了用户是否感觉“对面像个人”。
- 表达决策层:将认知层输出的文本和情绪标签,映射为具体的动作、表情与语音合成指令。传统方式依靠规则和动作库,现代方法则使用语音驱动的面部动画合成(如基于扩散模型的唇形同步)以及大语言模型直接生成行为序列。
- 驱动与生成层:根据表达指令,同步生成语音(TTS)和视觉表现。语音合成需要处理韵律、情感、停顿;视觉生成则要保证唇形匹配、表情细腻、动作自然。技术路线包括3D动画驱动和2D/3D神经辐射场(NeRF)/扩散模型视频生成。
- 渲染呈现层:将驱动信号实时渲染为画面。3D引擎(Unreal Engine 5, Unity)可提供可自由镜头、高交互性的三维场景;2D路线则依赖视频流合成,成本更低但交互维度受限。渲染质量可用帧率(≥30fps)、分辨率(至少1080P)和光线真实度衡量。
关键参数
评估数字人系统或产品,建议从四个维度建立定量与定性指标体系:
1. 形象与表现力
- 几何精度/面数:3D数字人超写实模型的面数通常在10万–100万面之间(2023年行业实践)。AI视频生成路线不适用此指标。
- 唇形同步误差(Lip-Sync Error):以毫秒或帧数衡量。高质量系统要求音频与嘴唇运动时差在±40ms以内,否则用户会感知到脱节。
- 表情维度:基于面部动作编码系统(FACS),高品质数字人需支持至少30个以上的面部动作单元(AU),以实现细腻情感表达。
- 恐怖谷规避程度:通过用户主观评测,卡通/风格化设计可能比超写实更易被接受。企业通常用A/B测试留存率衡量。
2. 智能与交互
- 对话质量:可用任务完成率、对话轮次(CPS)、用户满意度(CSAT)衡量。接入GPT-4级别模型的数字人,在金融产品咨询测试中任务完成率可达85%以上(2024年行业案例引用)。
- 响应延迟:端到端交互延迟(语音输入到画面与声音反馈)应低于2秒,否则对话流畅感崩溃。各家公开的最优指标在800ms–1.5s之间(2023年实测数据)。
- 知识覆盖与幻觉率:RAG的准确率直接影响信任度。金融等严肃场景要求幻觉率低于2%,来源可追溯。
3. 生产效率与成本
- 创建成本:一个高品质3D超写实数字人的定制成本在2020年仍高达30万–100万元人民币,2023年已下降至5万–20万元(行业调研)。AI驱动口播数字人制作成本可低至数千元。
- 制作周期:从扫描建模到上线,传统路线需4–8周,AI化路线可压缩至24小时以内。
- 运行边际成本:云渲染与API调用成本,实时交互数字人每分钟成本在0.1–1元人民币区间(2024年公开定价信息估算)。
4. 商业效果
- 替代效率:如数字人直播场均GMV/观看-转化率,或数字人客服处理咨询量(提升比例%),必须对标真人基线。
- 用户接受度/留存率:7日/30日留存率是衡量数字人服务是否被持续使用的硬指标。部分虚拟陪伴类应用留存在10%–20%区间(2023年公开数据)。
- 资产复用率:3D数字人资产在多场景、多渠道的复用次数,是衡量资产回报的关键。
技术路线
数字人的视觉与交互呈现当前有三条主要技术路线,其2024年态势对比如下:
| 维度 | 传统3D建模驱动路线 | AI视频生成路线(扩散/NeRF) | 混合实时驱动路线(2.5D/3D GS) |
|---|---|---|---|
| 核心资产 | 多边形模型、骨骼绑定、PBR材质、动作捕捉库 | 大规模视频扩散模型、LoRA权重、Prompt库 | 3D高斯泼溅(3DGS)或可驱动NeRF表示+生成先验 |
| 代表技术 | MetaHuman, Character Creator, Maya+动捕 | SadTalker, MuseTalk, EMO, Sora | NVIDIA Audio2Face, 阿里Talking Head GS, 实时2D人脸重演 |
| 优势 | 多视角自由,资产高度可复用,物理交互丰富,严格人设可控 | 真实感上限极高,风格化灵活,生成成本低,无3D管线 | 实时交互可行,角度可调整,部分资产可编辑,生成质量较好 |
| 劣势 | 创作成本高、周期长,对美术团队依赖,LLM集成复杂 | 视角受限,资产难以编辑和拆分,实时驱动延迟高,幻觉运动 | 技术整合复杂,硬件要求高,训练与推理效率待优化 |
| 主要场景 | 高价值虚拟偶像、3A游戏NPC、影视特效、多平台复用企业大使 | 短视频口播、社交媒体广告、有声漫画、快速原型 | 直播互动、全息客服、大小屏硬件助手 |
| 成熟度 | 成熟,有多年积累 | 快速迭代,尚不完美 | 开始落地,处于早期商用 |
趋势判断:3D路线不会消亡,而是走向AI自动化辅助建模与动画生成,大幅降低门槛。视频生成路线将在非实时、高真实感内容领域占据优势。混合路线可能在未来2–3年内成为实时交互主战场,结合可微渲染与轻量级Transformer,实现可控、可信、可交互的“三可”数字人。
上游
数字人产业链上游由底层硬件、基础软件平台和预训练模型三大类构成,是整个产业的技术源头与成本瓶颈。
硬件层
- 计算芯片:GPU是训练大模型与实时渲染的核心。英伟达(NVIDIA)A100/H100在云端训练与推理中占据主导,2023年数据中心GPU收入达475亿美元(英伟达FY2024年报)。国产替代如华为昇腾、寒武纪等加速导入,但生态仍有差距。
- 动作捕捉设备:光学动捕(Vicon、OptiTrack)精度最高但成本高昂;惯性动捕(Xsens)与视觉动捕(基于RGB相机)性价比提升。2023年消费级面部捕捉(如iPhone ARKit)已成为轻量级方案首选。
- 摄像头与传感器:深度摄像头(如Intel RealSense、结构光)用于面部与体态重建,成本持续下降。
基础软件与工具
- 3D引擎:Epic Games的Unreal Engine与Unity占据市场双寡头地位。UE5的MetaHuman提供超写实数字人快速生成,降低门槛。全球游戏引擎市场规模2022年约26亿美元,预计2028年达62亿美元(MarketsandMarkets数据)。
- 建模与动画工具:Autodesk Maya/3ds Max、Blender、ZBrush等用于精细建模;Reallusion Character Creator、Daz 3D面向轻量级创作;Adobe Substance用于材质。AI生成建模工具(如NVIDIA Picasso)正在出现。
- 语音技术SDK:微软Azure Speech、百度语音、阿里云语音等提供TTS与ASR云服务,以及声音复刻能力。2023年自然度MOS评分(5分制)普遍超过4.2。
- NLP与大模型平台:OpenAI GPT系列、Anthropic Claude、Meta Llama开源生态,以及国内百度文心、阿里通义、智谱GLM、百川等。这些是数字人大脑的基座,直接决定对话智能水平。
预训练资产与数据
- 人物外观与动画数据库:高质量扫描的人类面部、身体运动捕捉数据(如RenderPeople、3D Scan Store),是训练生成模型和减轻恐怖谷的原料。
- 多模态对齐数据集:语音-嘴唇、文本-表情、手势的配对数据仍稀缺,是行业瓶颈。部分公司通过自建或采集积累。公开数据集如LRS3(唇读)被广泛采用。
下游
数字人下游应用覆盖文化娱乐、企业服务、个人消费三大领域,需求层次从“一次性吸睛”向“持续性替代人力”深化。
1. 文化娱乐与内容
- 虚拟偶像/主播:以洛天依、A-SOUL等为代表,主要通过直播打赏、商演和品牌代言变现。据艾媒咨询报告,2023年中国虚拟人带动产业市场规模和核心市场规模分别为3334.7亿元和205.2亿元(口径为泛虚拟人产业),直播电商是主要应用场景。
- 短视频与营销:品牌自建数字人形象用于短视频口播、社交账号运营,替代重复性真人拍摄,成本降低90%以上(行业案例估算)。
- 影视与游戏:数字替身用于高难度动作戏、群集模拟;游戏中NPC智能化。生成式AI让NPC拥有自主对话,如《逆水寒》手游中接入LLM的智能NPC,2023年上线后玩家互动量激增。
2. 企业服务与生产力
- 金融:数字理财经理、智能投顾,提供7×24视频咨询服务。某股份行试点数字人柜台,人力替代率约30%(2023年项目调研数据)。
- 电商直播:品牌自播采用数字人轮播,覆盖闲时流量,场次增加3–5倍,部分案例显示成本降至真人直播的1/10,但转化率差距仍存。
- 教育培训:数字人讲师用于标准化课程录制、企业培训,多语言输出,极大降低培训成本。
- 医疗健康:虚拟导诊、心理健康陪伴、康复训练指导。数字人界面在老年看护、心理咨询中具备无偏见交互优势。
- 文旅政务:虚拟导游、数字讲解员、政府服务大厅虚拟办事员。多地景区、博物馆已部署,增强互动体验。
3. 个人应用与元宇宙
- 数字分身与记忆:个人虚拟形象用于远程会议、社交平台,部分初创探索“数字永生”服务,但伦理争议大。
- AI伴侣与情感交互:以Character.AI、Replika和国内星野等为代表,通过数字人形象与用户建立长期陪伴关系。Character.AI月活用户已达千万级别(2023年数据),商业化通过订阅制,但留存与长期价值待考。
下游核心矛盾在于 “替代真人”与“辅助真人”的边界仍模糊。多数企业ROI模型尚未闭环,需关注具体场景的人效提升数值、留存率与边际成本。
受益公司
数字人产业链的价值分配呈现“上游工具平台拿确定性收益,下游应用公司博弹性回报”的特点。以下均基于2023–2024年公开信息,不构成任何投资建议。
上游基础设施受益方
- 英伟达(NVIDIA):GPU核心供应商,通过CUDA生态、Omniverse数字孪生平台、ACE(Avatar Cloud Engine)提供端到端数字人微服务,2024年GTC大会展示AI NPC技术Demo。
- Unity/Epic Games:引擎双雄。Epic通过MetaHuman、RealityCapture等工具链拓展虚拟制作;Unity凭借庞大开发者生态渗透移动和轻量数字人。
- 微软/亚马逊/阿里云等云厂商:提供语音、视觉和大模型API服务,构成数字人大脑和神经系统的底层能力平台。
技术平台型与解决方案公司
- 小冰公司:从微软分拆,拥有X框架、Rinne和多名虚拟人IP,重点布局社交陪伴和数字员工,2023年完成B轮融资。
- 魔珐科技:3D虚拟人全栈方案,主打超写实企业大使和虚拟内容制作中台,已与金融、互联网大厂合作。
- 硅基智能:聚焦AIGC数字人,推出硅语等产品,主打带货直播和短视频,2022年完成C轮融资,号称克隆成本降至千元级别。
- 商汤科技:SenseMARS平台提供数字人生成与驱动,结合大装置算力,赋能空间计算与文旅场景。
- 世优科技:以实时动捕和虚拟直播技术见长,为央视、B站等提供技术服务。
垂直应用与IP运营
- 蓝色光标/天下秀等营销集团:布局虚拟人IP(如苏小妹、AYAYI)和数字人营销服务,推动品牌合作。
- 乐华娱乐等经纪公司:打造并运营A-SOUL等头部虚拟女团,探索粉丝经济。
- 国内银行科技子公司:如光大科技、平安科技等,自研或合作开发数字人金融助手,用于零售客服。
开源生态与新兴势力
- Stability AI/ Runway:开源视频生成模型生态降低了二创和短内容数字人门槛。
- Hugging Face/GitHub:Wonder Studio、SadTalker、MuseTalk、EMO等项目大幅加速数字人平民化进程。
(注:各公司财务数据如数字人业务收入占比多未单独披露,公开资料未见具体份额数字,故不作罗列。)
市场规模
数字人市场处于早期高速膨胀期,不同研究机构因界定口径(核心/带动/泛虚拟人)不同,数据存在差异。以下汇总可得的2023–2024年公开发布数据,仅供参考:
- 中国虚拟数字人核心市场规模:据艾媒咨询,2023年约205.2亿元人民币,带动产业市场规模3334.7亿元(口径较宽,包含所有虚拟形象相关消费),预计2025年核心市场达480.6亿元。该数值包含虚拟偶像、虚拟主播、数字员工等,统一采用其广义定义。
- 全球数字人相关市场:根据Grand View Research报告,2023年全球虚拟人和数字人市场规模约175亿美元,复合年增长率(CAGR)约31.5%,预计2030年将超过1300亿美元。口径包含虚拟现实社交形象、数字助理等。
- 细分领域:MarketsandMarkets在2023年发布的数字人市场预测中,将交互式数字人分为客户服务和营销两大类,2023年估值为31.2亿美元,2028年有望达到113.3亿美元(CAGR 29.5%)。
- 中国AIGC数字人:量子位《2023年中国AIGC产业全景报告》估算,AIGC数字人作为生成式AI关键应用,当年市场规模约10亿–20亿元人民币量级,但增速极快,未来5年CAGR或超100%。
需注意,以上数据均基于机构预测,口径存在差异,且市场结构中大量投入为“试点”性质,真正带来营收和利润的项目比例有限。投资者需关注付费客户数量和客户生命周期价值等先行指标。部分海外高增长预测基于元宇宙预期,实际落地节奏可能受宏观和监管影响。
玩家对比
下面从技术路线、应用场景和商业化阶段,对比几类代表性公司(基于2023–2024年公开信息整理):
| 类别 | 代表公司/产品 | 核心路线 | 技术与产品特色 | 商业化情况 | 竞争壁垒 |
|---|---|---|---|---|---|
| 互联网大厂平台 | 百度曦灵、阿里通义星尘、腾讯智影 | 云原生2D/3D混合+LLM | 与自身云服务、大模型深度绑定;提供一站式平台 | 多为解决方案输出,部分内测,未拆分收入 | 算力+模型+生态协同 |
| 3D全栈方案 | 魔珐科技、网易伏羲 | 超写实3D建模+动捕+实时渲染 | 品质顶尖,可多平台复用;大客户定制化服务 | 服务大型企业,客单价高,项目制为主 | 美术资产积累,端到端管线 |
| AIGC视频路线 | 硅基智能、HeyGen、字节跳动火山引擎 | 视频扩散+语音克隆 | 创建快速、成本低,适合短视频与直播 | 订阅制/SaaS,走量模式,已有出海尝试 | 自动化程度、成本控制、效果逼真度 |
| AI伴侣/用户侧 | Character.AI、星野(Minimax)、小冰 | LLM对话+虚拟形象 | 注重情感陪聊与角色扮演,社区驱动 | 用户量大,订阅和增值服务盈利逐步验证 | 模型微调、数据飞轮、社区粘性 |
| 硬件与引擎平台 | NVIDIA、Unity | 技术基座赋能 | 提供SDK、中间件和参考设计 | 算力与许可证收入,高毛利率 | 技术标准、生态系统 |
| 垂直场景深耕 | 商汤、科大讯飞、海马云等 | 行业定制化 | 结合行业知识库,主攻金融、政务、医疗 | 项目交付,部分产品化 | 场景理解与数据闭环 |
关键观察:当前没有公司完全跑通“低成本高品质实时智能交互”的整个闭环。大厂平台有资源但缺乏灵活性,专业3D公司品质高但难以大规模铺开,视频流派效率高但交互浅。未来竞争力的焦点在于“技术栈一体化深度”与“场景知识飞轮”的双重构建。份额公开数据不足,均为定性比较。
风险
1. 技术路线颠覆风险 AI视频生成模型发展极快(如Sora),可能越过传统的3D建模与动捕管线,直接生成逼真交互画面,导致重资产投入3D资产的公司优势被瓦解。同时,实时3D高斯泼溅等新表示技术可能带来新的成本和交互范式。技术预测期内(3–5年)不确定性高。
2. 商业变现证伪风险 多数数字人项目仍处于POC或市场声量阶段,ROI不清晰。直播电商场景下数字人转化率通常低于真人头部主播;数字人客服NPS(净推荐值)可能低于人工。若持续无法证明可量化的降本增效或增收,企业IT支出将收缩。2023年部分厂商已出现BD放缓、项目裁撤迹象(行业观察)。
3. 监管与伦理风险
- 深度伪造(Deepfake)与诈骗:利用数字人进行身份仿冒、金融欺诈的风险加剧。2023年全球已出现多起利用AI换脸视频实施诈骗的案件。中国《互联网信息服务深度合成管理规定》《生成式人工智能服务管理暂行办法》等法律法规要求标识和备案,不合规将面临下架和处罚。
- 数字人“身份”与权益:数字人模仿已故名人的权益纠纷(肖像权、名誉权),以及虚拟员工劳动权益的灰色地带,可能引发诉讼。
- 对就业的冲击:数字人大规模替代基础客服、直播场控、基础培训等岗位,可能引发社会争议和行业抵触,需关注舆论和政策导向。
4. 用户接受度与体验瓶颈 长时间交互中,数字人的“非人感”仍然明显,重复对话逻辑单一、微表情呆板等问题导致用户新鲜感后流失快。AI伴侣类产品面临情感操控指责,留存曲线陡峭。在需要共情和复杂推理的场景中,数字人表现远不及人类。
5. 成本控制与规模效应的矛盾 实时智能交互的数字人需要消耗大量GPU推理资源,随着并发用户增加,云成本线性甚至超线性增长,可能侵蚀本已微薄的商业利润。将模型精简、端侧推理优化是解决路径,但技术尚不成熟。
误读纠偏
误读一:“数字人就是一定要长得像真人的超写实虚拟偶像” 纠偏:超写实只是表象的一种。大量成功的数字人产品采用二次元、低多边形、艺术风格化甚至纯抽象符号形态。风格化形象更容易规避恐怖谷,制作成本仅为超写实的10%–30%(行业经验),且更适配年轻化、国际化的品牌调性。数字人成败关键在“人设”、“智能”与“持续输出价值的能力”,而非皮肤质感。
误读二:“接入大模型后,数字人就可以完全自主对话,哪里都能用” 纠偏:LLM赋予了流利对话能力,但通用大模型缺乏领域知识、安全边界和事实核查。企业级数字人必须经过RAG知识增强、Prompt工程、权限管控和多层安全围栏,否则极易产生“幻觉”——编造产品参数、承诺不可能的服务,甚至违反合规要求。技术上,这需要大量工程投入和持续调优。
误读三:“数字人是独立产品,买来即用” 纠偏:数字人是一种“界面”,必须嵌入具体工作流才能发挥价值。真正考验的是系统集成能力:与CRM、知识库、业务系统的对接,与直播流、会议系统的打通。部署一个企业数字员工,IT咨询和流程改造的投入可能远大于数字人形象采购本身。
误读四:“数字人普及后,人就退场了” 纠偏:当前阶段,数字人最佳定位是“人机协同”助手——解决重复、标准化、跨时区的需求,将人类解放到需要创造性、情感和复杂决策的环节。银行数字人分流80%的常见问题,复杂理财方案仍需人工顾问;数字人老师可以讲授知识,但辅导作业、启发思考仍需真人教师。完全替代人既无技术可能,也非商业最优。
误读五:“开源一个SadTalker就能做数字人生意” 纠偏:开源模型大大降低了入门门槛,但从Demo到可用商业产品之间存在巨大鸿沟。稳定性、并发性能、安全合规、UE体验、持续迭代、企业级服务支持,每个环节都需巨大资源投入。开源项目更多是产业催化器,而不是完整的业务闭环。
最新事件
以下梳理2024年至2025年初行业关键动态(截至2025年3月):
- 2024年2月,OpenAI Sora发布:展示了文生视频的惊人能力,可生成高度逼真且连贯的人物视频,引发对传统3D数字人制作路线的广泛冲击讨论。行业普遍认为长视频创作、短视频营销等领域将优先受影响。
- 2024年6月,苹果Vision Pro在中国上市:空间计算设备对高保真3D虚拟形象提出需求,相关数字人制作与实时驱动公司获得新关注,3D高斯泼溅类技术加速适配。
- 2024年8月,腾讯发布智影数字人3.0:升级AI驱动能力,支持少样本声音克隆与实时文本驱动表情,重点拓展视频号生态。数家电商SaaS公司公布数字人直播方案,2024年双11期间品牌自播使用数字人比例显著上升(行业观察数据,未出官方统计)。
- 2024年9月,中国出台《人工智能生成合成内容标识办法》征求意见稿:进一步明确深度合成内容需显著标识,对数字人视频、直播应用提出合规红线。部分数字人直播间因而加上了“AI生成”标识。
- 2024年12月,Meta展示Codec Avatars 2.0:基于深度传感器的逼真面部重建技术,延迟极低,但离消费级产品仍有距离。
- 2025年1月,英伟达GTC预告发布Audio2Face等组件更新:让数字人面部表情与语音更同步,并推出小模型适配边缘设备。
- 2025年2月,多款开源2D数字人实时驱动项目(如MuseTalkPlus、SadTalker-v3)发布:大幅提升实时唇形同步与表情自然度,进一步压低中小团队使用门槛。
- 2025年3月,字节跳动Dreamina平台开放文本生成数字人视频:面向抖音创作者生态,内测AI口播视频创作,引发内容赛道竞争加剧。
(注:各项动态的具体财务影响及市场份额数据公开资料未见,仅列事件。)
跟踪指标
为持续评估数字人产业景气度和公司竞争力,建议跟踪以下指标:
产业层面
- 一级市场融资事件与金额:关注AIGC数字人、虚拟人方向早期项目融资节奏,判断资本热度。可用IT桔子、烯牛数据。
- 用户渗透指标:TikTok/抖音/快手等平台上带“虚拟人”标签的视频播放量、直播场次和观看人次变化。
- 政策与标准出台:网信办、工信部、人工智能产业联盟等发布的深度合成管理规定细则、数字人标准白皮书等。
- 算力与芯片供给:云端GPU租赁价格走势、英伟达消费级与数据中心GPU供应情况,影响实时渲染成本。
- 开源社区活跃度:GitHub上Star数增长快的数字人相关项目,以及论文数目(如CVPR/ICCV/SIGGRAPH相关专题)。
公司/产品层面
- 付费客户数(B端)或付费用户数(C端):是检验产品市场匹配的核心先行指标。
- 客户平均交互时长、活跃天数、留存率:对于AI伴侣、虚拟陪伴类产品尤其关键。
- 单次交互成本(元/次)与ARPU:衡量单位经济模型健康度。
- 渲染与推理时延(P50/P99):技术成熟度直接指标。
- 客户成功案例数及续约率:验证商业模式的可持续性。
信源
以下为主要参考信息源,可在专业数据库和媒体中获取原始数据与深度分析:
- 行业研究报告:
- 艾媒咨询《中国虚拟偶像/数字人行业发展研究报告》(年度更新)
- 量子位《中国AIGC产业全景报告》及系列细分报告
- Grand View Research, “Digital Human (Virtual Human) Market Size, Share & Trends Analysis Report”
- MarketsandMarkets, “Digital Human Market by Component, Application, and Region”
- 学术与会议:
- ACM SIGGRAPH / SIGGRAPH Asia(计算机图形学顶级会议,数字人形生成与动捕)
- CVPR, ICCV, ECCV(3D视觉、面部重建、生成模型)
- NeurIPS, ICML, ICLR(生成模型、扩散模型、语音合成)
- 关键词:“Talking Head Generation”,“Audio-Driven Facial Animation”,“3D Gaussian Splatting”等。
- 监管与标准:
- 国家互联网信息办公室《深度合成管理规定》《生成式人工智能服务管理暂行办法》及相关征求意见稿
- 中国人工智能产业发展联盟《数字人评估指标与测试方法》等白皮书
- 企业公开信息:
- 上市公司年报/季报(如NVIDIA, Unity, 百度, 腾讯等)中有关AI/虚拟人章节
- 创投平台(Crunchbase, 烯牛数据, IT桔子)融资披露
- 科技与产业媒体:
- 机器之心、36氪、量子位、新智元、TechCrunch对数字人企业及产品的深度报道
- 各证券公司研究部发布的虚拟人/元宇宙行业研究报告(需注意利益声明与时效性)
(注:文中出现的所有市场数据均已注明来源机构及年份,未详之处为“公开资料未见”。所有公司信息基于公开事实,不含任何投资建议。)