模型层 开放阅读

语音到语音

Speech-to-Speech

概念 ID
speech-to-speech
更新时间
2026-05-29
来源数量
待补

语音到语音(Speech-to-Speech)

3 秒看懂

语音到语音(Speech-to-Speech, S2S) 是指系统接收用户语音输入,经过理解、推理后,直接生成语音输出的端到端或多阶段技术范式。核心目标:省去”语音→文字→语音”的传统串联链路,降低延迟、保留韵律与情感信息,实现更自然的人机语音交互。

3 分钟产业解释

为什么这件事重要?

过去十年,语音助手(Siri、Alexa、Google Assistant)的底层逻辑是 级联流水线(Cascaded Pipeline):

用户语音 → ASR(语音识别)→ 文本 → NLU/对话管理 → 文本生成 → TTS(语音合成)→ 播放

这条链路存在三个结构性问题:

  1. 延迟高:每个模块串行推理,端到端延迟通常在 1-3 秒量级[行业常见估算],对话体感差。
  2. 信息丢失:ASR 转文字后,语调、情感、停顿节奏、语速等 副语言信息(paralinguistic features) 被丢弃,TTS 很难还原。
  3. 错误级联:ASR 的识别错误会沿链传播,后续模块无法纠正。

S2S 的产业诉求正是解决这三类问题。2024 年以来,OpenAI GPT-4o 原生语音模式、Google Gemini Live、Moshi(Kyutai)、Meta SeamlessM4T v2 等产品/模型密集落地,标志着 S2S 从研究走向产品化。

商业价值映射

  • 实时客服/陪伴:延迟从秒级降到亚秒级,用户留存直接挂钩。
  • 实时翻译/同传:跨语言 S2S 对旅游、国际商务的场景价值巨大。
  • 无障碍/辅助:为听障/视障用户提供更自然的交互界面。
  • 车载/可穿戴:无屏设备对自然语音交互有刚性需求。

15 分钟专家深入

1. 技术范式分野:级联 vs. 端到端

当前 S2S 技术存在两大范式,处于 混合共存、端到端逐步崛起 的阶段:

范式 A:级联优化(Cascaded with Shortcut)

语音 → ASR → 文本 → LLM 推理 → 文本 → TTS → 语音
                        ↕(中间可保留语义向量/韵律embedding)

代表:大多数现有语音助手产品仍采用此架构。改进方向包括:

  • 流式 ASR + 流式 TTS 并行化(边识别边合成)
  • 在 ASR→LLM 之间传递语义 embedding 而非纯文本(保留更多原始信息)
  • LLM 流式 token 生成 + TTS 流式 chunk 合成的 流水线并行

范式 B:端到端语音-语音(End-to-End S2S)

语音输入 → [单一模型/紧密耦合架构] → 语音输出

代表模型与系统:

系统机构年份架构特点
GPT-4o 原生语音OpenAI2024多模态原生架构,具体细节未充分披露
Gemini LiveGoogle2024基于 Gemini 多模态大模型,具体细节未充分披露
MoshiKyutai2024开源,基于 Helium LLM + 多流音频 tokenizer,支持全双工
SeamlessM4T v2Meta2023-2024多语言翻译导向,S2S + S2T + T2S 多任务
MiniOmni社区2024基于开源 LLM 的轻量 S2S 方案
VALL-E / VALL-E XMicrosoft2023语音 codec 语言模型范式,可用于 S2S

2. 端到端 S2S 的关键子问题

端到端并非”一个模型什么都能做”,而是需要解决一系列子问题:

(1)语音表示 / 音频 Tokenization

原始音频波形(16kHz 采样 = 每秒 16,000 个样本)维度太高,直接建模不现实。核心方法:

  • 神经音频 Codec(Neural Audio Codec):如 EnCodec(Meta)、SoundStream(Google)、DAC(Descript Audio Codec)。将音频压缩为 离散 token 序列(通常多码本 RVQ 结构),码率可配置(1.5kbps ~ 24kbps),每秒产生数百到数千个 token。
    • EnCodec 示例:24kHz 输入,8 个 RVQ 层,每秒约 75 个 frame × 8 codebook = 约 600 token/s(取决于码率配置)。
  • 连续表示:用预训练语音 encoder(如 HuBERT、wav2vec 2.0、Whisper encoder)提取连续向量,不做离散化。
  • 混合方案:语义 token(来自语音理解模型)+ 声学 token(来自 codec),双流建模。例如 Moshi 使用的 Mimi codec 就走此路线。

(2)语言模型骨干(Backbone)

拿到 token 序列后,用 Transformer 语言模型建模。核心挑战:

  • 序列长度爆炸:文本 LLM 处理的 token 数一般百到千量级;语音 token 可达每秒数百个,一段 10 秒语音就是数千 token。对注意力机制的计算压力是平方级的。
  • 解决方案方向
    • 降低音频 token 率(更低码率 codec)
    • 线性/亚二次注意力(如 Mamba/SSM、RWKV 等非 Transformer 骨干)
    • 分层建模:先建模语义 token,再由声学 decoder 补充声学细节

(3)流式推理与延迟

S2S 交互对延迟极度敏感(人对对话间隙的容忍约 200-500ms):

  • 需要 chunk-level 流式推理:模型每接收一段音频就开始生成,而非等整句话说完。
  • 推理引擎优化:KV cache 复用、推测解码(speculative decoding)、量化(INT8/INT4)。
  • 语音 token 的生成速率需使得实时因子(RTF)< 1.0(即生成耗时短于音频时长),否则用户感知到停顿。

(4)全双工(Full-Duplex)交互

人类对话是全双工的——说话的同时可以听。Moshi 是较早公开实现此能力的开源系统:

  • 模型同时处理输入音频流和生成输出音频流。
  • 需要解决 回声消除(AEC)打断检测(barge-in)轮次切换(turn-taking) 等问题。
  • 架构上常见双流设计:一条流建模”听”(输入音频),另一条流建模”说”(输出音频),两流之间有交叉注意力或共享状态。

3. 语音对语音的”理解”到底理解了什么?

级联系统中,ASR 转文字后,LLM 读到的只是文本。这意味着:

信息维度文本能承载?S2S 能承载?
语义内容
说话人身份❌(需额外处理)❌(默认不保留,输出音色与输入说话人无关,除非专门设计保持/转换)
情感/情绪❌ / 部分(靠措辞)✅(韵律保留)
语速/节奏
停顿/犹豫
背景音/环境✅(取决于建模粒度)
多人重叠说话❌(ASR 通常失败)有可能(全双工架构)

这意味着 S2S 在 情感陪伴、心理咨询、语言教学、配音 等场景有本质性优势——它不只是”听懂说了什么”,还能”听出怎么说的”。


技术原理

端到端 S2S 的典型架构

以 Moshi(Kyutai, 2024)为参考架构(它是当前公开细节最完整的开源 S2S 系统之一):

┌─────────────────────────────────────────────────────────┐
│                    Moshi 架构概览                         │
│                                                          │
│  ┌──────────┐    ┌────────────────────┐   ┌──────────┐  │
│  │ 用户音频  │───→│   Mimi Codec       │──→│ Audio    │  │
│  │ (输入流)  │    │  (Neural Codec     │   │ Token    │  │
│  └──────────┘    │   多码本 RVQ)       │   │ 序列     │  │
│                  └────────────────────┘   └────┬─────┘  │
│                                                │         │
│                  ┌─────────────────────────────▼───────┐ │
│                  │     Helium (Transformer LLM)        │ │
│                  │                                      │ │
│                  │  内部多流处理:                         │ │
│                  │  · 语义流 (Inner Monologue)           │ │
│                  │  · 输出音频流 (Moshi's Voice)         │ │
│                  │  · 输入音频流 (User's Voice)          │ │
│                  │                                      │ │
│                  │  → 支持全双工: 同时处理输入+生成输出    │ │
│                  └──────────────────────────────────────┘ │
│                         │                                 │
│                  ┌──────▼──────┐                          │
│                  │ Mimi Decoder │                         │
│                  │ (RVQ → 波形) │                         │
│                  └──────┬──────┘                          │
│                         │                                 │
│                  ┌──────▼──────┐                          │
│                  │  输出语音    │                          │
│                  └─────────────┘                          │
└─────────────────────────────────────────────────────────┘

关键组件详解

(a)Mimi Codec(神经音频编解码器)

输入波形 (24kHz)
    │
    ▼
┌─────────────────────┐
│ Encoder (1D Conv)   │  → 连续潜向量 z
└─────────┬───────────┘
          │
          ▼
┌─────────────────────┐
│ RVQ (残差向量量化)    │  → 多层离散 code (如 8 层 codebook)
│ · 第1层: 语义信息为主 │     每层 codebook 大小约 2048-8192
│ · 后续层: 声学细节    │
└─────────┬───────────┘
          │
          ▼
┌─────────────────────┐
│ Decoder (1D Conv-T) │  → 重建波形
└─────────────────────┘

Mimi 的创新在于 第一层 RVQ 显式训练为语义通道(通过与语音理解模型的蒸馏对齐),后续层负责声学细节。这样 LLM 可以主要关注语义流,减少对海量声学 token 的建模负担。

(b)多流 Transformer

传统 LLM 是单序列建模。S2S 需要同时建模:

  • 系统自身的”思考”(内部独白 / inner monologue)
  • 系统的语音输出
  • 用户的语音输入

Moshi 的做法是在 Transformer 内部使用 多流注意力——不同流的 token 在不同位置排列,通过注意力 mask 控制信息流向。每一步(time step)同时产生一个语义 token 和一个声学 token,实现 同步多流生成

(c)延迟与实时性约束

关键公式:

实时因子 (RTF) = 生成耗时 / 音频时长

RTF  1.0 → 能实时生成(生成速度  播放速度)
RTF ≥ 1.0 → 无法实时,产生卡顿

S2S 系统的 RTF 目标通常要求 < 0.5(留出余量给网络传输和前端处理)。


技术演进史

时间里程碑关键意义
2012-2016传统级联 ASR+TTS 系统成熟Siri/Alexa/Google Assistant 产品化,但体验受限于延迟和信息丢失
2018Google Duplex(I/O Demo)展示了语音助手打电话预约餐厅的能力,引发对自然语音交互的想象;但底层仍是级联
2020-2021语音自监督模型爆发(wav2vec 2.0, HuBERT)为语音表示学习奠定基础,语音 encoder 质量大幅提升
2022AudioLM(Google)、SpeechGPT 等探索开始尝试用语言模型范式建模音频 token
2023VALL-E/VALL-E X(Microsoft)证明”语音 codec + LLM”范式的 zero-shot 语音合成能力
2023SeamlessM4T(Meta)多语言、多任务(S2S/S2T/T2S/T2T)统一模型
2024.05GPT-4o 发布,原生多模态端到端语音交互延迟显著降低,demo 中表现出情感理解和实时打断能力
2024.06Moshi 开源(Kyutai)首个完整细节公开的端到端全双工 S2S 系统
2024.07Gemini Live(Google)Google 的端到端语音交互产品化
2024 H2MiniOmni、SLAM-ASR 等开源社区跟进降低 S2S 研究门槛
2025持续演进中:多语言、情感可控、多人对话、长上下文产业进入产品化竞争阶段

趋势判断:S2S 正处于从 “技术验证”到”产品化” 的拐点,2024-2025 是关键窗口期。


技术路线对比

维度级联优化方案端到端 S2S
典型延迟1-3 秒 [行业估算]0.3-1 秒 [产品实测估算]
副语言信息保留差(ASR 丢弃)好(直觉建模)
可控性强(每模块可独立调优)弱(黑盒程度更高)
多语言扩展成熟(ASR/TTS 各自多语言)需大规模多语言训练数据
训练数据需求各模块独立,数据较易获取需要大量配对/连续语音交互数据(稀缺)
可解释性较强(每阶段有中间输出)较弱
工程成熟度高(大量工具链和部署经验)中低(仍在快速迭代)
推理成本各模块可分别优化单一大模型,显存/算力需求较高
代表产品传统语音助手、客服系统GPT-4o Voice, Gemini Live, Moshi

关键权衡:在当前阶段,级联方案在可控性、可部署性上仍有优势;端到端方案在体验质量上逐步拉开差距。中短期看,混合方案(用端到端模型处理核心对话,用级联模块处理边界情况如多语言翻译)可能是最务实的路线。


上下游

上游(S2S 依赖什么?)

环节关键要素典型供应商/方案
算力GPU 推理(实时 S2S 对推理延迟极敏感)NVIDIA(H100/H200/B200)、AMD MI300X 等
神经音频 Codec模型权重 + 推理库EnCodec (Meta)、DAC (Descript)、Mimi (Kyutai)
语音理解基础模型ASR、语音表示学习Whisper (OpenAI)、HuBERT (Meta)、wav2vec 2.0 (Meta)
LLM 骨干通用大语言模型开源:LLaMA 系列、Mistral;闭源:GPT、Gemini
语音数据语音交互、对话、多语言语音Common Voice (Mozilla)、LibriLight、各语种专有数据集
声学前端回声消除(AEC)、降噪、VADDSP 芯片厂商、WebRTC AEC、专用前端模块

下游(S2S 应用于什么?)

场景价值主张成熟度
智能客服降低延迟、提升自然度高(级联方案已广泛部署;端到端在试点)
AI 陪伴/情感交互保留情感信息是核心差异化中(产品探索中)
实时翻译/同传语音直出目标语言语音中(S2S 翻译质量仍在追赶级联方案)
车载/可穿戴语音无屏设备的自然交互
语言教学/口语练习需要精细的语音理解与反馈
无障碍辅助为残障用户提供语音界面早期
游戏/虚拟角色NPC 语音交互早期

关键指标

评估 S2S 系统的核心技术指标:

指标定义目标值(参考)测量方法
端到端延迟(E2E Latency)用户说完到系统开始输出的耗时< 500ms实测
实时因子(RTF)推理耗时 / 音频时长< 0.5计时
语音质量(MOS)主观听感评分,1-5 分> 3.5众包主观评测
语义准确性生成内容是否正确回应了输入与文本 LLM 对齐自动评测 + 人工
情感保真度输出语音是否正确反映了预期情感定性 / 人工评分人工
说话人一致性输出语音音色是否稳定主观评分人工
轮次切换准确率何时说话、何时停止、何时被打断> 90% [估算目标]交互测试
多语言覆盖率支持语言数 × 质量顶级系统覆盖数十种语言多语言基准测试
上下文窗口能处理的对话历史长度数十分钟级语音测试

供需与市场数据

市场规模

  • 语音 AI 整体市场:多家行业报告(Grand View Research、MarketsandMarkets 等)估算全球语音 AI 市场 2024 年规模约在 150-250 亿美元量级,CAGR 约 15-20% [行业报告口径,不同报告差异较大]。
  • S2S 细分:尚无独立统计口径,目前被计入对话式 AI / 语音助手子市场。随着端到端 S2S 产品化,预计将在 2025-2027 年获得独立市场关注。

供给侧关键瓶颈

  1. 高质量语音交互数据:端到端 S2S 需要大量自然对话音频数据(含情感标注、轮次标注),这类数据远比文本数据稀缺。
  2. 实时推理算力:S2S 对延迟极敏感,需要低延迟 GPU 推理。按 [供应链估算],一次实时 S2S 会话可能占用比文本聊天多 5-20 倍的 token 量(语音 token 率远高于文本),推理成本是关键限制。
  3. 多语言数据不均衡:英语数据最丰富,其他语言(尤其低资源语言)数据稀缺。

需求侧信号

  • OpenAI GPT-4o 语音模式上线后获得大量用户使用 [公开报道]。
  • 2024-2025 年,多家科技公司在语音交互方向加大投入(Google、Apple、Meta、Samsung 等)[公开信息]。
  • 企业客服、电信、金融等行业对语音 AI 的采购意愿持续上升 [行业调研口径]。

代表公司与资本映射

公司/机构角色S2S 相关布局上市/融资状态
OpenAI闭源 S2S 旗舰GPT-4o 原生语音模式,多模态端到端未上市(巨额融资,估值数百亿美元)
Google / DeepMind闭源多模态大模型Gemini Live,语音-视觉-文本统一模型Alphabet (GOOGL)
Meta / FAIR开源基础研究SeamlessM4T v2, EnCodec, Voicebox, Moshi 合作Meta (META)
Apple端侧语音Siri 升级方向、端侧模型(Apple Intelligence)AAPL
Microsoft语音模型研究VALL-E 系列、Azure 语音服务MSFT
Kyutai开源 S2S 先锋Moshi(首个完整开源端到端全双工 S2S)法国 AI 实验室,融资信息待确认
ElevenLabsAI 语音合成语音合成/克隆技术,S2S 的下游 TTS 环节已融资,估值约数十亿美元 [公开报道]
SoundHound AI语音 AI 平台车载/餐饮语音交互,正向端到端演进SOUN(NASDAQ)
Cerence车载语音传统级联方案,正在探索下一代架构CRNC(NASDAQ)
科大讯飞中文语音龙头星火大模型 + 语音交互全链路002230.SZ
思必驰对话式 AI语音交互平台,车载/IoT 场景688163.SH

A 股映射思路(非投资建议):

  • 直接相关:科大讯飞(语音 AI 全栈)、思必驰(对话式 AI)
  • 上游算力:海光信息、寒武纪等(推理芯片)
  • 语音前端芯片:恒玄科技、炬芯科技等(音频处理 SoC)
  • 应用层:关注布局 AI 客服/AI 陪伴的公司

投资逻辑

核心观点

  1. S2S 是 LLM 交互范式的重要演进方向:从”读写”(文本聊天)到”听说”(语音交互),交互界面自然化是不可逆趋势。语音交互的 TAM(总可寻址市场)远大于文本交互——全球数十亿不擅长打字的用户(老人、儿童、非英语母语者、发展中地区用户)都可能因此进入 AI 交互市场。

  2. 端到端 vs. 级联的路线之争是短期最大变量:端到端体验更优但工程成熟度不足,级联方案可部署但天花板明显。短期内级联方案的存量市场不会被快速替代,但增量高端场景会逐步转向端到端。

  3. 推理成本是商业化的核心约束:语音 token 率远高于文本,S2S 会话的推理成本可能是文本聊天的 10 倍以上 [粗略估算]。谁能用更小的模型实现更好的 S2S 体验(压缩 token 率、降低模型参数量),谁就拥有成本优势。

  4. 数据飞轮是护城河:高质量语音交互数据极度稀缺。拥有大规模真实用户语音交互数据的公司(如 OpenAI、Google、Apple、科大讯飞)在 S2S 赛道具有结构性优势。

风险提示

  • 技术路线不确定性:端到端 S2S 仍在快速迭代,今天的技术方案可能在 1-2 年内被颠覆。
  • 监管风险:语音克隆、深度伪造(deepfake)问题可能引发监管收紧,影响语音 AI 部署。
  • 隐私问题:语音数据比文本更敏感,涉及个人身份信息(声纹)和环境信息,合规成本高。

常见误读纠偏

❌ 误读 1:“S2S 就是 ASR + LLM + TTS 串起来,没什么新东西”

纠偏:级联方案确实如描述,但 端到端 S2S 的核心创新在于消除了文字中间表示。模型直接在语音 token 空间中完成理解和生成,保留了韵律、情感、语速等副语言信息。这不是简单地把三个模型粘在一起——它需要全新的训练范式(语音-语音预训练)、新的 tokenizer(神经音频 codec)、新的交互机制(全双工/流式)。类比:JPEG 压缩后再解压看图 vs. 直接用相机取景器看——信息损失和延迟完全不同。

❌ 误读 2:“GPT-4o 语音模式是端到端的,所以延迟低”

纠偏:GPT-4o 原生语音模式的技术细节 并未被 OpenAI 完整公开。虽然 OpenAI 宣称其为”原生多模态”,但具体是否完全消除了 ASR/TTS 中间步骤、语音 token 化方案细节等均 未充分披露。其低延迟可能来自端到端架构,也可能来自级联链路的高度优化(流式 ASR + 流式 TTS + 流式 LLM 的流水线并行)。在官方技术论文发布前,不宜断言其架构归属。

❌ 误读 3:“端到端 S2S 已经完全取代级联方案”

纠偏远未取代。截至 2025 年,绝大多数生产环境中的语音交互系统仍是级联方案。端到端方案在延迟和体验上有优势,但在可控性、可调试性、多语言覆盖、推理成本上仍有明显短板。产品选型需要根据场景权衡,不存在”全面碾压”。

❌ 误读 4:“S2S = 语音克隆/深度伪造”

纠偏:语音克隆/深度伪造是语音合成技术的 滥用场景,不是 S2S 的定义或主要用途。S2S 系统可以使用固定的系统音色(不模仿任何真人),也可以提供可控的语音生成(用户选择音色)。行业正在建立声纹水印、合成检测等技术防线。


学习路径

入门(1-3 天)

  1. 了解语音处理基础:采样率、频谱图、MFCC、端点检测
  2. 学习 ASR 基础:CTC、Attention-based Seq2Seq、Whisper 架构
  3. 学习 TTS 基础:Tacotron、VITS、端到端 TTS

进阶(1-2 周)

  1. 学习神经音频 Codec:阅读 EnCodec 论文(Défossez et al., 2022),理解 RVQ(残差向量量化)机制
  2. 学习语音语言模型范式:阅读 AudioLM(Borsos et al., 2023)和 VALL-E(Wang et al., 2023)
  3. 阅读 Moshi 论文(Défossez et al., 2024)——这是理解端到端 S2S 的最佳技术文档之一
  4. 动手实验:用 Hugging Face 上的开源模型(Moshi, MiniOmni)搭建一个本地 S2S demo

专家(持续跟进)

  1. 跟踪主流会议:Interspeech、ICASSP、NeurIPS、ICML 中的语音/音频生成 Workshop
  2. 关注技术报告:OpenAI、Google、Meta 的技术博客和论文
  3. 实践优化:流式推理、低延迟部署、多语言适配

推荐资源

  • 论文:Moshi (Kyutai, 2024)、SeamlessM4T (Meta, 2023)、SpeechGPT (Zhang et al., 2023)、VALL-E (Wang et al., 2023)
  • 开源代码:Kyutai/Moshi (GitHub)、facebookresearch/seamless_communication
  • 博客:Hugging Face 博客中关于音频/语音模型的系列文章
  • 工具:Hugging Face Transformers(音频模型支持)、Gradio(快速 demo)

一句话总结

S2S 让 AI 从”读懂你的文字”进化为”听懂你的话语”——它不仅理解你说了什么,还理解你怎么说的,是人机交互走向自然化的关键技术拐点。


延伸阅读与来源

来源说明
Défossez et al., “Moshi: a speech-text foundation model for real-time dialogue”, 2024端到端全双工 S2S 最详细的开源技术文档
Meta SeamlessM4T / SeamlessM4T v2, 2023-2024多语言 S2S/S2T/T2S 统一模型
OpenAI GPT-4o 技术博客, 2024.05GPT-4o 原生多模态能力介绍(技术细节有限)
Borsos et al., “AudioLM: a Language Modeling Approach to Audio Generation”, 2023语音语言模型范式的开创性工作
Wang et al., “Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers”, 2023 (VALL-E)语音 codec + LLM 范式
Défossez et al., “High Fidelity Neural Audio Compression” (EnCodec), 2022神经音频 codec 的经典工作
Hugging Face Blog: Audio Transformers 系列开源社区对语音模型的实践教程
SoundHound AI (SOUN) SEC Filings / Investor Presentations语音 AI 商业化进展的上市公司视角
行业报告:Grand View Research, MarketsandMarkets 语音 AI 市场报告市场规模估算(不同报告口径有差异)

*本文档技术事实基于公开论文和产品发布信息。未被充分披露的系统细节(如 GPT-4o 的具体架构)标注为”未

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型