語音到語音(Speech-to-Speech)
3 秒看懂
語音到語音(Speech-to-Speech, S2S) 是指系統接收使用者語音輸入,經過理解、推論後,直接生成語音輸出的端到端或多階段技術範式。核心目標:省去”語音→文字→語音”的傳統串聯鏈路,降低延遲、保留韻律與情感資訊,實現更自然的人機語音互動。
3 分鐘產業解釋
為什麼這件事重要?
過去十年,語音助手(Siri、Alexa、Google Assistant)的底層邏輯是 級聯流水線(Cascaded Pipeline):
使用者語音 → ASR(語音識別)→ 文本 → NLU/對話管理 → 文本生成 → TTS(語音合成)→ 播放
這條鏈路存在三個結構性問題:
- 延遲高:每個模組序列推論,端到端延遲通常在 1-3 秒量級[行業常見估算],對話體感差。
- 資訊丟失:ASR 轉文字後,語調、情感、停頓節奏、語速等 副語言資訊(paralinguistic features) 被丟棄,TTS 很難還原。
- 錯誤級聯:ASR 的識別錯誤會沿鏈傳播,後續模組無法糾正。
S2S 的產業訴求正是解決這三類問題。2024 年以來,OpenAI GPT-4o 原生語音模式、Google Gemini Live、Moshi(Kyutai)、Meta SeamlessM4T v2 等產品/模型密集落地,標誌著 S2S 從研究走向產品化。
商業價值對映:
- 即時客服/陪伴:延遲從秒級降到亞秒級,使用者留存直接掛鉤。
- 即時翻譯/同傳:跨語言 S2S 對旅遊、國際商務的場景價值巨大。
- 無障礙/輔助:為聽障/視障使用者提供更自然的互動介面。
- 車載/可穿戴:無屏裝置對自然語音互動有剛性需求。
15 分鐘專家深入
1. 技術範式分野:級聯 vs. 端到端
當前 S2S 技術存在兩大範式,處於 混合共存、端到端逐步崛起 的階段:
範式 A:級聯最佳化(Cascaded with Shortcut)
語音 → ASR → 文本 → LLM 推論 → 文本 → TTS → 語音
↕(中間可保留語義向量/韻律embedding)
代表:大多數現有語音助手產品仍採用此架構。改進方向包括:
- 流式 ASR + 流式 TTS 並行化(邊識別邊合成)
- 在 ASR→LLM 之間傳遞語義 embedding 而非純文本(保留更多原始資訊)
- LLM 流式 token 生成 + TTS 流式 chunk 合成的 流水線並行
範式 B:端到端語音-語音(End-to-End S2S)
語音輸入 → [單一模型/緊密耦合架構] → 語音輸出
代表模型與系統:
| 系統 | 機構 | 年份 | 架構特點 |
|---|---|---|---|
| GPT-4o 原生語音 | OpenAI | 2024 | 多模態原生架構,具體細節未充分揭露 |
| Gemini Live | 2024 | 基於 Gemini 多模態大型模型,具體細節未充分揭露 | |
| Moshi | Kyutai | 2024 | 開源,基於 Helium LLM + 多流音訊 tokenizer,支援全雙工 |
| SeamlessM4T v2 | Meta | 2023-2024 | 多語言翻譯導向,S2S + S2T + T2S 多工 |
| MiniOmni | 社群 | 2024 | 基於開源 LLM 的輕量 S2S 方案 |
| VALL-E / VALL-E X | Microsoft | 2023 | 語音 codec 語言模型範式,可用於 S2S |
2. 端到端 S2S 的關鍵子問題
端到端並非”一個模型什麼都能做”,而是需要解決一系列子問題:
(1)語音表示 / 音訊 Tokenization
原始音訊波形(16kHz 取樣 = 每秒 16,000 個樣本)維度太高,直接建模不現實。核心方法:
- 神經音訊 Codec(Neural Audio Codec):如 EnCodec(Meta)、SoundStream(Google)、DAC(Descript Audio Codec)。將音訊壓縮為 離散 token 序列(通常多碼本 RVQ 結構),位元速率可配置(1.5kbps ~ 24kbps),每秒產生數百到數千個 token。
- EnCodec 示例:24kHz 輸入,8 個 RVQ 層,每秒約 75 個 frame × 8 codebook = 約 600 token/s(取決於位元速率配置)。
- 連續表示:用預訓練語音 encoder(如 HuBERT、wav2vec 2.0、Whisper encoder)提取連續向量,不做離散化。
- 混合方案:語義 token(來自語音理解模型)+ 聲學 token(來自 codec),雙流建模。例如 Moshi 使用的 Mimi codec 就走此路線。
(2)語言模型骨幹(Backbone)
拿到 token 序列後,用 Transformer 語言模型建模。核心挑戰:
- 序列長度爆炸:文本 LLM 處理的 token 數一般百到千量級;語音 token 可達每秒數百個,一段 10 秒語音就是數千 token。對注意力機制的計算壓力是平方級的。
- 解決方案方向:
- 降低音訊 token 率(更低位元速率 codec)
- 線性/亞二次注意力(如 Mamba/SSM、RWKV 等非 Transformer 骨幹)
- 分層建模:先建模語義 token,再由聲學 decoder 補充聲學細節
(3)流式推論與延遲
S2S 互動對延遲極度敏感(人對對話間隙的容忍約 200-500ms):
- 需要 chunk-level 流式推論:模型每接收一段音訊就開始生成,而非等整句話說完。
- 推論引擎最佳化:KV cache 複用、推測解碼(speculative decoding)、量化(INT8/INT4)。
- 語音 token 的生成速率需使得即時因子(RTF)< 1.0(即生成耗時短於音訊時長),否則使用者感知到停頓。
(4)全雙工(Full-Duplex)互動
人類對話是全雙工的——說話的同時可以聽。Moshi 是較早公開實現此能力的開源系統:
- 模型同時處理輸入音訊流和生成輸出音訊流。
- 需要解決 回聲消除(AEC)、打斷檢測(barge-in)、輪次切換(turn-taking) 等問題。
- 架構上常見雙流設計:一條流建模”聽”(輸入音訊),另一條流建模”說”(輸出音訊),兩流之間有交叉注意力或共享狀態。
3. 語音對語音的”理解”到底理解了什麼?
級聯絡統中,ASR 轉文字後,LLM 讀到的只是文本。這意味著:
| 資訊維度 | 文本能承載? | S2S 能承載? |
|---|---|---|
| 語義內容 | ✅ | ✅ |
| 說話人身份 | ❌(需額外處理) | ❌(預設不保留,輸出音色與輸入說話人無關,除非專門設計保持/轉換) |
| 情感/情緒 | ❌ / 部分(靠措辭) | ✅(韻律保留) |
| 語速/節奏 | ❌ | ✅ |
| 停頓/猶豫 | ❌ | ✅ |
| 背景音/環境 | ❌ | ✅(取決於建模粒度) |
| 多人重疊說話 | ❌(ASR 通常失敗) | 有可能(全雙工架構) |
這意味著 S2S 在 情感陪伴、心理諮詢、語言教學、配音 等場景有本質性優勢——它不只是”聽懂說了什麼”,還能”聽出怎麼說的”。
技術原理
端到端 S2S 的典型架構
以 Moshi(Kyutai, 2024)為參考架構(它是當前公開細節最完整的開源 S2S 系統之一):
┌─────────────────────────────────────────────────────────┐
│ Moshi 架構概覽 │
│ │
│ ┌──────────┐ ┌────────────────────┐ ┌──────────┐ │
│ │ 使用者音訊 │───→│ Mimi Codec │──→│ Audio │ │
│ │ (輸入流) │ │ (Neural Codec │ │ Token │ │
│ └──────────┘ │ 多碼本 RVQ) │ │ 序列 │ │
│ └────────────────────┘ └────┬─────┘ │
│ │ │
│ ┌─────────────────────────────▼───────┐ │
│ │ Helium (Transformer LLM) │ │
│ │ │ │
│ │ 內部多流處理: │ │
│ │ · 語義流 (Inner Monologue) │ │
│ │ · 輸出音訊流 (Moshi's Voice) │ │
│ │ · 輸入音訊流 (User's Voice) │ │
│ │ │ │
│ │ → 支援全雙工: 同時處理輸入+生成輸出 │ │
│ └──────────────────────────────────────┘ │
│ │ │
│ ┌──────▼──────┐ │
│ │ Mimi Decoder │ │
│ │ (RVQ → 波形) │ │
│ └──────┬──────┘ │
│ │ │
│ ┌──────▼──────┐ │
│ │ 輸出語音 │ │
│ └─────────────┘ │
└─────────────────────────────────────────────────────────┘
關鍵元件詳解:
(a)Mimi Codec(神經音訊編解碼器)
輸入波形 (24kHz)
│
▼
┌─────────────────────┐
│ Encoder (1D Conv) │ → 連續潛向量 z
└─────────┬───────────┘
│
▼
┌─────────────────────┐
│ RVQ (殘差向量量化) │ → 多層離散 code (如 8 層 codebook)
│ · 第1層: 語義資訊為主 │ 每層 codebook 大小約 2048-8192
│ · 後續層: 聲學細節 │
└─────────┬───────────┘
│
▼
┌─────────────────────┐
│ Decoder (1D Conv-T) │ → 重建波形
└─────────────────────┘
Mimi 的創新在於 第一層 RVQ 顯式訓練為語義通道(通過與語音理解模型的蒸餾對齊),後續層負責聲學細節。這樣 LLM 可以主要關注語義流,減少對海量聲學 token 的建模負擔。
(b)多流 Transformer
傳統 LLM 是單序列建模。S2S 需要同時建模:
- 系統自身的”思考”(內部獨白 / inner monologue)
- 系統的語音輸出
- 使用者的語音輸入
Moshi 的做法是在 Transformer 內部使用 多流注意力——不同流的 token 在不同位置排列,通過注意力 mask 控制資訊流向。每一步(time step)同時產生一個語義 token 和一個聲學 token,實現 同步多流生成。
(c)延遲與即時性約束
關鍵公式:
即時因子 (RTF) = 生成耗時 / 音訊時長
RTF 1.0 → 能即時生成(生成速度 播放速度)
RTF ≥ 1.0 → 無法即時,產生卡頓
S2S 系統的 RTF 目標通常要求 < 0.5(留出餘量給網路傳輸和前端處理)。
技術演進史
| 時間 | 里程碑 | 關鍵意義 |
|---|---|---|
| 2012-2016 | 傳統級聯 ASR+TTS 系統成熟 | Siri/Alexa/Google Assistant 產品化,但體驗受限於延遲和資訊丟失 |
| 2018 | Google Duplex(I/O Demo) | 展示了語音助手打電話預約餐廳的能力,引發對自然語音互動的想像;但底層仍是級聯 |
| 2020-2021 | 語音自監督模型爆發(wav2vec 2.0, HuBERT) | 為語音表示學習奠定基礎,語音 encoder 質量大幅提升 |
| 2022 | AudioLM(Google)、SpeechGPT 等探索 | 開始嘗試用語言模型範式建模音訊 token |
| 2023 | VALL-E/VALL-E X(Microsoft) | 證明”語音 codec + LLM”範式的 zero-shot 語音合成能力 |
| 2023 | SeamlessM4T(Meta) | 多語言、多工(S2S/S2T/T2S/T2T)統一模型 |
| 2024.05 | GPT-4o 釋出,原生多模態 | 端到端語音互動延遲顯著降低,demo 中表現出情感理解和即時打斷能力 |
| 2024.06 | Moshi 開源(Kyutai) | 首個完整細節公開的端到端全雙工 S2S 系統 |
| 2024.07 | Gemini Live(Google) | Google 的端到端語音互動產品化 |
| 2024 H2 | MiniOmni、SLAM-ASR 等開源社群跟進 | 降低 S2S 研究門檻 |
| 2025 | 持續演進中:多語言、情感可控、多人對話、長上下文 | 產業進入產品化競爭階段 |
趨勢判斷:S2S 正處於從 “技術驗證”到”產品化” 的拐點,2024-2025 是關鍵視窗期。
技術路線對比
| 維度 | 級聯最佳化方案 | 端到端 S2S |
|---|---|---|
| 典型延遲 | 1-3 秒 [行業估算] | 0.3-1 秒 [產品實測估算] |
| 副語言資訊保留 | 差(ASR 丟棄) | 好(直覺建模) |
| 可控性 | 強(每模組可獨立調優) | 弱(黑盒程度更高) |
| 多語言擴充套件 | 成熟(ASR/TTS 各自多語言) | 需大規模多語言訓練資料 |
| 訓練資料需求 | 各模組獨立,資料較易獲取 | 需要大量配對/連續語音互動資料(稀缺) |
| 可解釋性 | 較強(每階段有中間輸出) | 較弱 |
| 工程成熟度 | 高(大量工具鏈和部署經驗) | 中低(仍在快速迭代) |
| 推論成本 | 各模組可分別最佳化 | 單一大型模型,視訊記憶體/算力需求較高 |
| 代表產品 | 傳統語音助手、客服系統 | GPT-4o Voice, Gemini Live, Moshi |
關鍵權衡:在當前階段,級聯方案在可控性、可部署性上仍有優勢;端到端方案在體驗質量上逐步拉開差距。中短期看,混合方案(用端到端模型處理核心對話,用級聯模組處理邊界情況如多語言翻譯)可能是最務實的路線。
上下游
上游(S2S 依賴什麼?)
| 環節 | 關鍵要素 | 典型供應商/方案 |
|---|---|---|
| 算力 | GPU 推論(即時 S2S 對推論延遲極敏感) | NVIDIA(H100/H200/B200)、AMD MI300X 等 |
| 神經音訊 Codec | 模型權重 + 推論庫 | EnCodec (Meta)、DAC (Descript)、Mimi (Kyutai) |
| 語音理解基礎模型 | ASR、語音表示學習 | Whisper (OpenAI)、HuBERT (Meta)、wav2vec 2.0 (Meta) |
| LLM 骨幹 | 通用大語言模型 | 開源:LLaMA 系列、Mistral;閉源:GPT、Gemini |
| 語音資料 | 語音互動、對話、多語言語音 | Common Voice (Mozilla)、LibriLight、各語種專有資料集 |
| 聲學前端 | 回聲消除(AEC)、降噪、VAD | DSP 晶片廠商、WebRTC AEC、專用前端模組 |
下游(S2S 應用於什麼?)
| 場景 | 價值主張 | 成熟度 |
|---|---|---|
| 智慧客服 | 降低延遲、提升自然度 | 高(級聯方案已廣泛部署;端到端在試點) |
| AI 陪伴/情感互動 | 保留情感資訊是核心差異化 | 中(產品探索中) |
| 即時翻譯/同傳 | 語音直出目標語言語音 | 中(S2S 翻譯質量仍在追趕級聯方案) |
| 車載/可穿戴語音 | 無屏裝置的自然互動 | 中 |
| 語言教學/口語練習 | 需要精細的語音理解與反饋 | 中 |
| 無障礙輔助 | 為殘障使用者提供語音介面 | 早期 |
| 遊戲/虛擬角色 | NPC 語音互動 | 早期 |
關鍵指標
評估 S2S 系統的核心技術指標:
| 指標 | 定義 | 目標值(參考) | 測量方法 |
|---|---|---|---|
| 端到端延遲(E2E Latency) | 使用者說完到系統開始輸出的耗時 | < 500ms | 實測 |
| 即時因子(RTF) | 推論耗時 / 音訊時長 | < 0.5 | 計時 |
| 語音質量(MOS) | 主觀聽感評分,1-5 分 | > 3.5 | 眾包主觀評測 |
| 語義準確性 | 生成內容是否正確回應了輸入 | 與文本 LLM 對齊 | 自動評測 + 人工 |
| 情感保真度 | 輸出語音是否正確反映了預期情感 | 定性 / 人工評分 | 人工 |
| 說話人一致性 | 輸出語音音色是否穩定 | 主觀評分 | 人工 |
| 輪次切換準確率 | 何時說話、何時停止、何時被打斷 | > 90% [估算目標] | 互動測試 |
| 多語言覆蓋率 | 支援語言數 × 質量 | 頂級系統覆蓋數十種語言 | 多語言基準測試 |
| 上下文視窗 | 能處理的對話歷史長度 | 數十分鐘級語音 | 測試 |
供需與市場資料
市場規模
- 語音 AI 整體市場:多家行業報告(Grand View Research、MarketsandMarkets 等)估算全球語音 AI 市場 2024 年規模約在 150-250 億美元量級,CAGR 約 15-20% [行業報告口徑,不同報告差異較大]。
- S2S 細分:尚無獨立統計口徑,目前被計入對話式 AI / 語音助手子市場。隨著端到端 S2S 產品化,預計將在 2025-2027 年獲得獨立市場關注。
供給側關鍵瓶頸
- 高質量語音互動資料:端到端 S2S 需要大量自然對話音訊資料(含情感標註、輪次標註),這類資料遠比文本資料稀缺。
- 即時推論算力:S2S 對延遲極敏感,需要低延遲 GPU 推論。按 [供應鏈估算],一次即時 S2S 會話可能佔用比文本聊天多 5-20 倍的 token 量(語音 token 率遠高於文本),推論成本是關鍵限制。
- 多語言資料不均衡:英語資料最豐富,其他語言(尤其低資源語言)資料稀缺。
需求側訊號
- OpenAI GPT-4o 語音模式上線後獲得大量使用者使用 [公開報道]。
- 2024-2025 年,多家科技公司在語音互動方向加大投入(Google、Apple、Meta、Samsung 等)[公開資訊]。
- 企業客服、電信、金融等行業對語音 AI 的採購意願持續上升 [行業調研口徑]。
代表公司與資本對映
| 公司/機構 | 角色 | S2S 相關版面配置 | 上市/融資狀態 |
|---|---|---|---|
| OpenAI | 閉源 S2S 旗艦 | GPT-4o 原生語音模式,多模態端到端 | 未上市(鉅額融資,估值數百億美元) |
| Google / DeepMind | 閉源多模態大型模型 | Gemini Live,語音-視覺-文本統一模型 | Alphabet (GOOGL) |
| Meta / FAIR | 開源基礎研究 | SeamlessM4T v2, EnCodec, Voicebox, Moshi 合作 | Meta (META) |
| Apple | 端側語音 | Siri 升級方向、端側模型(Apple Intelligence) | AAPL |
| Microsoft | 語音模型研究 | VALL-E 系列、Azure 語音服務 | MSFT |
| Kyutai | 開源 S2S 先鋒 | Moshi(首個完整開源端到端全雙工 S2S) | 法國 AI 實驗室,融資資訊待確認 |
| ElevenLabs | AI 語音合成 | 語音合成/克隆技術,S2S 的下游 TTS 環節 | 已融資,估值約數十億美元 [公開報道] |
| SoundHound AI | 語音 AI 平台 | 車載/餐飲語音互動,正向端到端演進 | SOUN(NASDAQ) |
| Cerence | 車載語音 | 傳統級聯方案,正在探索下一代架構 | CRNC(NASDAQ) |
| 科大訊飛 | 中文語音龍頭 | 星火大型模型 + 語音互動全鏈路 | 002230.SZ |
| 思必馳 | 對話式 AI | 語音互動平台,車載/IoT 場景 | 688163.SH |
A 股對映思路(非投資建議):
- 直接相關:科大訊飛(語音 AI 全棧)、思必馳(對話式 AI)
- 上游算力:海光資訊、寒武紀等(推論晶片)
- 語音前端晶片:恆玄科技、炬芯科技等(音訊處理 SoC)
- 應用層:關注版面配置 AI 客服/AI 陪伴的公司
投資邏輯
核心觀點
-
S2S 是 LLM 互動範式的重要演進方向:從”讀寫”(文本聊天)到”聽說”(語音互動),互動介面自然化是不可逆趨勢。語音互動的 TAM(總可定址市場)遠大於文本互動——全球數十億不擅長打字的使用者(老人、兒童、非英語母語者、發展中地區使用者)都可能因此進入 AI 互動市場。
-
端到端 vs. 級聯的路線之爭是短期最大變數:端到端體驗更優但工程成熟度不足,級聯方案可部署但天花板明顯。短期內級聯方案的存量市場不會被快速替代,但增量高階場景會逐步轉向端到端。
-
推論成本是商業化的核心約束:語音 token 率遠高於文本,S2S 會話的推論成本可能是文本聊天的 10 倍以上 [粗略估算]。誰能用更小的模型實現更好的 S2S 體驗(壓縮 token 率、降低模型引數量),誰就擁有成本優勢。
-
資料飛輪是護城河:高質量語音互動資料極度稀缺。擁有大規模真實使用者語音互動資料的公司(如 OpenAI、Google、Apple、科大訊飛)在 S2S 賽道具有結構性優勢。
風險提示
- 技術路線不確定性:端到端 S2S 仍在快速迭代,今天的技術方案可能在 1-2 年內被顛覆。
- 監管風險:語音克隆、深度偽造(deepfake)問題可能引發監管收緊,影響語音 AI 部署。
- 隱私問題:語音資料比文本更敏感,涉及個人身份資訊(聲紋)和環境資訊,合規成本高。
常見誤讀糾偏
❌ 誤讀 1:“S2S 就是 ASR + LLM + TTS 串起來,沒什麼新東西”
糾偏:級聯方案確實如描述,但 端到端 S2S 的核心創新在於消除了文字中間表示。模型直接在語音 token 空間中完成理解和生成,保留了韻律、情感、語速等副語言資訊。這不是簡單地把三個模型粘在一起——它需要全新的訓練範式(語音-語音預訓練)、新的 tokenizer(神經音訊 codec)、新的互動機制(全雙工/流式)。類比:JPEG 壓縮後再解壓看圖 vs. 直接用相機取景器看——資訊損失和延遲完全不同。
❌ 誤讀 2:“GPT-4o 語音模式是端到端的,所以延遲低”
糾偏:GPT-4o 原生語音模式的技術細節 並未被 OpenAI 完整公開。雖然 OpenAI 宣稱其為”原生多模態”,但具體是否完全消除了 ASR/TTS 中間步驟、語音 token 化方案細節等均 未充分揭露。其低延遲可能來自端到端架構,也可能來自級聯鏈路的高度最佳化(流式 ASR + 流式 TTS + 流式 LLM 的流水線並行)。在官方技術論文釋出前,不宜斷言其架構歸屬。
❌ 誤讀 3:“端到端 S2S 已經完全取代級聯方案”
糾偏:遠未取代。截至 2025 年,絕大多數生產環境中的語音互動系統仍是級聯方案。端到端方案在延遲和體驗上有優勢,但在可控性、可除錯性、多語言覆蓋、推論成本上仍有明顯短板。產品選型需要根據場景權衡,不存在”全面碾壓”。
❌ 誤讀 4:“S2S = 語音克隆/深度偽造”
糾偏:語音克隆/深度偽造是語音合成技術的 濫用場景,不是 S2S 的定義或主要用途。S2S 系統可以使用固定的系統音色(不模仿任何真人),也可以提供可控的語音生成(使用者選擇音色)。行業正在建立聲紋水印、合成檢測等技術防線。
學習路徑
入門(1-3 天)
- 瞭解語音處理基礎:取樣率、頻譜圖、MFCC、端點檢測
- 學習 ASR 基礎:CTC、Attention-based Seq2Seq、Whisper 架構
- 學習 TTS 基礎:Tacotron、VITS、端到端 TTS
進階(1-2 周)
- 學習神經音訊 Codec:閱讀 EnCodec 論文(Défossez et al., 2022),理解 RVQ(殘差向量量化)機制
- 學習語音語言模型範式:閱讀 AudioLM(Borsos et al., 2023)和 VALL-E(Wang et al., 2023)
- 閱讀 Moshi 論文(Défossez et al., 2024)——這是理解端到端 S2S 的最佳技術文件之一
- 動手實驗:用 Hugging Face 上的開源模型(Moshi, MiniOmni)搭建一個本地 S2S demo
專家(持續跟進)
- 追蹤主流會議:Interspeech、ICASSP、NeurIPS、ICML 中的語音/音訊生成 Workshop
- 關注技術報告:OpenAI、Google、Meta 的技術部落格和論文
- 實踐最佳化:流式推論、低延遲部署、多語言適配
推薦資源
- 論文:Moshi (Kyutai, 2024)、SeamlessM4T (Meta, 2023)、SpeechGPT (Zhang et al., 2023)、VALL-E (Wang et al., 2023)
- 開原始碼:Kyutai/Moshi (GitHub)、facebookresearch/seamless_communication
- 部落格:Hugging Face 部落格中關於音訊/語音模型的系列文章
- 工具:Hugging Face Transformers(音訊模型支援)、Gradio(快速 demo)
一句話總結
S2S 讓 AI 從”讀懂你的文字”進化為”聽懂你的話語”——它不僅理解你說了什麼,還理解你怎麼說的,是人機互動走向自然化的關鍵技術拐點。
延伸閱讀與來源
| 來源 | 說明 |
|---|---|
| Défossez et al., “Moshi: a speech-text foundation model for real-time dialogue”, 2024 | 端到端全雙工 S2S 最詳細的開源技術文件 |
| Meta SeamlessM4T / SeamlessM4T v2, 2023-2024 | 多語言 S2S/S2T/T2S 統一模型 |
| OpenAI GPT-4o 技術部落格, 2024.05 | GPT-4o 原生多模態能力介紹(技術細節有限) |
| Borsos et al., “AudioLM: a Language Modeling Approach to Audio Generation”, 2023 | 語音語言模型範式的開創性工作 |
| Wang et al., “Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers”, 2023 (VALL-E) | 語音 codec + LLM 範式 |
| Défossez et al., “High Fidelity Neural Audio Compression” (EnCodec), 2022 | 神經音訊 codec 的經典工作 |
| Hugging Face Blog: Audio Transformers 系列 | 開源社群對語音模型的實踐教程 |
| SoundHound AI (SOUN) SEC Filings / Investor Presentations | 語音 AI 商業化進展的上市公司視角 |
| 行業報告:Grand View Research, MarketsandMarkets 語音 AI 市場報告 | 市場規模估算(不同報告口徑有差異) |
*本文件技術事實基於公開論文和產品釋出資訊。未被充分揭露的系統細節(如 GPT-4o 的具體架構)標註為”未