模型層 開放閱讀

語音到語音

Speech-to-Speech

概念 ID
speech-to-speech
更新時間
2026-05-29
來源數量
待補

語音到語音(Speech-to-Speech)

3 秒看懂

語音到語音(Speech-to-Speech, S2S) 是指系統接收使用者語音輸入,經過理解、推論後,直接生成語音輸出的端到端或多階段技術範式。核心目標:省去”語音→文字→語音”的傳統串聯鏈路,降低延遲、保留韻律與情感資訊,實現更自然的人機語音互動。

3 分鐘產業解釋

為什麼這件事重要?

過去十年,語音助手(Siri、Alexa、Google Assistant)的底層邏輯是 級聯流水線(Cascaded Pipeline):

使用者語音 → ASR(語音識別)→ 文本 → NLU/對話管理 → 文本生成 → TTS(語音合成)→ 播放

這條鏈路存在三個結構性問題:

  1. 延遲高:每個模組序列推論,端到端延遲通常在 1-3 秒量級[行業常見估算],對話體感差。
  2. 資訊丟失:ASR 轉文字後,語調、情感、停頓節奏、語速等 副語言資訊(paralinguistic features) 被丟棄,TTS 很難還原。
  3. 錯誤級聯:ASR 的識別錯誤會沿鏈傳播,後續模組無法糾正。

S2S 的產業訴求正是解決這三類問題。2024 年以來,OpenAI GPT-4o 原生語音模式、Google Gemini Live、Moshi(Kyutai)、Meta SeamlessM4T v2 等產品/模型密集落地,標誌著 S2S 從研究走向產品化。

商業價值對映

  • 即時客服/陪伴:延遲從秒級降到亞秒級,使用者留存直接掛鉤。
  • 即時翻譯/同傳:跨語言 S2S 對旅遊、國際商務的場景價值巨大。
  • 無障礙/輔助:為聽障/視障使用者提供更自然的互動介面。
  • 車載/可穿戴:無屏裝置對自然語音互動有剛性需求。

15 分鐘專家深入

1. 技術範式分野:級聯 vs. 端到端

當前 S2S 技術存在兩大範式,處於 混合共存、端到端逐步崛起 的階段:

範式 A:級聯最佳化(Cascaded with Shortcut)

語音 → ASR → 文本 → LLM 推論 → 文本 → TTS → 語音
                        ↕(中間可保留語義向量/韻律embedding)

代表:大多數現有語音助手產品仍採用此架構。改進方向包括:

  • 流式 ASR + 流式 TTS 並行化(邊識別邊合成)
  • 在 ASR→LLM 之間傳遞語義 embedding 而非純文本(保留更多原始資訊)
  • LLM 流式 token 生成 + TTS 流式 chunk 合成的 流水線並行

範式 B:端到端語音-語音(End-to-End S2S)

語音輸入 → [單一模型/緊密耦合架構] → 語音輸出

代表模型與系統:

系統機構年份架構特點
GPT-4o 原生語音OpenAI2024多模態原生架構,具體細節未充分揭露
Gemini LiveGoogle2024基於 Gemini 多模態大型模型,具體細節未充分揭露
MoshiKyutai2024開源,基於 Helium LLM + 多流音訊 tokenizer,支援全雙工
SeamlessM4T v2Meta2023-2024多語言翻譯導向,S2S + S2T + T2S 多工
MiniOmni社群2024基於開源 LLM 的輕量 S2S 方案
VALL-E / VALL-E XMicrosoft2023語音 codec 語言模型範式,可用於 S2S

2. 端到端 S2S 的關鍵子問題

端到端並非”一個模型什麼都能做”,而是需要解決一系列子問題:

(1)語音表示 / 音訊 Tokenization

原始音訊波形(16kHz 取樣 = 每秒 16,000 個樣本)維度太高,直接建模不現實。核心方法:

  • 神經音訊 Codec(Neural Audio Codec):如 EnCodec(Meta)、SoundStream(Google)、DAC(Descript Audio Codec)。將音訊壓縮為 離散 token 序列(通常多碼本 RVQ 結構),位元速率可配置(1.5kbps ~ 24kbps),每秒產生數百到數千個 token。
    • EnCodec 示例:24kHz 輸入,8 個 RVQ 層,每秒約 75 個 frame × 8 codebook = 約 600 token/s(取決於位元速率配置)。
  • 連續表示:用預訓練語音 encoder(如 HuBERT、wav2vec 2.0、Whisper encoder)提取連續向量,不做離散化。
  • 混合方案:語義 token(來自語音理解模型)+ 聲學 token(來自 codec),雙流建模。例如 Moshi 使用的 Mimi codec 就走此路線。

(2)語言模型骨幹(Backbone)

拿到 token 序列後,用 Transformer 語言模型建模。核心挑戰:

  • 序列長度爆炸:文本 LLM 處理的 token 數一般百到千量級;語音 token 可達每秒數百個,一段 10 秒語音就是數千 token。對注意力機制的計算壓力是平方級的。
  • 解決方案方向
    • 降低音訊 token 率(更低位元速率 codec)
    • 線性/亞二次注意力(如 Mamba/SSM、RWKV 等非 Transformer 骨幹)
    • 分層建模:先建模語義 token,再由聲學 decoder 補充聲學細節

(3)流式推論與延遲

S2S 互動對延遲極度敏感(人對對話間隙的容忍約 200-500ms):

  • 需要 chunk-level 流式推論:模型每接收一段音訊就開始生成,而非等整句話說完。
  • 推論引擎最佳化:KV cache 複用、推測解碼(speculative decoding)、量化(INT8/INT4)。
  • 語音 token 的生成速率需使得即時因子(RTF)< 1.0(即生成耗時短於音訊時長),否則使用者感知到停頓。

(4)全雙工(Full-Duplex)互動

人類對話是全雙工的——說話的同時可以聽。Moshi 是較早公開實現此能力的開源系統:

  • 模型同時處理輸入音訊流和生成輸出音訊流。
  • 需要解決 回聲消除(AEC)打斷檢測(barge-in)輪次切換(turn-taking) 等問題。
  • 架構上常見雙流設計:一條流建模”聽”(輸入音訊),另一條流建模”說”(輸出音訊),兩流之間有交叉注意力或共享狀態。

3. 語音對語音的”理解”到底理解了什麼?

級聯絡統中,ASR 轉文字後,LLM 讀到的只是文本。這意味著:

資訊維度文本能承載?S2S 能承載?
語義內容
說話人身份❌(需額外處理)❌(預設不保留,輸出音色與輸入說話人無關,除非專門設計保持/轉換)
情感/情緒❌ / 部分(靠措辭)✅(韻律保留)
語速/節奏
停頓/猶豫
背景音/環境✅(取決於建模粒度)
多人重疊說話❌(ASR 通常失敗)有可能(全雙工架構)

這意味著 S2S 在 情感陪伴、心理諮詢、語言教學、配音 等場景有本質性優勢——它不只是”聽懂說了什麼”,還能”聽出怎麼說的”。


技術原理

端到端 S2S 的典型架構

以 Moshi(Kyutai, 2024)為參考架構(它是當前公開細節最完整的開源 S2S 系統之一):

┌─────────────────────────────────────────────────────────┐
│                    Moshi 架構概覽                         │
│                                                          │
│  ┌──────────┐    ┌────────────────────┐   ┌──────────┐  │
│  │ 使用者音訊  │───→│   Mimi Codec       │──→│ Audio    │  │
│  │ (輸入流)  │    │  (Neural Codec     │   │ Token    │  │
│  └──────────┘    │   多碼本 RVQ)       │   │ 序列     │  │
│                  └────────────────────┘   └────┬─────┘  │
│                                                │         │
│                  ┌─────────────────────────────▼───────┐ │
│                  │     Helium (Transformer LLM)        │ │
│                  │                                      │ │
│                  │  內部多流處理:                         │ │
│                  │  · 語義流 (Inner Monologue)           │ │
│                  │  · 輸出音訊流 (Moshi's Voice)         │ │
│                  │  · 輸入音訊流 (User's Voice)          │ │
│                  │                                      │ │
│                  │  → 支援全雙工: 同時處理輸入+生成輸出    │ │
│                  └──────────────────────────────────────┘ │
│                         │                                 │
│                  ┌──────▼──────┐                          │
│                  │ Mimi Decoder │                         │
│                  │ (RVQ → 波形) │                         │
│                  └──────┬──────┘                          │
│                         │                                 │
│                  ┌──────▼──────┐                          │
│                  │  輸出語音    │                          │
│                  └─────────────┘                          │
└─────────────────────────────────────────────────────────┘

關鍵元件詳解

(a)Mimi Codec(神經音訊編解碼器)

輸入波形 (24kHz)


┌─────────────────────┐
│ Encoder (1D Conv)   │  → 連續潛向量 z
└─────────┬───────────┘


┌─────────────────────┐
│ RVQ (殘差向量量化)    │  → 多層離散 code (如 8 層 codebook)
│ · 第1層: 語義資訊為主 │     每層 codebook 大小約 2048-8192
│ · 後續層: 聲學細節    │
└─────────┬───────────┘


┌─────────────────────┐
│ Decoder (1D Conv-T) │  → 重建波形
└─────────────────────┘

Mimi 的創新在於 第一層 RVQ 顯式訓練為語義通道(通過與語音理解模型的蒸餾對齊),後續層負責聲學細節。這樣 LLM 可以主要關注語義流,減少對海量聲學 token 的建模負擔。

(b)多流 Transformer

傳統 LLM 是單序列建模。S2S 需要同時建模:

  • 系統自身的”思考”(內部獨白 / inner monologue)
  • 系統的語音輸出
  • 使用者的語音輸入

Moshi 的做法是在 Transformer 內部使用 多流注意力——不同流的 token 在不同位置排列,通過注意力 mask 控制資訊流向。每一步(time step)同時產生一個語義 token 和一個聲學 token,實現 同步多流生成

(c)延遲與即時性約束

關鍵公式:

即時因子 (RTF) = 生成耗時 / 音訊時長

RTF  1.0 → 能即時生成(生成速度  播放速度)
RTF ≥ 1.0 → 無法即時,產生卡頓

S2S 系統的 RTF 目標通常要求 < 0.5(留出餘量給網路傳輸和前端處理)。


技術演進史

時間里程碑關鍵意義
2012-2016傳統級聯 ASR+TTS 系統成熟Siri/Alexa/Google Assistant 產品化,但體驗受限於延遲和資訊丟失
2018Google Duplex(I/O Demo)展示了語音助手打電話預約餐廳的能力,引發對自然語音互動的想像;但底層仍是級聯
2020-2021語音自監督模型爆發(wav2vec 2.0, HuBERT)為語音表示學習奠定基礎,語音 encoder 質量大幅提升
2022AudioLM(Google)、SpeechGPT 等探索開始嘗試用語言模型範式建模音訊 token
2023VALL-E/VALL-E X(Microsoft)證明”語音 codec + LLM”範式的 zero-shot 語音合成能力
2023SeamlessM4T(Meta)多語言、多工(S2S/S2T/T2S/T2T)統一模型
2024.05GPT-4o 釋出,原生多模態端到端語音互動延遲顯著降低,demo 中表現出情感理解和即時打斷能力
2024.06Moshi 開源(Kyutai)首個完整細節公開的端到端全雙工 S2S 系統
2024.07Gemini Live(Google)Google 的端到端語音互動產品化
2024 H2MiniOmni、SLAM-ASR 等開源社群跟進降低 S2S 研究門檻
2025持續演進中:多語言、情感可控、多人對話、長上下文產業進入產品化競爭階段

趨勢判斷:S2S 正處於從 “技術驗證”到”產品化” 的拐點,2024-2025 是關鍵視窗期。


技術路線對比

維度級聯最佳化方案端到端 S2S
典型延遲1-3 秒 [行業估算]0.3-1 秒 [產品實測估算]
副語言資訊保留差(ASR 丟棄)好(直覺建模)
可控性強(每模組可獨立調優)弱(黑盒程度更高)
多語言擴充套件成熟(ASR/TTS 各自多語言)需大規模多語言訓練資料
訓練資料需求各模組獨立,資料較易獲取需要大量配對/連續語音互動資料(稀缺)
可解釋性較強(每階段有中間輸出)較弱
工程成熟度高(大量工具鏈和部署經驗)中低(仍在快速迭代)
推論成本各模組可分別最佳化單一大型模型,視訊記憶體/算力需求較高
代表產品傳統語音助手、客服系統GPT-4o Voice, Gemini Live, Moshi

關鍵權衡:在當前階段,級聯方案在可控性、可部署性上仍有優勢;端到端方案在體驗質量上逐步拉開差距。中短期看,混合方案(用端到端模型處理核心對話,用級聯模組處理邊界情況如多語言翻譯)可能是最務實的路線。


上下游

上游(S2S 依賴什麼?)

環節關鍵要素典型供應商/方案
算力GPU 推論(即時 S2S 對推論延遲極敏感)NVIDIA(H100/H200/B200)、AMD MI300X 等
神經音訊 Codec模型權重 + 推論庫EnCodec (Meta)、DAC (Descript)、Mimi (Kyutai)
語音理解基礎模型ASR、語音表示學習Whisper (OpenAI)、HuBERT (Meta)、wav2vec 2.0 (Meta)
LLM 骨幹通用大語言模型開源:LLaMA 系列、Mistral;閉源:GPT、Gemini
語音資料語音互動、對話、多語言語音Common Voice (Mozilla)、LibriLight、各語種專有資料集
聲學前端回聲消除(AEC)、降噪、VADDSP 晶片廠商、WebRTC AEC、專用前端模組

下游(S2S 應用於什麼?)

場景價值主張成熟度
智慧客服降低延遲、提升自然度高(級聯方案已廣泛部署;端到端在試點)
AI 陪伴/情感互動保留情感資訊是核心差異化中(產品探索中)
即時翻譯/同傳語音直出目標語言語音中(S2S 翻譯質量仍在追趕級聯方案)
車載/可穿戴語音無屏裝置的自然互動
語言教學/口語練習需要精細的語音理解與反饋
無障礙輔助為殘障使用者提供語音介面早期
遊戲/虛擬角色NPC 語音互動早期

關鍵指標

評估 S2S 系統的核心技術指標:

指標定義目標值(參考)測量方法
端到端延遲(E2E Latency)使用者說完到系統開始輸出的耗時< 500ms實測
即時因子(RTF)推論耗時 / 音訊時長< 0.5計時
語音質量(MOS)主觀聽感評分,1-5 分> 3.5眾包主觀評測
語義準確性生成內容是否正確回應了輸入與文本 LLM 對齊自動評測 + 人工
情感保真度輸出語音是否正確反映了預期情感定性 / 人工評分人工
說話人一致性輸出語音音色是否穩定主觀評分人工
輪次切換準確率何時說話、何時停止、何時被打斷> 90% [估算目標]互動測試
多語言覆蓋率支援語言數 × 質量頂級系統覆蓋數十種語言多語言基準測試
上下文視窗能處理的對話歷史長度數十分鐘級語音測試

供需與市場資料

市場規模

  • 語音 AI 整體市場:多家行業報告(Grand View Research、MarketsandMarkets 等)估算全球語音 AI 市場 2024 年規模約在 150-250 億美元量級,CAGR 約 15-20% [行業報告口徑,不同報告差異較大]。
  • S2S 細分:尚無獨立統計口徑,目前被計入對話式 AI / 語音助手子市場。隨著端到端 S2S 產品化,預計將在 2025-2027 年獲得獨立市場關注。

供給側關鍵瓶頸

  1. 高質量語音互動資料:端到端 S2S 需要大量自然對話音訊資料(含情感標註、輪次標註),這類資料遠比文本資料稀缺。
  2. 即時推論算力:S2S 對延遲極敏感,需要低延遲 GPU 推論。按 [供應鏈估算],一次即時 S2S 會話可能佔用比文本聊天多 5-20 倍的 token 量(語音 token 率遠高於文本),推論成本是關鍵限制。
  3. 多語言資料不均衡:英語資料最豐富,其他語言(尤其低資源語言)資料稀缺。

需求側訊號

  • OpenAI GPT-4o 語音模式上線後獲得大量使用者使用 [公開報道]。
  • 2024-2025 年,多家科技公司在語音互動方向加大投入(Google、Apple、Meta、Samsung 等)[公開資訊]。
  • 企業客服、電信、金融等行業對語音 AI 的採購意願持續上升 [行業調研口徑]。

代表公司與資本對映

公司/機構角色S2S 相關版面配置上市/融資狀態
OpenAI閉源 S2S 旗艦GPT-4o 原生語音模式,多模態端到端未上市(鉅額融資,估值數百億美元)
Google / DeepMind閉源多模態大型模型Gemini Live,語音-視覺-文本統一模型Alphabet (GOOGL)
Meta / FAIR開源基礎研究SeamlessM4T v2, EnCodec, Voicebox, Moshi 合作Meta (META)
Apple端側語音Siri 升級方向、端側模型(Apple Intelligence)AAPL
Microsoft語音模型研究VALL-E 系列、Azure 語音服務MSFT
Kyutai開源 S2S 先鋒Moshi(首個完整開源端到端全雙工 S2S)法國 AI 實驗室,融資資訊待確認
ElevenLabsAI 語音合成語音合成/克隆技術,S2S 的下游 TTS 環節已融資,估值約數十億美元 [公開報道]
SoundHound AI語音 AI 平台車載/餐飲語音互動,正向端到端演進SOUN(NASDAQ)
Cerence車載語音傳統級聯方案,正在探索下一代架構CRNC(NASDAQ)
科大訊飛中文語音龍頭星火大型模型 + 語音互動全鏈路002230.SZ
思必馳對話式 AI語音互動平台,車載/IoT 場景688163.SH

A 股對映思路(非投資建議):

  • 直接相關:科大訊飛(語音 AI 全棧)、思必馳(對話式 AI)
  • 上游算力:海光資訊、寒武紀等(推論晶片)
  • 語音前端晶片:恆玄科技、炬芯科技等(音訊處理 SoC)
  • 應用層:關注版面配置 AI 客服/AI 陪伴的公司

投資邏輯

核心觀點

  1. S2S 是 LLM 互動範式的重要演進方向:從”讀寫”(文本聊天)到”聽說”(語音互動),互動介面自然化是不可逆趨勢。語音互動的 TAM(總可定址市場)遠大於文本互動——全球數十億不擅長打字的使用者(老人、兒童、非英語母語者、發展中地區使用者)都可能因此進入 AI 互動市場。

  2. 端到端 vs. 級聯的路線之爭是短期最大變數:端到端體驗更優但工程成熟度不足,級聯方案可部署但天花板明顯。短期內級聯方案的存量市場不會被快速替代,但增量高階場景會逐步轉向端到端。

  3. 推論成本是商業化的核心約束:語音 token 率遠高於文本,S2S 會話的推論成本可能是文本聊天的 10 倍以上 [粗略估算]。誰能用更小的模型實現更好的 S2S 體驗(壓縮 token 率、降低模型引數量),誰就擁有成本優勢。

  4. 資料飛輪是護城河:高質量語音互動資料極度稀缺。擁有大規模真實使用者語音互動資料的公司(如 OpenAI、Google、Apple、科大訊飛)在 S2S 賽道具有結構性優勢。

風險提示

  • 技術路線不確定性:端到端 S2S 仍在快速迭代,今天的技術方案可能在 1-2 年內被顛覆。
  • 監管風險:語音克隆、深度偽造(deepfake)問題可能引發監管收緊,影響語音 AI 部署。
  • 隱私問題:語音資料比文本更敏感,涉及個人身份資訊(聲紋)和環境資訊,合規成本高。

常見誤讀糾偏

❌ 誤讀 1:“S2S 就是 ASR + LLM + TTS 串起來,沒什麼新東西”

糾偏:級聯方案確實如描述,但 端到端 S2S 的核心創新在於消除了文字中間表示。模型直接在語音 token 空間中完成理解和生成,保留了韻律、情感、語速等副語言資訊。這不是簡單地把三個模型粘在一起——它需要全新的訓練範式(語音-語音預訓練)、新的 tokenizer(神經音訊 codec)、新的互動機制(全雙工/流式)。類比:JPEG 壓縮後再解壓看圖 vs. 直接用相機取景器看——資訊損失和延遲完全不同。

❌ 誤讀 2:“GPT-4o 語音模式是端到端的,所以延遲低”

糾偏:GPT-4o 原生語音模式的技術細節 並未被 OpenAI 完整公開。雖然 OpenAI 宣稱其為”原生多模態”,但具體是否完全消除了 ASR/TTS 中間步驟、語音 token 化方案細節等均 未充分揭露。其低延遲可能來自端到端架構,也可能來自級聯鏈路的高度最佳化(流式 ASR + 流式 TTS + 流式 LLM 的流水線並行)。在官方技術論文釋出前,不宜斷言其架構歸屬。

❌ 誤讀 3:“端到端 S2S 已經完全取代級聯方案”

糾偏遠未取代。截至 2025 年,絕大多數生產環境中的語音互動系統仍是級聯方案。端到端方案在延遲和體驗上有優勢,但在可控性、可除錯性、多語言覆蓋、推論成本上仍有明顯短板。產品選型需要根據場景權衡,不存在”全面碾壓”。

❌ 誤讀 4:“S2S = 語音克隆/深度偽造”

糾偏:語音克隆/深度偽造是語音合成技術的 濫用場景,不是 S2S 的定義或主要用途。S2S 系統可以使用固定的系統音色(不模仿任何真人),也可以提供可控的語音生成(使用者選擇音色)。行業正在建立聲紋水印、合成檢測等技術防線。


學習路徑

入門(1-3 天)

  1. 瞭解語音處理基礎:取樣率、頻譜圖、MFCC、端點檢測
  2. 學習 ASR 基礎:CTC、Attention-based Seq2Seq、Whisper 架構
  3. 學習 TTS 基礎:Tacotron、VITS、端到端 TTS

進階(1-2 周)

  1. 學習神經音訊 Codec:閱讀 EnCodec 論文(Défossez et al., 2022),理解 RVQ(殘差向量量化)機制
  2. 學習語音語言模型範式:閱讀 AudioLM(Borsos et al., 2023)和 VALL-E(Wang et al., 2023)
  3. 閱讀 Moshi 論文(Défossez et al., 2024)——這是理解端到端 S2S 的最佳技術文件之一
  4. 動手實驗:用 Hugging Face 上的開源模型(Moshi, MiniOmni)搭建一個本地 S2S demo

專家(持續跟進)

  1. 追蹤主流會議:Interspeech、ICASSP、NeurIPS、ICML 中的語音/音訊生成 Workshop
  2. 關注技術報告:OpenAI、Google、Meta 的技術部落格和論文
  3. 實踐最佳化:流式推論、低延遲部署、多語言適配

推薦資源

  • 論文:Moshi (Kyutai, 2024)、SeamlessM4T (Meta, 2023)、SpeechGPT (Zhang et al., 2023)、VALL-E (Wang et al., 2023)
  • 開原始碼:Kyutai/Moshi (GitHub)、facebookresearch/seamless_communication
  • 部落格:Hugging Face 部落格中關於音訊/語音模型的系列文章
  • 工具:Hugging Face Transformers(音訊模型支援)、Gradio(快速 demo)

一句話總結

S2S 讓 AI 從”讀懂你的文字”進化為”聽懂你的話語”——它不僅理解你說了什麼,還理解你怎麼說的,是人機互動走向自然化的關鍵技術拐點。


延伸閱讀與來源

來源說明
Défossez et al., “Moshi: a speech-text foundation model for real-time dialogue”, 2024端到端全雙工 S2S 最詳細的開源技術文件
Meta SeamlessM4T / SeamlessM4T v2, 2023-2024多語言 S2S/S2T/T2S 統一模型
OpenAI GPT-4o 技術部落格, 2024.05GPT-4o 原生多模態能力介紹(技術細節有限)
Borsos et al., “AudioLM: a Language Modeling Approach to Audio Generation”, 2023語音語言模型範式的開創性工作
Wang et al., “Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers”, 2023 (VALL-E)語音 codec + LLM 範式
Défossez et al., “High Fidelity Neural Audio Compression” (EnCodec), 2022神經音訊 codec 的經典工作
Hugging Face Blog: Audio Transformers 系列開源社群對語音模型的實踐教程
SoundHound AI (SOUN) SEC Filings / Investor Presentations語音 AI 商業化進展的上市公司視角
行業報告:Grand View Research, MarketsandMarkets 語音 AI 市場報告市場規模估算(不同報告口徑有差異)

*本文件技術事實基於公開論文和產品釋出資訊。未被充分揭露的系統細節(如 GPT-4o 的具體架構)標註為”未

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型