應用層 開放閱讀

AI 寫作

AI Writing

概念 ID
ai-writing
更新時間
2026-05-29
來源數量
待補

AI 寫作

3 秒看懂

AI 寫作是基於大規模語言模型(LLM)的文本生成技術,能根據提示自動產出文章、報告、郵件、程式碼等。它不是“模板填空”,而是通過數千億引數的機率模型逐詞生成內容,核心驅動是 Transformer 架構與自迴歸預測。當前頂尖模型在多數中文寫作場景已逼近人類水平,但仍存在幻覺、邏輯斷裂與知識截止斷點等固有限制。

3 分鐘產業解釋

AI 寫作的產業本質是“大語言模型 + 使用者互動介面 + 工具鏈”的閉環。上游由通用基座模型(如 GPT-4、Claude、文心一言等)與領域微調模型構成,中游是垂直寫作工具(Jasper、Copy.ai、WPS AI等),下游面向市場行銷、媒體、法務、教育等數億終端使用者。同時,AI 寫作與搜尋、辦公套件、程式碼助手(GitHub Copilot)深度融合,正在重塑內容生產力。

商業模式已分化出三條路線:① 模型即服務(MaaS),通過 API 按 token 計費;② SaaS 訂閱,提供模板化寫作工作臺;③ 嵌入式增強,如 Office Copilot 直接整合進辦公軟體。競爭優勢壁壘主要在基礎模型的預訓練資料質量、強化學習與人類反饋(RLHF)的對齊成本,以及場景資料積累形成的微調飛輪。

15 分鐘專家深入

當前 AI 寫作系統的核心引擎幾乎全是基於 Decoder-only 的 Transformer 架構。其推論過程是典型的自迴歸生成:給定前文上下文視窗 mathbf(x)_{<t},模型輸出下一個 token 的機率分佈 p(x_t | mathbf(x)_{<t}),通過束搜尋或採樣策略產出最終序列。寫作質量高度依賴兩個因素:

① 上下文長度與注意力機制 早期模型僅支援 2K token,如今主流已擴充套件至 32K–128K token,部分系統通過結合 RoPE 位置編碼與位置插值、NTK-aware scaling 等擴充套件技術,實現數百萬 token 的上下文。長上下文使得模型在撰寫報告、長篇小說或合同文本時能保持全域性一致性,但也帶來注意力計算平方級膨脹的瓶頸。為此,FlashAttention 等 IO-aware 演算法成為關鍵加速元件,可減少高頻寬記憶體訪問,但具體速度提升倍數在量產系統中未統一揭露。

② 對齊與風格控制 AI 寫作不只是“會寫”,更要“有目的地寫”。通過監督微調(SFT)和 RLHF,模型學會遵循指令、拒絕不當請求、保持事實審慎。寫作類產品普遍在 RLHF 中強化“格式遵循”“客觀性”“敏感內容規避”等維度。更精細的控制依賴系統訊息與提示工程,例如通過 langchain 組合多個 prompt 實現大綱生成→分章節擴寫→潤色→事實核查的流水線。

需要警惕的是,AI 寫作的“創造力”其實源自訓練語料中表層模式與語義關聯的統計復刻,並不具備真實理解與意圖。這導致它在需要因果推論、精確數字引用、時效性知識的寫作任務中,可靠性急劇下降。

技術原理(最深)

從數學與系統層面剖析 AI 寫作的完整鏈路。以下描述基於公開研究成果,不指涉特定商業產品內部實現細節。

1. 模型架構

絕大多數現代寫作模型使用 Decoder-only 因果自注意力架構。每一層由掩碼多頭注意力與位置前饋網路(FFN)組成,並輔以殘差連線和層歸一化。

Input Sequence: [START] 請 寫 一 篇 產 品 介 紹

Token Embedding + Positional Encoding

For L layers:
   Masked Multi-Head Self-Attention
    → Q = W_Q · h,  K = W_K · h,  V = W_V · h
    → Attention(Q,K,V) = softmax((QK^T)/√d_k + Mask) · V
   Add & LayerNorm
   Feed-Forward (通常是 SwiGLU 或其他門控啟用)
   Add & LayerNorm

Final LayerNorm → Linear (project to vocab size) → softmax → next token prob.

生成過程:給定 prompt,模型輸出詞彙表上機率分佈,取樣一個 token(如“如”),拼接到輸入末尾,再繼續預測下一個 token,直至產出終止符。

2. 關鍵引數與規模(公共知識範圍)

  • 引數總量:基礎模型通常為 7B、13B、70B,甚至未公開的 1.7T 等[基於已知公開研究]。
  • 詞彙表大小:一般在 32K 至 256K 個 subword 單元(如 Byte-Pair Encoding 詞表)。
  • 詞嵌入維度 (d_model):7B 模型常見 4096,70B 常見 8192 或更高。
  • 注意力頭數與層數:7B 模型可能為 32 層、32 頭;70B 可能為 80 層、64 頭[典型取值]。
  • 訓練 FLOPs:近似估計公式為 6ND(N為引數,D為token數)。如 1T token 訓練 70B 模型,計算量約 4.2e23 FLOPs,需數千 GPU 周級訓練[公開文獻推導],具體叢集規模和耗時因廠商而異,未充分揭露。

3. 推論與生成策略

  • 溫度與 top-p:溫度 T 控制機率分佈平滑度,較低溫度(如 0.2)使輸出更確定,適合事實性寫作;較高溫度(如 0.9)增加多樣性,適合創意文案。top-p(核取樣)截斷低機率尾部,是平衡流暢性與創造性的核心手段。
  • KV 快取:推論時為避免重複計算歷史 token 的 Key/Value,所有層快取 KV 張量,長序列時記憶體佔用成為瓶頸。例如,80 層、8192 維、128K 上下文時,KV 快取可能佔用數百 GB 視訊記憶體(精確值依賴批次大小與精度)[學術界公開測量]。
  • 投機取樣:為提高生成速度,採用小模型預測多個 token,再交由大型模型並行驗證。該技術在部分部署中可將吞吐量提升 2–3 倍([來自開源專案量化報告,視任務分佈差異])。

4. 寫作特化技術

  • 檢索增強生成(RAG):寫作時檢索外部知識庫,將證據片段注入上下文,大幅降低幻覺。檢索模組通常基於雙塔式密集檢索(如 DPR)。
  • 工具呼叫:AI 寫作工具可通過函式連線計算器、天氣 API、搜尋引擎等,獲取即時資訊,輔助生成準確內容。
  • 指令分層與可控文本生成:通過字首控制(如 RL LoRA 施加風格向量)在不改變基座模型的前提下實現品牌語調、合規性控制。具體實施細節多屬於各家商業機密,未公開。

技術演進史

  • 2017 年前“前 Transformer 時代”:寫作輔助主要依靠規則模板、統計語言模型(n-gram)及早期 RNN/LSTM。產出僵硬,無法處理長距依賴。
  • 2018–2019 預訓練興起:BERT 的出現帶來理解革新,但僅適用於完形填空式生成。GPT-1/2 展示單向 Transformer 的自迴歸生成潛力,文本通順度大幅躍升,但寫作的邏輯、事實性仍較差。
  • 2020–2021 GPT-3 引爆:175B 引數,通過 few-shot prompt 即可完成摘要、郵件、故事寫作,無需微調。同期國內出現盤古、悟道等基座模型,AI 寫作在營銷文案、電商詳情頁等垂直場景開始規模化落地。
  • 2022 指令對齊與 RLHF 成熟:InstructGPT/ChatGPT 用 RLHF 極大改善了對人類意圖的遵從度,成為寫作工具的轉折點。AI 開始處理複雜格式、長文綱要、多使用者角色扮演等任務。
  • 2023–至今 多模態與工具整合:寫作模型開始融合圖片、表格理解,結合程式碼直譯器、即時搜尋,向“智慧文件助理”演進。同時,長上下文突破 128K 甚至更高,專業寫作工具的細分賽道白熱化。

技術路線對比

維度通用基座模型 API垂直寫作 SaaS開源模型自部署
代表形式OpenAI API、Claude APIJasper、Copy.ai、WPS AILLaMA 系列、Qwen 等 + 私有知識庫
寫作質量通用任務最優,但領域知識需 RAG 增強提示模板+場景微調,特定體裁(廣告、SEO)更高效依賴微調資料和工程最佳化,可控性強但成本高
資料隱私資料經雲端端處理,部分企業級方案提供私有租賃多為多租戶雲端,少數支援私有化完全本地或自有雲端部署,隱私等級最高
延遲與成本按 token 計費,長文成本線性增長通常會員制,單篇成本隱藏於定價硬體投入高,需自行最佳化推論;邊際成本低
定製性僅通過系統訊息、有限微調(若有)品牌語調、合規詞庫模板化定製,非深度微調全微調、RLHF、外掛定製,靈活性最高
維護與更新供應商負責,自動升級供應商迭代,使用者無感知需團隊持續跟進新模型、安全補丁
幻覺與安全護欄通用安全層,但領域特化失效難控針對商業寫作新增品牌事實校驗流程完全自建,可實施最嚴事實稽核管線

注:以上對比基於公開資料歸納,具體效能指標[未充分揭露],僅作定性參考。

上下游

上游

  • 算力:GPU/TPU 叢集、雲端服務(訓練與推論)。
  • 資料:網頁語料、書籍、論文、程式碼庫、人工標註語料(RLHF 所需的偏好資料)。
  • 架構與工具:PyTorch、DeepSpeed、Megatron-LM、vLLM 等訓練/推論架構。
  • 基礎模型提供商:閉源(OpenAI、Anthropic)與開源社群(Meta、智譜等)。

中游

  • AI 寫作引擎開發商:整合基座模型 + 工程化封裝(對話管理、記憶、風格控制)。
  • 領域適配服務商:針對金融、醫療、法律等領域的微調、知識庫建置。
  • 評測與安全:事實準確性檢測、原創性/抄襲檢測、敏感內容過濾中介軟體。

下游

  • 內容營銷:社交帖子、廣告文案、SEO 文章。
  • 企業文書:報告、郵件、會議紀要、合同草案。
  • 教育與個人使用:論文大綱、寫作潤色、創意助手。
  • 新聞與出版:突發新聞初稿、資料包表生成(需強人工稽核)。

關鍵指標

生成質量指標(自動化)

  • BLEU/ROUGE:用於參考文本重疊計算,不適合開放性寫作評估。
  • 困惑度(Perplexity):衡量模型對測試集的預測能力,越低越好,但不直接反映生成可用性。
  • 人工評估維度:流暢度、連貫性、資訊準確性、創意性、風格一致性(多采用 Likert 量表)。

事實與安全指標

  • 事實一致性(Factual Consistency):生成內容與檢索證據間的蘊含率(如 DAE 指標)。
  • 幻覺率(Hallucination Rate):由人工或自動檢測(如 SelfCheckGPT)統計的非事實性生成比例。
  • 安全拒答率與使用者滿意度:無據可查,無量化釋出[未充分揭露]。

效能指標

  • 首 token 延遲:從請求發出到顯示第一個字的時間,互動式寫作通常要求 < 1 秒。
  • 生成吞吐量:tokens/秒,受模型大小、硬體、批次、KV 快取影響,典型值數十至數千。
  • 上下文利用效率:模型能否在長文中準確呼叫任意位置的細節,壓力測試例如“大海撈針”測試(Needle In A Haystack)。

供需與市場資料

因搜尋失敗未能獲取最新第三方市場報告。定性觀察如下:

  • 供給側:通用大型模型層趨於寡頭化,頭部的研發投入每年數十至數百億美元計[公司年報口徑];垂直寫作工具層卻極其分散,進入門檻降低,但留存率和盈利能力分化明顯。
  • 需求側:企業內容生成量年增長速率超 30%([過往行業調研趨勢]),2023 年後 AI 寫作幾乎成為營銷技術棧的標配,以節省 40%–60% 的初稿人力時間([早期學術案例研究推論]),但最終採納和全面替代仍需人工事實核查與編輯環節。
  • 定價趨勢:千 token 生成價格在 2023–2024 年間經歷了數倍下降(如 OpenAI 多次降價),促使更大量使用,呈現“傑文斯悖論”現象。

代表公司與資本對映

基礎模型層

  • OpenAI(微軟支援):GPT-4 系列,API 和 ChatGPT 具備最強品牌認知。
  • Anthropic:Claude 系列,以安全對齊和長上下文見長。
  • Google DeepMind:Gemini,深度融合搜尋與辦公生態。
  • 國內:百度(文心一言)、智譜(ChatGLM)、深度求索(DeepSeek)、月之暗面(Kimi)等。

垂直寫作與辦公

  • Jasper:早期營銷文案 AI,後拓展至企業內容工作流。
  • Copy.ai:從寫作生成轉型 GTM 流程自動化。
  • WPS AI(金山辦公):嵌入 WPS 套件,主打中文辦公寫作與表格。
  • Notion AI:文件內嵌寫作助手,作為協同功能增值。

資本對映邏輯

  • 基座模型公司高估值源於算力+資料+人才的馬太效應,以及對未來平台議價權的預期。
  • 寫作工具公司估值更多看 ARR 增長、客戶粘性、使用時長,以及是否能在巨頭整合中存活並形成獨特資料飛輪。
  • 開源生態通過降低部署門檻,使得定製化部署商和私有化寫作方案提供商獲取長尾獲利。

投資邏輯

  1. 平台層的“輝達式”算力賣鏟子:無論哪家寫作 AI 勝出,上游的高階 GPU、HBM、光模組需求均獲益。
  2. 垂直場景資料護城河:投資擁有獨特領域資料(金融合規文件、醫療記錄、法律文書)並能通過使用者互動持續積累偏好模型的公司,其寫作產品比純 prompt 工程更不易被替代。
  3. 成本下降驅動的使用量爆發:推論成本每下降 10 倍,可能引發非結構化文本生成量的井噴,受益方是那些與工作流深度繫結、擁有分發渠道的寫作工具(如嵌入 ERP、CRM 系統中的人機協作寫作介面)。
  4. 審計與信任層機遇:AI 寫作越氾濫,事實核查、AIGC 鑑別水印、創作品權屬確權的需求越剛性,衍生出一批“AI 寫作後處理”安全企業。

常見誤讀糾偏

誤讀 1:AI 寫作就是套模板,本質和以前的自動摘要差不多。

糾偏:傳統模板系統根據規則填入資料,無理解能力。而基於 LLM 的 AI 寫作利用了數十億引數捕捉的深層語義與常識,能處理模糊指令、進行創意構思和多步邏輯鋪排,甚至根據反饋自我修正。兩者完全不在同一技術層面。

誤讀 2:模型引數量越大,寫作就越好。

糾偏:寫作質量不僅依賴引數規模,還取決於訓練資料質量、微調對齊程度以及部署時的檢索增強工程。一個小且高質、經過精調的對齊模型,在特定垂直領域常常優於通用巨模型。此外,知識截止、幻覺控制等均非單純堆引數可解。

誤讀 3:AI 能完全自動寫出可釋出的高質量文章。

糾偏:當前技術下,絕大多數商用級別的寫作仍需人類參與——設定大綱、核實事實、調整語調、注入行業 know-how。全自動生成的內容在時效性、深度分析、合規嚴謹性等方面仍會頻繁出錯,直接釋出風險極高。AI 寫作更多是增強而非替代。

學習路徑

第一步:親身體驗

  • 使用 ChatGPT、Claude、Kimi 等免費或試用介面,完成同一 prompt 下的不同模型效果對比,建立直觀感知。 第二步:理解 Transformer 與 tokenizer
  • 閱讀《Attention Is All You Need》及 Jay Alammar 的《The Illustrated Transformer》部落格。
  • 動手用 Hugging Face transformers 載入一個小型 GPT-2 模型,觀察 tokenizer 分詞與自迴歸生成過程。 第三步:掌握提示工程與 RAG
  • 學習 LangChain 或 LlamaIndex,搭建一個可以讀取本地 PDF 並基於內容回答/寫作的系統。
  • 瞭解 few-shot、chain-of-thought、指令格式等提示策略。 第四步:深入對齊與評測
  • 瞭解 RLHF 整體流程(監督微調 - 獎勵模型 - PPO),可閱讀 OpenAI 的 InstructGPT 論文或開源 RLHF 實現。
  • 學習事實一致性評測方法(如 AlignScore、SelfCheckGPT)。 第五步:追蹤前沿與部署
  • 關注 arXiv 的最新 LLM 論文,特別是長上下文、工具使用和可控生成方向。
  • 研究 vLLM、TensorRT-LLM 等高效能推論架構,理解量化、KV 快取等工程實踐。

一句話總結

AI 寫作不是“會寫字的機器”,而是由機率模型、對齊訓練和工程工具鏈共同建置的內容生產力系統,它變革了人機協作創造文本的範式,但離完全獨立可信的寫作能力尚有明顯距離。

延伸閱讀與來源

  • Vaswani et al., “Attention Is All You Need”, NeurIPS 2017.
  • Brown et al., “Language Models are Few-Shot Learners”, NeurIPS 2020. (GPT-3)
  • Ouyang et al., “Training language models to follow instructions with human feedback”, NeurIPS 2022. (InstructGPT)
  • Touvron et al., “LLaMA: Open and Efficient Foundation Language Models”, 2023.
  • Dao et al., “FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness”, NeurIPS 2022.
  • 各公司官方部落格及技術報告(OpenAI、Anthropic、Google DeepMind、Meta AI),具體量化資料以各自最新發布為準。
  • 注:本頁中的具體數值除標註[未充分揭露]或[估算]外,均根據學術公開基準模型的通識引數範圍定性描述,實際產品指標以供應商即時公告為準。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型