應用層 開放閱讀

科研 AI

Scientific AI

概念 ID
scientific-ai
更新時間
2026-05-29
來源數量
待補

科研 AI

報告日期:2025 年 3 月

1 三秒看懂:科研 AI 的本質與雄心

科研 AI 不是某個單一演算法的簡單落地,而是一股將人工智慧——尤其是深度學習、生成式模型與大語言模型——作為新工具、新範式,系統性地注入基礎科學研究全流程的顛覆性浪潮。它覆蓋生命科學、材料、物理、化學、氣候、數學乃至天體物理,目標遠不止於“幫科學家省時間”——它要成為科學假設的提出者、實驗路徑的規劃者、新知識的共同創作者,以及自然界隱藏秩序的解碼者。

其核心影像是:讓 AI 長出“眼睛”來觀測人類無法直觀感知的高維資料空間,再賦予它一個“腦”來推論因果、反向設計、跨越尺度聯想。過去,一個藥物分子從先導化合物最佳化到候選分子,需要十幾年與數十億美元;今天,AI 驅動的閉環流程有望將這一週期壓縮一半,成本降至十分之一。在材料領域,傳統“試錯-修正”的迴圈已被“性質預測-逆向生成-自動化合成”取代,具備指定帶隙、機械強度或催化活性的新材料可以在幾天內被設計出來。

一句話:科研 AI 讓人類探索未知科學邊界的運動方式,從“步行”跨入“飛行”時代。它的終極野心是實現“AI 科學家”——一個能夠在特定領域自主提出問題、設計實驗、解讀結果並迭代理論的智慧代理。這一願景雖然遙遠,但其雛形已經在蛋白質結構預測、數學猜想性證明和自驅動材料實驗室中出現。

2 三分鐘產業解釋:從“計算輔助”到“AI 驅動”的範式革命

表面上看,科學計算與 AI 結合並非新事。過去數十年,計算機主要承擔物理模擬與數值求解的角色——無論是密度泛函理論(DFT)計算電子結構,還是分子動力學模擬蛋白摺疊。這類方法的本質,是在已知物理定律邊界內跑程式,受到維度災難、時空解析度與昂貴計算成本的扼制。

科研 AI 帶來的深層變革,在於從“計算輔助”邁向“AI 驅動”。它不再單純解方程,而是從海量、異構、高噪的科學資料中直接學習隱藏規律、提出可驗證假設、逆向創造新實體,並在實驗環境中自主驗證。這從根本上重塑了科研流程,使其由經典的“觀察-假設-驗證-理論”線性路徑,轉變為“資料-模型-洞察-驗證-再學習”的螺旋式演進。

2.1 產業背景:三浪疊加

這場革命受三大力量共同推動:

資料海嘯:人類科學進入了資料密集時代。基因測序成本降至不足 1000 美元/人,英國生物庫(UK Biobank)已收集 50 萬人多組學資料;同步輻射光源、冷凍電鏡和高通量實驗每年產生 PB 甚至 EB 級資料。這些資料量已遠遠超過任何個人或團隊的“手工”分析極限,為 AI 模型提供了前所未有的燃料。

演算法引擎升級:以 Transformer 為核心的架構席捲了序列到物理世界的各個角落。圖神經網路(GNN)讓分子與晶體結構學習成為可能;擴散模型與流匹配在生成任務中超越傳統方法;物理資訊神經網路(PINNs)將微分方程直接嵌入學習過程;等變網路則將三維空間的幾何對稱性鍛造成歸納偏置。這些進步使 AI 能處理結構化、非結構化,甚至在極端稀疏標籤下的科學資料,捕捉人類難以靠直覺把握的複雜關聯。

算力與軟體棧成熟:千卡級 GPU/TPU 叢集的高速互聯、專為科學計算最佳化的庫(如 Open Catalyst、DeepChem、DGL、PyTorch Geometric)以及預訓練模型權重的開放,讓訓練數十億引數的科學大型模型成為可能。雲端運算和聯邦學習也加速了學界與產業界的合作,降低了進入門檻。

2.2 產業全價值鏈重構

科研 AI 正在重塑從基礎研究到產業落地的每一個環節:

  • 上游——科學資料:資料獲取、標準化、清洗、標註以及資料治理規則成為核心瓶頸和壁壘。誰擁有高質量、體系化的科學資料庫(如 Materials Project、Protein Data Bank),誰就掌握源頭優勢。
  • 中游——模型與平台:包括面向科學的 AI 基礎模型、專用晶片架構(如支援等變運算的加速器)、自動化實驗控制軟體,以及支援高通量計算的雲端平台。此層是技術密集與資本密集的匯聚點。
  • 下游——應用與產品:AI 驅動的藥物發現與臨床試驗最佳化、材料逆向篩選與設計、儲能方案、先進半導體工藝、氣候預測,以及數學定理證明、引力波探測等前沿基礎科學應用。

2.3 科學家角色的躍遷

科學家的核心職能隨之發生深刻轉變:從“一線操作員”變為“科學問題的定義者、AI 產出的裁判者和人機協同系統的設計師”。未來的頂尖實驗室管理者,不僅要懂領域知識,更需要具備“與 AI 協作”的元技能,懂得如何向基礎模型提出正確問題,並設計實驗來檢驗 AI 的猜想。

3 技術原理:科學世界的內在對稱性、物理約束與資料驅動融於一爐

科研 AI 的技術基底,是將科學世界的結構對稱性、嚴格的物理定律與資料驅動的表徵學習能力深度融合,解決傳統方法在面對高維、非線性、多尺度、標籤稀疏等問題時的困境。

3.1 全域性架構

一個典型的先進科學發現系統,其計算引擎可被概括為以下流程:

graph TD
    A[重大科學問題] --> B[多模態資料獲取與表徵]
    B --> C{核心AI模型層}

    subgraph C [核心AI模型層]
        C1[等變圖神經網路
分子/晶體/蛋白質]
        C2[Transformer與大語言模型
序列/文獻/多模態]
        C3[擴散/流匹配模型
逆向生成與設計]
        C4[物理資訊/PDE嵌入網路
方程約束與求解]
        C5[主動學習與貝葉斯最佳化
實驗設計]
    end

    C --> D[科學輸出與認知]
    D --> E[候選分子/材料結構]
    D --> F[隱含物理規律/相互作用圖譜]
    D --> G[最優實驗方案與條件]

    G --> H[自動化實驗驗證]
    H -- 迭代反饋 --> A

其工作機制深度解析如下:

3.2 對稱性與等變性:讓網路“懂”物理

蛋白質、分子和晶體存在於三維空間,它們的勢能面與性質應當獨立於分子旋轉、平移和反演。頂尖模型如 Allegro、MACE、Equiformer 等,將 E(3) 群的等變性直接編碼進網路結構:當輸入幾何發生旋轉時,網路輸出(如力場或能量)按相同規則變換。這一設計不僅極大提升了資料效率,還天然保證了預測的物理一致性,避免了資料增強帶來的冗餘。

3.3 生成式逆向設計:從條件到實體

傳統材料或藥物發現本質是“正向篩選”——從海量候選分子庫中,通過計算篩選得到滿足指標的少數分子。生成式逆向設計翻轉了這一邏輯:擴散模型或流匹配模型從隨機噪聲出發,在接受“化學條件訊號”(如目標帶隙 1.5 eV、對某靶點結合親和力優於 10 nM)的引導後,逐步去噪,直接輸出具有指定性質的全新分子結構。這種方式繞過了組合爆炸,使得探索化學空間的能力躍升幾個數量級。

3.4 物理損失函式與科學機器學習

物理資訊神經網路(PINNs)將偏微分方程(如納維-斯托克斯方程、薛定諤方程)作為神經網路訓練的約束項或正則化項。這讓模型在資料稀疏區域(如裂紋尖端或湍流邊界層)依然遵循第一性原理,不僅能夠求解正向問題,還能從觀測資料中推斷未知引數甚至恢復隱含場——這為氣候建模、流體動力學與量子問題提供了統一的解決方案。

3.5 自監督預訓練與少樣本泛化

模仿語言模型中的 BERT 與 GPT,科研 AI 建置了“分子 GPT”“蛋白 BERT”等基礎模型。在十億級別無標號分子構象資料上完成掩碼重建或對比學習預訓練後,這些模型將化學空間編碼為高維連續表示。下游的任務,如毒性預測或溶解度分類,僅需數十個標記樣本微調就能達到此前數百個樣本訓練的精度,這對於資料極度稀缺的科研領域意義深遠。


4 核心驅動力深度解讀:資料、演算法、算力三角

科研 AI 呈現爆發式增長,根源在於資料、演算法、算力三大要素同時迎來臨界點,並形成強烈的正反饋迴圈。

4.1 資料:從稀缺到洪流

實驗技術的進步使科學資料呈現指數級增長。第三代基因測序、空間轉錄組學、原位冷凍電鏡等技術每天產出多維、多尺度的海量資料。但同時,科學資料存在嚴重的異構性、噪聲、缺失與樣本不平衡。產業的關鍵瓶頸不再是“有無資料”,而是“能否建置高質量標註、標準化的科學資料集”。因此,圍繞資料清洗、主動學習標註策略、聯邦資料共享協議的企業正在成為細分賽道的核心壁壘。許多頂級 AI 藥物發現公司(如 Recursion、Insilico Medicine)的價值,一半在其模型,一半在其專屬的、可被系統化擴增的生物學資料引擎。

4.2 演算法:幾何、序列與物理的深度融合

演算法不再是簡單的 ResNet 或 GBDT 遷移。新一代架構呈現出三大融合趨勢:序列建模與結構理解的統一(如 AlphaFold 使用 Evoformer 同時處理多序列比對與對距離的幾何約束)、物理對稱性的原生實施(等變網路、群卷積)、機率生成與大語言模型的結合(如用 LLM 解析科學文獻並生成實驗方案,再結合擴散模型設計分子)。這些演算法的通用性使得一個在蛋白質上訓練的等變網路,稍作調整即可用於小分子或晶體。

4.3 算力與專用生態

高階 GPU 叢集讓訓練百億乃至千億引數的科學基礎模型成為現實。例如,微軟的 AI4Science 團隊與輝達合作,為分子動力學部署數千塊 A100/H100 進行毫秒級模擬。同時,出現了面向科學計算的領域專用架構趨勢,例如支援高效球諧函式運算和張量積的硬體,或專為圖稀疏通訊最佳化的網際網路絡。更關鍵的是,軟體生態的成熟——PyTorch Geometric、JAX MD、DeepMD-kit 等工具大大降低了科學家建置模型的門檻,促進“AI 平民化”。


5 關鍵演算法架構一:等變神經網路與圖世界

自然界的基礎構造單元(原子、分子、蛋白質、晶體)天然具有空間幾何結構。等變神經網路因此成為科研 AI 的支柱之一。

5.1 圖表示與訊息傳遞

分子可視為原子為節點、化學鍵或空間鄰近為邊的圖。圖神經網路通過多層訊息傳遞,聚合鄰居資訊以更新節點表徵,從而捕捉區域性化學環境。然而,經典 GNN 對三維方向不敏感。等變網路則通過球諧函式展開和高階張量積,使得訊息不僅包含距離,還包含精確的方向資訊,並確保所有表徵在旋轉下實現預定方式的變換——這就是“等變性”。

5.2 代表模型與突破

  • NequIP / Allegro / MACE:通過高精度的等變訊息傳遞,建置分子力場,僅用數百個 DFT 計算資料進行訓練,便可達到從頭計算級別的精度,且速度高出幾個數量級。
  • Equiformer:將 Transformer 注意力機制與等變特性結合,在蛋白質-配體相互作用與催化劑篩選任務上取得頂尖成績,展示了“注意力+等變”的巨大潛力。
  • SE(3)-Transformers 及其變體:直接處理點雲端,可用於粒子物理與天體模擬。

這些模型不僅加速模擬,更成為了生成式模型的 backbone。當逆向設計新分子時,等變網路能保證生成的分子在幾何上物理合理(鍵長、鍵角不畸形),顯著提高生成物的合成可行性。


6 關鍵演算法架構二:生成式 AI 與逆向設計

生成式模型將化學空間探索從“尋找針”變為“製造針”。核心技術鏈路包括變分自編碼器、生成對抗網路、自迴歸模型、擴散模型與流匹配,其中後兩者當前佔據主導。

6.1 擴散模型:逐步雕刻分子

擴散模型通過前向過程向資料新增噪聲,再學習反向去噪,從高斯分佈中恢復出合理樣本。在科研中,條件擴散模型接受性質標籤(如 HOMO-LUMO 能隙、水溶性、生物活性),引導生成過程。EDM、GeoDiff 等模型直接在三維原子座標上執行,與等變網路結合,確保生成結構的物理合理性(如手性保持)。擴散模型的一大優勢是能夠產出多樣化的候選集,覆蓋廣闊的化學空間,避免了單一點估計的侷限性。

6.2 流匹配與 SE(3) 生成

流匹配通過連續歸一化流建置從簡單分佈到複雜資料分佈的精確對映,具有訓練更穩定、取樣速度更快的潛力。其與等變網路的結合還可以保證生成機率密度在旋轉下不變,這對生成晶體材料或蛋白質主鏈至關重要。RFdiffusion 等利用流匹配在蛋白質骨架設計上取得突破,產生了自然界中未曾見過的、具有高度可摺疊性的全新蛋白質。

6.3 多目標最佳化的挑戰

科學研究中往往需要同時最佳化多個相互拮抗的性質,如藥物的高活性與低毒性、材料的高強度與良好韌性。單一條件生成難以滿足,業界正引入基於強化學習的反饋最佳化(使用 AI 評分器作為獎勵模型)和帕累托前沿學習架構,使模型能夠自動探索多目標約束下的最最佳化學空間區域。


7 關鍵演算法架構三:物理資訊網路與科學機器學習

許多物理現象由偏微分方程(PDE)描述。然而,高維 PDE 的數值求解存在維度災難,且邊界條件和引數的獲取常常不完備。科學機器學習(SciML)將知識與資料融合,提供了一條新路。

7.1 物理資訊神經網路 (PINNs)

PINNs 將 PDE 的殘差作為額外損失項加入網路訓練。一張網路即可同時表示場量(如速度、壓力、溫度),並滿足控制方程。其創新性應用包括:從稀疏速度測量資料中重建全流場、從 MRI 資料反演材料彈性模量、從疫情資料推斷傳染病模型的隱含引數。PINNs 的優勢在於無網格、無縫融合觀測資料與第一性原理,非常適合反問題。

7.2 運算元學習與高效模擬

傅立葉神經運算元(FNO)和 DeepONet 學習無限維函式空間之間的對映,即學習 PDE 的解運算元。一旦訓練完成,對於新的輸入函式(如不同滲透率場),可在毫秒級時間內預測全解,速度比傳統有限元方法快數萬倍。這被用於二氧化碳封存模擬、天氣預報(如輝達 FourCastNet)及工程最佳化。

7.3 混合建模與灰盒系統

在工業場景中,純黑盒模型難以被信任。最新的實踐是將已知的物理機理(如質量守恆)作為“骨架”硬約束,而用神經網路僅去擬合未知的閉合項(如湍流雷諾應力)。這種灰盒模型既保證了外推的可靠性,又在資料驅動下捕捉複雜效應,成為工業數字孿生中的核心技術。


8 科學基礎模型:邁向統一的多模態科學智慧

大語言模型(LLM)的成功啟發人們建置能夠處理多模態科學資料的統一基礎模型,它們被期望在一個模型內執行文獻理解、結構預測、實驗規劃等多項任務。

8.1 分子與蛋白基礎模型

  • 分子 GPT 類:如 MolGPT、ChemGPT,在數十億分子 SMILES 或圖結構上使用自迴歸預訓練,學習化學語言語法。微調後可用於性質預測、逆合成路線規劃。
  • ProstT5、ESM 系列:在成億蛋白質序列上訓練,捕獲了進化資訊與結構約束。ESM-2 可直接從單一序列預測三維結構,併產生高解析度蛋白設計。ESM-3 更進一步,將序列、結構、功能統一在一個生成架構內。
  • 跨域基礎模型:微軟的 BioGPT、DeepMind 的 AlphaFold 均展現出跨蛋白質、核酸到小分子的能力。最新的趨勢是使用Token化一切科學實體(原子、殘基、SMILES、光譜、影像)的範式,在統一 Transformer 下進行掩碼預訓練,建置“科學 GPT”。

8.2 科學文獻挖掘與知識整合

LLM 已能閱讀和理解數百萬科學論文。通過檢索增強生成,模型可回答跨材料、催化、生物醫學的前沿問題,甚至指出文獻中的矛盾並提出新的假設。例如,利用 Graph RAG 將論文中的化合物、性質、關係建置為知識圖譜,再由 LLM 進行推論,可輔助發現新藥靶點或材料配方。

8.3 自主實驗室與智慧代理

基礎模型正在進化為科學智慧代理,結合執行程式碼、呼叫 API、控制實驗室裝置的能力。例如,在化學合成中,智慧代理可根據目標產物呼叫逆合成預測器、價格資料庫與機器人臂,自動下單試劑、規劃步驟並執行合成。這種人機協同的“閉環智慧代理”正被視作科研 AI 的下一聖盃。


9 資料基礎設施:科研 AI 的氧氣和護城河

如果說模型是發動機,資料就是燃料與潤滑劑。當前,資料基礎設施的健全程度直接決定一個國家或企業在科研 AI 競賽中的後勁。

9.1 高質量資料庫的稀缺性

科研資料分公共、半公開與專屬三層。公共庫如 Protein Data Bank、Materials Project 和人類蛋白質圖譜,已成為全球 AI 訓練的公共知識底座。但這些資料往往存在取樣偏差(偏向已發表“正面”結果)、註釋不完整、格式不統一等問題。建置經過嚴格清洗、標準化、版本化的“黃金資料集”,需要大量領域專家與資料工程師協作,是沉沒成本極高的壁壘。例如,Open Catalyst 專案耗費了數百萬 GPU 小時計算 2 億個催化介面吸附能,這種獨家資料集使後續的模型創新擁有了強大的訓練和基準測試基礎。

9.2 主動學習與資料高效獲取

實驗產出資料昂貴,因而主動學習成為關鍵策略。模型不被動接受所有資料,而是主動選擇最有資訊量的下一個實驗。貝葉斯最佳化和不確定性估計方法被用於指導合成化學家或自動化實驗室,在極少的實驗迭代內找到最優條件。這種策略使資料生產從“撒網”變為“釣魚”,大幅降低發現成本。

9.3 資料飛輪與聯邦生態

領先企業正建置“資料飛輪”:AI 預測 -> 定向實驗 -> 實驗結果自動回注訓練集 -> 模型升級 -> 更精準預測。這種閉環一旦轉動,就會產生難以複製的先發優勢。與此同時,為兼顧資料隱私與合規,聯邦學習技術被引入多機構聯合建模,使多家制藥公司能夠在共享一個安全、加密的全域性模型的同時,不暴露各自的敏感患者資料或化合物庫,建置科研資料的協作網路。


10 應用縱深一:生命科學與藥物發現

生命科學是科研 AI 商業化最前沿、資本密度最高、成果最顯著的領域。

10.1 靶點發現與驗證

通過分析基因組、轉錄組、蛋白質組等多模態資料,AI 能夠識別疾病相關的全新靶點。例如,利用圖神經網路融合蛋白質-蛋白質相互作用網路和單細胞資料,篩選出拓撲上關鍵、且可成藥的節點。在此基礎上,自然語言處理技術對海量文獻與臨床試驗資料進行挖掘,交叉驗證靶點與疾病的因果性,極大降低靶點驗證失敗的風險。

10.2 苗頭化合物發現至先導物最佳化

傳統高通量篩選(HTS)耗費數月至年,命中率低。AI 模型能利用數十億級虛擬分子庫,在數天內篩選並排序出最具成藥潛力的分子。擴散模型和分子生成模型直接設計結構新穎、滿足多引數最佳化(活性、選擇性、ADMET、可合成性)的先導物。以 Insilico Medicine 為代表,其 AI 發現的抗纖維化新靶點的全新小分子從靶點發現到提名前臨床候選僅用 18 個月、花費約 260 萬美元,遠低於行業平均的 42 個月和數千萬美元。

10.3 蛋白質設計與合成生物學

AI 正賦予人類“編寫蛋白質程式碼”的能力。利用基於擴散或流匹配的骨架生成網路,可以設計具有全新摺疊方式的蛋白,用於催化非天然反應、靶向特定癌細胞或作為分子機器。在合成生物學中,AI 被用於設計基因迴路、最佳化代謝通路,以實現精準發酵生產高價值化合物。


11 應用縱深二:材料科學與化學

“材料基因組計劃”早已提出,而 AI 將其擴充套件到全新維度:不僅是材料表徵,更是材料創造。

11.1 材料正向篩選與性質預測

利用圖神經網路或等變網路,可以從巨大虛擬材料空間(如包含數百萬種鈣鈦礦、MOF 或合金)中,快速預測其電子帶隙、彈性模量、熱導率、離子電導率等關鍵性質。篩選後的 top 候選再進入 DFT 精細計算,使計算資源節省 99% 以上。這已被廣泛應用於固態電解質、光伏材料和熱電材料的開發。

11.2 逆向設計與新型材料創造

擴散模型能夠直接生成具有指定表面催化活性或磁矩的催化劑表面。在合金設計中,AI 逆向設計已產出具有極高溫蠕變強度的高熵合金,被用於航空航天發動機。更重要的是,生成式 AI 開始探索遠離已知材料的全新化學計量比,而人類直覺從未考慮過這些區域,這開啟了發現規則破缺型材料的可能性。

11.3 化學反應與合成規劃

逆合成分析是化學的核心。基於 Transformer 和 GNN 的模型(如 Chematica)能夠在數百萬已知反應規則中搜索出多條可行路線,並綜合成本、毒性、收率進行排序。結合自動化合成平台,AI 可自主最佳化反應條件(溫度、溶劑、催化劑),在連續的引數空間中快速找到全域性最優,大幅縮短工藝開發週期。


12 應用縱深三:物理、氣候與天體物理

從最微觀的粒子到宏觀宇宙,AI 正重塑物理科學的認知邊界。

12.1 量子多體問題與模擬

求解多電子薛定諤方程是理解化學和材料的基礎。變分蒙特卡洛與神經網路結合產生的神經量子態,通過深度學習波函式 ansatz,實現了在精度與計算量之間更好的平衡(如 FermiNet、PauliNet)。這不僅有助於精確計算分子能譜,還為理解高溫超導等強關聯體系提供了新數值工具。

12.2 天氣與氣候預測

傳統的數值天氣預報依賴大型超級計算機。基於傅立葉神經運算元和視覺 Transformer 的模型(如輝達 FourCastNet、華為盤古氣象)已能在幾秒內給出 10 天全球預報,準確率可比肩甚至區域性超過 IFS 系統,且成本降低千萬倍。氣候模型同樣受益,AI 通過學習次網格物理過程(如雲端微物理、對流)的閉合項,可顯著提升長期氣候預估的可信度。

12.3 天文與粒子物理

AI 已深度參與引力波探測訊號的即時去噪與波源分類、快速射電暴識別,以及大型強子對撞機中稀有事件觸發。在宇宙學中,AI 驅動的模擬和逆問題求解加速了暗物質分佈圖的生成,以及從弱引力透鏡資料中提取宇宙學引數。無監督異常檢測演算法同樣被用於尋找超出標準模型的新物理訊號。


13 應用縱深四:數學與基礎科學發現

數學是高度邏輯的領域,但 AI 正通過模式識別和大語言推論,介入猜想提出與定理證明。

13.1 符號迴歸與規律發現

通過稀疏迴歸和神經網路結合,AI 從觀測資料中發現簡潔的數學表示式(如牛頓定律、薛定諤方程)。這使得研究者能從實驗資料中自動提煉出守恆量和控制方程,對於研究新體系(如複雜流體、生命系統的集體行為)具有啟迪意義。

13.2 定理證明與數學認知

DeepMind 的 AlphaGeometry 解決了國際數學奧林匹克幾何問題,接近人類金牌水平。它通過合成數百萬個定理來訓練神經語言模型,再與符號推論引擎協同。在運算元代數、組合數學等領域,AI 開始為數學家提供有洞見的猜想和反例,真正扮演了“數學協作者”角色。

13.3 基礎物理中的概念關聯

機器學習還在弦理論、散射振幅計算中發現了新的數學結構。通過對大量解析結果進行訓練,神經網路提出新的對偶關係與代數結構,為理論物理學家提供全新視角。


14 競爭格局與產業生態

全球科研 AI 正呈現產學研高度協同、巨頭與初創齊頭並進的格局。

14.1 國際巨頭的平台化戰略

Google DeepMind 以其 AlphaFold、GNoME、AlphaGeometry 等里程碑研究定義了領域高度;微軟設立 AI4Science 研究院,建立大型科學基礎模型並建置雲端運算工具鏈;輝達不僅提供硬體,更通過 BioNeMo、Earth-2 等平台提供預訓練模型和微服務。這些巨頭正利用平台化優勢,試圖建立科學 AI 時代的作業系統。

14.2 獨角獸與初創公司

藥物發現方面,Recursion、Insilico Medicine、Exscientia、BenevolentAI 走在前列,多已管線進入臨床。材料方面,Citrine Informatics、MaterialsZone 提供材料資訊學平台。實驗自動化方面,Arctoris、Synthace 等打通軟硬體閉環。此外,針對科學文件、知識圖譜和實驗室物聯網的創業公司也日趨活躍。

14.3 中國的科研 AI 力量

中國在科研 AI 上有獨特的體制優勢(大科學裝置集中)和資料規模優勢。華為盤古在氣象大型模型上取得突破;深勢科技推出 DPA 系列勢函式與藥物設計平台;多家 AI 製藥企業(晶泰、英矽智慧)已在全球版面配置。中科院體系也在積極推動“科學智算”平台建設,旨在打破資料孤島,推動統一模型發展。


15 挑戰、展望與投資思考

儘管前景光輝,科研 AI 仍面臨諸多結構性挑戰,而這些挑戰本身也指出了未來十年的演進方向。

15.1 可解釋性與可信度

黑盒模型在高風險決策(如臨床試驗准入、核材料研發)面前仍面臨信任危機。可解釋 AI、因果推斷和不確定性量化是必須攻克的關鍵技術,否則科學共同體的採納將受阻。

15.2 資料孤島與標準化

實驗室資料的大量沉默、負面結果的缺失、跨模態對齊的困難,仍形成巨大的隱性成本。推動 FAIR 資料原則(可發現、可訪問、可互操作、可複用)及建置全球化的資料聯盟,是公共規劃和產業發展的當務之急。

15.3 跨尺度模擬與統一範式

現實世界是多尺度、多物理場耦合的(如催化中電子轉移-擴散-反應器尺度流動)。當前 AI 模型多為單尺度單領域,建置能跨尺度無縫傳遞資訊的統一科學基礎模型,是下一個巨大挑戰。

15.4 投資邏輯

科研 AI 投資呈現“資本密集、長週期、高壁壘”特徵。最受關注的是擁有專屬高質量資料飛輪的生物技術公司,以及具備顛覆性基礎模型能力的平台型公司。硬科技基金和 CVC 正加大版面配置,重點關注那些將 AI 與自動化硬體、自驅動實驗室深度結合的企業,因為它們能夠形成“實物資產+資料+模型”三重護城河。

展望未來十年,科研 AI 將從“點狀突破”走向“系統整合”,從“工具賦能”走向“科學夥伴”。在材料、藥物、能源、氣候等關乎人類命運的領域,AI 將不再只是加速器,而是重新定義可能性的第一性原理。能夠把握這一變局,在資料資產、演算法創新與跨學科人才三方面建立優勢的國家與組織,將站在下一場科學革命的潮頭。


source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型