GPT-6登頂第一,AlphaFold之後最大震撼,成抗體預測最強AI

新智元
09/11

AlphaFold之後的最大震撼來了。

啱啱,OpenAI 總裁 Greg Brockman轉發的一條消息,足以引爆整個科技與醫藥圈。

知名科學家 Andrew Aiginin 在X上發布了激動人心的消息——

在嚴苛的獨立基準測試中,GPT-6 Astra 啱啱擊敗了所有前沿模型,成為了抗體可開發性預測的最強AI!

不僅拿到了跑分第一,Astra 還在短短 1 小時內,直接手搓出了複雜的抗體機理交互式可視化頁面。

一直以來,圈內都有一個共識:「AI for Science,必須是用專用的模型,打專用的問題。」

比如 AlphaFold 之於蛋白質摺疊,LLM通常只被當成寫代碼和讀文獻的輔助工具。

但今天,GPT-6 Astra 將這個共識撕開了一道巨大的口子!

它依靠通用智能,直接切入了生物醫藥研發中最難量化、最令人頭疼的臨床前死穴。

而這一切並非偶然。構建該測試基準的頂尖 AI 製藥團隊Insilico Medicine在 arXiv 上放出一篇21頁重磅論文。

標題:Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

論文:https://arxiv.org/pdf/2608.18940

這篇論文,不僅首次揭開了測試 GPT-6 Astra 的 DDD Benchmark 的嚴苛性,更向我們展示了:從小分子化學合成,到大分子抗體預測,通用大模型正在全面接管最硬核的科學邊界!

AlphaFold 之後的科學範式轉移,或許才啱啱開始。

37.98分!GPT-6登頂權威「DDD基準測試」

實測結果顯示:GPT-6 Astra 接入 DDD Benchmark 中的抗體可開發性測試模塊(綜合了 6 種不同的抗體實驗數據)後,拿下了驚人的 37.98 分,碾壓了所有受測模型。

AI 學者 Rim Shayakhmetov 發出難以置信的驚歎:

「專用模型在這個任務上的常規分數是多少?這結果太有趣了,你很難在藥物發現的基準測試中,看到前沿的大語言模型在‘不依賴外部專用工具’的情況下如此閃耀!」

沒有專業生物信息學插件、沒有專門做抗體數據微調的情況下,一個通用大模型,居然直接切中了抗體成藥性的命脈,這太令人興奮了。

發現抗體只是開始,「成藥」纔是真正的死亡之谷

要理解 GPT-6 Astra 這一成績的含金量,我們首先得弄懂一個醫藥界的殘酷現實。

Andrew寫下了一句直擊靈魂的話:「找到一個能結合的抗體僅僅只是開始。它會聚集嗎?它能保持穩定嗎?它真的能像一個藥物那樣發揮作用嗎?」

這句話,道出了全球無數新藥研發人員的血淚史。

在過去,當我們談論抗體藥物研發時,大家最關注的是「結合力」。

通俗點說,就是這個抗體能不能精準地像鑰匙插進鎖孔一樣,識別並結合到病毒或癌細胞的靶點上。

早期的AI模型(比如AlphaFold)已經在「預測結合」這件事上做得非常出色了。

但是!能結合 ≠ 能變成藥。

這就好比談戀愛。男女雙方看對眼了,一見鍾情,這只是第一步。你們能不能走進婚姻的殿堂?能不能經受住柴米油鹽的考驗?

在藥物研發中,這個「柴米油鹽的考驗」被稱為「成藥性」。

現實中,無數看似結合力極強的「完美抗體」,一旦進入真實的生理環境或工業生產環節,就會暴露出致命缺陷:

它會不會聚集成團?

它的結構穩不穩定?

它到底能不能表現得像一款真正的「藥」?

這些屬性統稱為抗體可開發性。

這是整個生物製藥界的「死亡之谷」。

它導致了一個極其慘烈的局面:全球每年有成千上萬個抗體分子在實驗室裏表現優異,但最終倒在了「成藥性」的評估階段。

藥企為此燒掉了幾十億美金,耗費了幾年甚至十幾年時間,最終顆粒無收。

而今天,GPT-6 Astra 宣佈,它能比目前世界上任何其他前沿模型,更精準地預測這些成藥性特徵。

揭祕試金石:GPT-6 Astra 面對的「地獄級」基準測試

有人可能會問:這會不會又是一個「刷榜」成績?

絕對不是。

Bogdan A. Zagribelnyy 博士指出,Astra 登頂的平台是他們構建的 DDD Benchmark。

在他們發布的論文中,我們看到了這個測試體系多麼硬核。

雖然推文討論的是「大分子抗體」,但這篇論文展示了該團隊在「小分子化學」領域建立評測標準的恐怖深度。了解了這個背景,你纔會明白 Astra 的奪冠有多麼不可思議。

在論文中,研究團隊聚焦了另一個製藥界的世紀難題:單步逆合成。

簡單來說,逆合成就是「化學界的倒推法」——給你一個目標藥物分子,你需要倒推出可以用哪些現成的、便宜的化學原料來合成它。

過去的 AI 評測是怎麼做的?

給 AI 一個目標分子,AI 吐出一個合成路徑,如果跟已有的專利數據庫(比如 USPTO)裏的一模一樣,就算 100 分。

但這在真實世界裏幾乎行不通。因為合成路徑天生就是「一對多」的,傳統的「單一標準答案」評估法,極大地限制了 AI 探索未知的能力。

為此,Insilico 團隊構建了令人髮指的測試環境:

1.URSA-expert-2026 基準:這是一個包含 100 個由機器生成、並由頂尖人類化學專家手動確認合成可及性的全新分子數據集。它與任何公開的訓練數據完全隔離,徹底杜絕了模型「背題」的可能性。

2.ChemCensor 打分系統:他們不看模型是不是完美復刻了專利,而是開發了 ChemCensor 框架,從「反應中心映射」、「官能團兼容性」等最底層的化學物理規則出發,去判斷模型生成的反應是否具備真正的化學合理性)。

正是在這種「剝殼見骨」的物理/化學規律考覈下,傳統的 LLM幾乎都失敗了。

在早期的 Top-1測試中,哪怕是強如 GPT-5.5、Gemini 3.1 Pro,其表現依然無法超越最頂尖的專用傳統化學模型(如 MHNreact、LocalRetro)。

「大力出奇跡」的通用 LLM ,似乎碰壁了。

4500萬數據,LLM被「逼出」科學直覺的?

通用 LLM 拼不過專用模型,那該怎麼辦?

論文給出的答案震撼了業界——不要換模型,換一種激發通用模型潛力的方法。

研究團隊在論文中提出了三大殺招,徹底解鎖了大模型在化學領域的封印:

第一招:Top-K 提示詞範式

既然逆合成是「一對多」,那就不要讓 LLM 只猜一次。

團隊在 Prompt 中明確要求:「給我 15 種不同的答案」。

奇蹟出現了,僅僅是切換到 Top-K模式,幾乎所有的大模型(GPT-5.5, Claude Opus系列)在化學合理性和多樣性上都迎來了爆發式增長。

Gemini 3.1 Pro 在 Top-15 模式下性能飆升,直接成為最強 LLM 基線。

這證明,大模型是有科學知識的,只是過去的提問方式不對。

第二招:構建 4560 萬規模的超大核驗數據集(CREED-CCV-2+USPTO-XL)

為了訓練出專門針對化學限制對齊的語言模型(C3LM),團隊不惜算力,利用虛擬合成引擎和 ChemCensor 框架,硬生生構建了一個包含約 4560 萬個經過驗證的真實化學反應的超大規模數據集。

第三招:強化學習中的「新穎性」獎勵

在微調 C3LM 模型時,他們引入了 GRPO 強化學習算法。

獎勵函數極其刁鑽:模型給出的合成路徑不僅要符合 ChemCensor 的化學合理性,而且如果模型能想出一種連 4500 萬訓練集裏都沒有、但依然合理的全新反應,將會獲得額外的巨大獎勵。

結果是什麼?

經過這種「地獄級」訓練的 C3LM 模型,在 URSA-expert-2026 盲測中,終於一舉擊敗了 MHNreact 等所有傳統專用 SSRS 模型!

數據分析顯示,C3LM 和其他基礎大模型能夠探索出與傳統模型完全互補的反應空間,生成了大量傳統模型想不到的獨特路徑。

論文的核心結論是:大語言模型不僅能處理自然語言,只要給予正確的環境和激勵,它們完全可以掌握最深奧的化學鍵、官能團和合成邏輯!

降維打擊:從 C3LM 到 GPT-6 Astra,通用智能的全面接管

如果你看懂了上面這篇論文,你就會明白 Bogdan 博士為什麼會把 GPT-6 Astra 的成績和這篇論文聯繫在一起。

在這篇論文中,Insilico 團隊費盡九牛二虎之力,用 4500 萬條數據微調、用強化學習對齊、用 Top-K提示詞引導,才終於讓大模型在小分子化學合成上打敗了專用模型。

然而,當測試賽道切換到更加複雜、維度更高的大分子可開發性預測時,GPT-6 Astra 居然在「沒有使用外部工具」的情況下,直接在同樣的 DDD Benchmark 測試體系下登頂,拿下了 37.98 分!

這絕對是降維打擊。

過去,我們要解決抗體穩定性問題,需要專業團隊設計專門的三維圖神經網絡。

而現在的 GPT-6 Astra,它的通用世界模型中似乎已經內化了物理、化學、生物的底層邏輯。

它在閱讀了人類歷史上浩如煙海的論文、專利、實驗數據,甚至通過多模態學習了微觀世界的物理法則後,已經能像人類專家一樣,「直覺」判斷出一個蛋白質分子在溶液中為什麼會聚集。

此外,Astra 展現出的工程效率同樣令人膽寒。

Andrew Aiginin 提到:「順便提一句,這個展示抗體實際工作原理的交互式可視化頁面,也是用 Astra 在大約 1 小時內建好的。」

在傳統藥企,做這樣一個系統,整個流程少說也要兩三周。

現在,1個小時,一個人,一個通用大模型,就能解決了。

AlphaFold 之後,真正的範式轉移

GPT-6在抗體基準上的跑分第一,宣告着通用大模型已經顯出AGI雛形,在人類最頂尖智力活動中取得的實質性統治。

這個排行榜第一,宣告了這個新時代的到來——

未來十年,科學發現的核心驅動力,可能不再是為每一個孤立的科學問題定製一個專門的 AI 模型;而是學會如何向一個如同神明般的ASI提出正確的 prompt。

小分子逆合成被突破了,大分子抗體成藥性被突破了。

從新藥研發到材料科學,從聚變控制到量子物理,通用大模型的外溢紅利,即將如海嘯般席捲所有硬核行業。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10