AI行業正在出現一個值得資本市場重視的新變化。
過去兩年,市場討論AI時主要圍繞幾個問題展開:模型能力能否繼續提升、推理成本能否下降、Coding之外能否出現新的萬億美元應用、數據中心建設會不會過剩。
但隨着谷歌發布Gemini 3.8 Flash、SSI宣佈未來12個月算力擴張10倍,以及OpenAI公開討論遞歸自我改進(RSI)與訓練資源調配,前沿實驗室正在把競爭焦點推向另一個方向:
AI不只要服務用戶,也開始參與訓練、評估和優化下一代AI。
RSI,即Recursive Self-Improvement,通常被譯為遞歸自我改進。通俗理解,這並不是模型突然擁有「自我意識」,更多的是讓模型參與模型研發的更多環節:生成算法、編寫代碼、設計實驗、調用訓練工具、評估結果、修復錯誤,並把有效經驗反饋給下一輪研發。
如果這一閉環不斷縮短,AI研發的節奏就可能發生變化。
而RSI不是某一家公司的孤注一擲。谷歌、OpenAI、SSI、Anthropic,幾乎所有前沿實驗室都在朝同一個方向走。
Gemini 3.8 Flash,谷歌發出的RSI信號
9月2日,谷歌正式發布Gemini 3.8 Flash。這是谷歌六周內推出的第三款Flash模型。
性能數據本身已足夠引人注目:在獨立測評機構Artificial Analysis的高推理模式下,3.8 Flash智能指數達到59分,接近GPT-5.6 Sol和Grok 4.6等頂級旗艦模型,單任務成本僅0.58美元,輸入價格0.75美元/百萬Token。
但更值得關注的,是谷歌DeepMind研究員姚順宇對這款模型的定性:
對模型而言,這只是邁出了一小步;但對於RSI來說,這是一次巨大飛躍。
這句話揭示了谷歌真正在做什麼。
谷歌內部備忘錄明確寫道,目標是「逼出遞歸自我進化,把編程模型硬生生改造成全自動AI研究員,徹底打通整個研發閉環」。為此,谷歌組建了由DeepMind CTO領導、聯合創始人謝爾蓋·布林直接監督的代碼突擊隊,並從OpenAI挖來後訓練負責人Barret Zoph出任研究副總裁,主管強化學習和後訓練方向。
3.8 Flash的核心升級,正是這一戰略的產品體現:模型被設計為在複雜任務上執行更多推理步驟、反覆調用工具,通過長時間運行的智能體循環對自身結果進行評估和優化。換句話說,模型開始承擔「規劃—執行—檢查—修復」的完整流程。
值得一提的是,谷歌內部原本有幾個3.5 Pro候選模型,但最終全部被否決——原因是它們並沒有比Flash系列強出足夠多。與此同時,下一代旗艦Gemini 4仍卡在後訓練階段。這一切陰差陽錯,反而造就了Flash系列的瘋狂迭代。
OpenAI的剎車與SSI的加速:巨頭的同頻共振
就在谷歌發布新模型前後,OpenAI CEO Sam Altman在一次公開訪談中做出了一個罕見表態。
他承認,OpenAI延遲了一次前沿強化學習(RL)訓練run。這是OpenAI歷史上第一次主動暫停前沿訓練。
原因不是某個單一的「冒煙槍」事件,在訓練過程中,團隊觀察到模型能力提升的速度本身令人震驚。
Altman原話是:「能力進步的速度……我只能用'令人敬畏'來形容。我們需要更多時間讓安全、對齊和安全保障跟上來。」
他進一步說:「一年前,我不認為超級智能會很快到來。現在我認為它可能會發生。我不是說一定會,但我們正在以極快的速度推進。」
Altman同時表示,這次暫停專門針對前沿RL訓練run,並非所有訓練都停止,集群也沒有閒置。他強調,OpenAI當前商業勢頭強勁,企業收入已超過消費者收入,現有模型仍有大量商業價值可以挖掘。
但這一表態的信號意義遠超商業層面:連OpenAI自己都要剎車等安全跟上,這是RSI臨近最直接的公開信號。
此外,就在近期,英偉達宣佈對SSI(Safe Superintelligence Inc.)進行重大戰略投資,SSI同時宣佈未來12個月算力將擴張10倍。
SSI由OpenAI聯合創始人、前首席科學家Ilya Sutskever於2024年6月創立,其「唯一目標與唯一產品」是安全的超級智能。
這則公告中,最值得關注的一句話是:
Our research is worth scaling(我們的研究已經值得大規模擴張)。
據華爾街見聞文章援引「少數派觀點」分析顯示,市場目前流行一個敘事:除了Coding,AI還沒有找到下一個萬億美元級應用,因此到2028年前後,AI資本開支增速大概率見頂。
但SSI事件揭示了這個敘事可能抓錯了變量。
決定前沿實驗室CapEx的第一變量,從來不是某個應用賽道,而是:下一代模型是否仍然值得繼續擴大訓練規模。
過去半年,幾乎所有前沿實驗室釋放的信號高度一致:OpenAI繼續擴建訓練集群,Anthropic持續孖展建設AI基礎設施,xAI不斷擴建Colossus,Meta持續建設GW級AI園區,谷歌繼續擴大TPU部署,SSI宣佈算力擴張十倍。
沒有一家公司的行動體現出「訓練結束了」。
RSI重塑算力邏輯:訓練從「一次性」變成「永不停止」
這一切的關鍵可能在於RSI(遞歸自我改進)正在改變訓練本身的形態。
過去的訓練模式是:收集數據→訓練→發布→結束。
RSI時代的訓練模式是:模型A生成新算法→訓練模型B→模型B優化訓練流程→訓練模型C→模型C發現更好的RL策略→循環不止。
這意味着訓練變成了持續訓練(Continuous Training)——將永不停止。
為了驗證一個新算法,以前訓練一次,現在可能同時跑100個、1000個、10000個版本,最後只留最好的一個。
據華爾街見聞援引的分析,這帶來一個直接推論:算力優勢直接變成研究優勢,研究優勢直接變成模型優勢。 擁有足夠GPU的實驗室一天能完成全部驗證,缺少GPU的實驗室一天只能完成5個、10個,速度差距立刻被拉開。
OpenAI提出了Automated AI Researcher(自動化AI研究員)的概念;Anthropic大量讓Claude參與模型研發;谷歌AlphaEvolve已經開始利用AI尋找新算法。這些都是RSI的真實落地。
Gavin Baker的警告:頂尖實驗室可能主動砍收入去訓練
這對投資者意味着什麼?
知名科技投資人Gavin Baker在近期一次公開對話中給出了一個具體測算:
假設某家實驗室擁有10GW算力,其中8GW用於推理,按每GW 600億美元計算,年化收入約4800億美元。
假設他們取得了重大研究突破,決定將推理分配從8GW壓縮到2GW,同時將訓練從2GW擴大到8GW,那麼年化收入就會從4800億驟降至1200億。我認為他們真的可能做出這樣的決定,而這是公開市場必須習慣的事情。
Gavin Baker同時表示,基於對Scaling Laws的堅信,頂尖大模型公司短期內不會追求自由現金流,取而代之的是會將所有利潤和資金重新投入購買算力和模型訓練。
他還指出,這與Meta、谷歌等互聯網公司不同——後者的基本面相當平穩,基礎設施成本與收入之間不存在巨大的權衡取捨。而前沿實驗室隨時可能為了長期技術優勢,主動犧牲鉅額短期商業收入。
這對AI股估值是一個重大風險提示。
前沿研究員的心理:算力壓倒一切帶來的無力感
這場競賽也在改變前沿研究員的心理狀態。
Conviction創始人、AI投資人Sarah Guo在一檔視頻博客採訪中分享了自己對約250位前沿AI建設者的觀察,過去12個月內,越來越多頂尖研究人員開始相信:具備遞歸自我改進能力的AI研究模型出現後,人類距離指數級智能可能只有1到2年時間。
但與此同時,當模型訓練預算邁向數百甚至數千億美元、團隊擴大到數千人時,部分頂尖研究員產生了兩種消極情緒:
我做的事情不重要,因為模型很快能自己做。
唯一重要的只有算力規模,個人貢獻被稀釋。
這種心理變化本身,也是RSI邏輯正在被業內廣泛接受的側面印證——當研究員開始覺得「只有算力重要」,恰恰說明算力與研究能力之間的綁定已經足夠緊密。
RSI將至,市場敘事需要更新
一個對投資者有直接影響的結論正在浮現:
市場關於「2028年AI資本開支見頂」的敘事,建立在一個前提之上——CapEx由商業化應用需求單方面驅動。
但RSI提供了一個不同的判斷框架:決定未來CapEx的,不只是推理需求和應用收入,還包括模型能力是否仍值得持續擴大訓練。
只要前沿實驗室仍然相信「Our research is worth scaling」,訓練投入就不會停止。而從目前所有公開信號來看,這個前提尚未動搖。
RSI會不會成為下一輪AI資本開支的核心變量?
現在下結論仍然太早。
RSI尚未被證明能夠穩定帶來指數級能力躍遷。模型在基準測試中的提升,也不等於能夠在真實研發環境中持續、自主地改進模型。更高的智能體能力還會帶來更高Token消耗、更復雜的系統工程,以及更大的安全風險。
但從谷歌、SSI和OpenAI釋放的信號看,前沿實驗室顯然已經不再把RSI視為遙遠的理論概念。
谷歌在嘗試讓低成本模型完成更長、更復雜、更可驗證的智能體任務;SSI在用10倍算力擴張驗證「研究是否值得大規模擴張」;OpenAI則在討論如何在安全、商業化和前沿訓練之間重新分配資源。
這些變化共同指向一個趨勢:
大模型行業下一階段的競爭,可能不只是「誰的模型更會回答問題」,更為重要或許是「誰能讓AI更快地參與AI研發,並在安全邊界內完成自我迭代」。
如果這一趨勢持續,AI產業鏈的核心問題也將發生變化。
市場不應只問:AI應用收入夠不夠支撐數據中心建設?
還需要問:前沿模型的能力曲線是否仍在上行?AI能否真正縮短研發周期?訓練集群能否將算力轉化為研究成果?以及,安全體系能否跟上模型自我迭代的速度?
這或許纔是RSI對AI資本開支、模型競爭和科技投資最重要的影響。