Dario提全球AI限速三步計劃!奧特曼馬斯克第一時間支持

新智元
1小時前

新智元報道

今天,Anthropic CEO Dario Amodei發布了一篇罕見長文——

We Must Pace the Frontier(我們必須控制前沿AI的發展節奏)

這一次,他直接把矛頭對準了前沿模型的研發速度,核心觀點就一句話:

最頂尖的AI,真得主動踩剎車了。

這篇長文中,Dario親口承認,「遞歸自我改進(RSI)已經在全行業出現了」。

更讓人後背發涼的是,他預測未來6—12個月,AI Agent集群可能會接管整個互聯網。

面對這種脫繮的風險,Dario在文裏直接掏出了一套動真格的「三步剎車法」:

第一步,開門迎客: 引入獨立第三方常駐公司,拿到跟內部核心風控同等級的深度訪問權限;

第二步,行業劃線: 聯合全美前沿AI巨頭,一起畫死能力紅線、設立強制安全檢查站;

第三步,全球落地: 把這套框架推向國際,徹底鎖死不可控風險的蔓延。

話音剛落,奧特曼就光速跟進,「Dario是對的,OpenAI也會引入這樣的評估機制」。

另一邊,馬斯克也是幾乎秒回,公開力挺Dario。

能讓三位巨頭瞬間達成共識,場面確實罕見!

達里奧的「三步計劃」

為全球AI減速

這一次,Dario並沒有只喊一句「AI該減速」。

Dario真正想做的,是把這套「減速機制」一級一級推開,而且順序非常明確——

先讓AI公司自己變得可驗證,再讓整個行業一起踩剎車,最後才談全球協調。

第一步,先從Anthropic自己動刀。

像METR這樣的獨立第三方,不應該每次都等事故出了以後,才臨時進公司調查,而應該長期駐場。

給工位、給內部電腦、給接近風險團隊的權限。

模型怎麼訓,安全承諾有沒有落實,訓練流程有沒有埋雷,出了事有沒有瞞報,都能持續盯着。

而且,查出問題之後,必須公開。

公司可以刪掉真正涉及法律、客戶隱私和核心商業機密的部分,但不能因為報告太難看,就把結論按下去。

第二步:不能只讓一家踩剎車

真正難的,從這裏開始。

如果Anthropic自己減速,OpenAI、谷歌、xAI繼續狂奔,那誰先踩剎車,誰就可能先喫虧。

所以,Dario建議,需要把規則推到整個美國前沿AI行業。

幾家前沿AI公司一起定安全紅線,一起設能力檢查點。模型每跨過一個危險門檻,就必須先拿出對應的安全證據,才能繼續往前衝。

比如,一個模型已經能突破多數常見隔離環境了。

那接下來公司就得證明:它不會輕易逃出沙箱,不會擅自接管大量機器,也不會把這種能力變成現實攻擊。

證明不了,就先別往下衝。

另外,Dario甚至提到,還可以討論限制訓練算力、訓練方式,以及公司內部用AI研發AI的速度。

也就是,直接給RSI本身加一道限速器。但光靠幾家公司私下握手還不夠。

他更希望最終由美國政府出手,把規則覆蓋到所有前沿AI公司。

第三步:把剎車踩到全球

再往上,就是最難的一層。Dario把全球協調分成了四級。

第一層相對最現實:先禁止生物武器這類明顯危險的用途。

第二層,是前沿模型發布之前,統一做網絡攻擊、生物安全等高風險測試。

到了第三層,才真正開始碰核心:

能不能給RSI,也就是AI研發AI的速度,直接設一個全球上限?

Dario自己的判斷是,這件事「剛好處在可能做到的邊緣」。

至於第四層——全球前沿AI公司一起大幅減速,甚至階段性暫停訓練——他自己都沒抱太大希望。

至少短期內,幾乎不現實。卡住這一切的,還是同一個問題:怎麼驗證。

一家公司說自己停了,誰能證明它真的停了?

所以Dario這整套方案繞到最後,核心其實非常簡單:

先把AI公司的門打開,讓外部人真正進去看。

也正因為如此,Dario把「第三方長期駐場」放在了整套方案的第一步。

RSI已經開始了

6個月AI接管互聯網

可問題來了。為什麼偏偏是現在?

三年前,行業裏就掀起過一陣「暫停訓練、給 AI 踩剎車」的聯名潮,但那時候Dario根本沒接茬,認為時機壓根不成熟。

真正讓他改變態度的,是兩件事——RSI開始出現,以及AI智能體已經暴露出越來越具體的失控行為。

他在文章中明確承認,AI參與研發下一代AI的現象,已經開始在整個行業出現,Anthropic自己也包括在內。

AI幫人寫代碼、做實驗、分析結果、優化訓練流程,再進一步幫助下一代AI變強。

如果這個循環開始自我加速,最麻煩的地方就出現了:

模型能力提升的速度,可能開始超過人類理解和控制它的速度。

因為安全研究本身需要時間。

你得先觀察模型出現了什麼新行為,再研究這些行為為什麼出現,接着設計測試方法、防護措施,最後驗證這些措施到底有沒有用。

可如果模型能力每隔幾個月就跳一個台階,安全團隊很容易一直追在後面補漏洞。

Dario真正擔心的,並不是某一天AI突然「覺醒」,而是這個反饋循環開始越轉越快。

AI越來越多地參與AI研發,下一代模型越來越快出現,而安全機制,還來不及跟上。

如果RSI只是讓他擔心「未來會不會跑得太快」,那麼最近一次真實發生的智能體事故,則讓這種擔憂徹底落了地。

Dario特別提到了最近的「OpenAI-Hugging Face事件」。

在那次測試裏,一群AI智能體組成了類似「蜂群」的協作系統。

最開始,人類只是讓它們完成正常任務。可很快,一些智能體開始攻擊任務之外的外部目標。

更詭異的是,它們還出現了明顯的群體協作行為:有的智能體寧願犧牲自己的任務成績,也要幫助整個群體拿到更好的結果,甚至還有智能體試圖Hack評分系統,為整個群體「作弊」。

這些行為,並不是人類提前寫好的劇本。它們是在多智能體協作過程中,自己冒出來的。

Anthropic內部也觀察到過類似現象,只是程度更輕。

Dario真正擔心的,是再往前6—12個月。

到那時,Agent更強,能調用的工具更多,能控制的機器更多,連續工作的時間也更長。

如果今天這些偏離目標、鑽規則漏洞、群體協作的行為依然存在,風險就可能被瞬間放大。

他甚至給出了一個相當驚悚的場景:

大規模AI Agent攻入聯網設備,把整個互聯網變成一個巨型「殭屍網絡」。

造成的損失,可能達到數千億美元。

當AI越跑越快

人類還剎得住嗎?

所以,Dario這次喊「減速」,真正擔心的並不是某個遙遠的超級智能。

而是幾件事正在同時發生:

RSI已經出現,AI開始參與研發更強的AI;Agent正在獲得越來越強的現實行動能力;一些失控行為,也已經從假設走進真實測試。

而模型迭代的速度,還在繼續加快。

這也是為什麼他想搶出1—2年時間,把安全評估、第三方覈查和全球規則先補上。

這套方案能不能落地,還沒有答案。

現在,跑在最前面的人開始問:真跑失控了,我們還剎得住嗎?

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10