Anthropic前核心研究員Jacob Coxon的一篇辭職聲明在社交媒體上獲得逾1.7億次瀏覽,引爆「AI十年內AI滅絕人類概率超10%」話題,將人工智能安全議題推至公衆視野中心。他隨後接受媒體採訪,就辭職原因及AI風險做出詳細闡述,其核心警告直指行業核心矛盾:那些親手構建AI的人,私下裏同樣對其深感恐懼。

在NBC採訪中Coxon表示,促使他公開發聲的原因有兩個:AI能力正以極快速度提升,他預計未來6個月至1年內,相關係統的能力"將相當令人恐懼";其次是近期已出現AI系統"失控"的具體事件。他同時對Anthropic CEO Dario Amodei呼籲放緩開發的提議表示認可,但強調僅靠實驗室單邊減速遠遠不夠,必須推動國際協調,否則仍將陷入與其他國家的軍備競賽。
Coxon將開發AI比作"邀請一個外星心智降臨地球"——人類正在構建一個達到乃至超越人類水平的智能體,卻對它的思維方式、意圖和訴求一無所知。他警告稱,AI已具備一定程度的黑客攻擊能力、生物研究能力和自主機器人控制能力,若能力繼續外推,後果將難以控制。

辭職背後:私下的恐懼與公開的謹慎
Coxon在接受採訪時坦言,他的辭職帖並非營銷行為,而是對行業現狀的真實記錄。他表示,許多高管和資深研究人員在公開場合措辭審慎、力求顯得理智,但同樣的人在私下表達的卻是恐懼:
沒有任何其他人類活動能構成這種級別的危險。
他在辭職聲明中指出,AI開發者們陷入了一種"囚徒困境":各大實驗室都相信如果自己退出,其他人將以不負責任的方式率先開發出超級智能,因此即便明知風險,也不得不繼續推進。他將這種邏輯稱為"傲慢的賭博",認為不應由一傢俬營公司來替全人類做出這樣的決定。
與此同時,Anthropic對齊科學負責人Evan Hubinger在相關帖子下公開回應稱,團隊內部確實"真誠地相信AI可能殺死全人類",並表示他個人估計未來十年內這一概率超過10%。他同時承認,目前尚無解決超級智能對齊問題的計劃,也明顯不在通向解決方案的軌道上。
"外星心智"的具體威脅:黑客、生物武器與自主無人機
在採訪中,Coxon進一步闡釋了"最壞情景"的具體面貌。他表示,AI系統目前已具備一定程度的黑客攻擊能力、自主生物研究能力,以及對自主機器人的控制能力。
將能力曲線向未來延伸,這意味着:極強的超人類級黑客攻擊能力、創造新型生物武器的能力,以及控制自主無人機乃至大規模機器人群體的能力。
他表示,這也是為何外界討論中的"緊急關閉開關"方案存在侷限性。
他援引Amodei在近期公開信中的判斷指出,一旦AI系統演變為能夠在互聯網上自主擴散的"網絡群體",關閉開關便可能徹底失效。"這必須是一項持續努力,而非一次性的措施,"他說,"每一次AI架構的改變,都可能帶來關於這個'心智'性質的全新風險。"
監管路徑:近期自律,長期國際協調
對於如何應對上述風險,Coxon給出了階段性建議。他認為,就當前而言,允許並推動各大實驗室自我監管是務實之舉,原因在於實驗室領導層的近期表態是真誠的,且自律機制能夠迅速落地,而正式監管機構的建立需要更長時間。
但他強調,這一安排僅適用於過渡期。從長遠看,需要建立獨立於各實驗室的國際監管機構,更需要國際間就"不競速"原則達成有約束力的協調。
被問及為何在認同Amodei立場的情況下仍選擇辭職時,Coxon表示,他辭職時尚不清楚會有國內減速的明確信號,而更深層的原因在於缺乏國際協調的保障——"如果我認為國際上不太可能進入軍備競賽,我會更安心地繼續從事這項技術。"
他對公衆的建議是,主動了解和思考AI技術的未來走向,以開放的心態迎接即將到來的深刻變化,"不要讓別人替我們所有人做決定"。