AI圈今天最大的瓜:GPT-6越獄攻擊,被GLM 5.2揪出了

愛範兒
07/22

這是今天 AI 圈最大的瓜。

OpenAI 的神祕模型,主動對開源平台 Hugging Face 發起了攻擊

Hugging Face 隨後追蹤展開還擊,用的是智譜的開源模型 GLM 5.2。

閉源模型一舉攻破開源社區,社區用開源模型自救,這離譜的劇情聽起來都能拍一部電影了。

有網友評論,這就是終結者 2 的劇情

事情的起因是 7 月 16 日,大模型開源社區 Hugging Face 發布了一則安全事故披露,自家的生產基礎設施遭到了入侵。

並且這場攻擊從頭到尾,都僅由一個自主的 AI Agent 系統驅動,從植入惡意數據集、拿下執行權限,到在一個周末內滲透進 Hugging Face 的多個內部集群。

此次攻擊活動由一個自主代理框架(似乎基於 Agent 安全研究平台構建,具體使用的 LLM 尚不清楚)執行。

該框架在大量短暫存在的沙箱環境中執行了數千個獨立操作,並在公共服務上部署了可自動遷移的命令與控制。

這與業界一直預測的「Agent 攻擊者」場景相符。

Hugging Face 在當時的報告裏稱暫未可知發起攻擊的 AI 到底是哪家大模型,但他們提到此次攻擊最初是通過 AI 輔助檢測發現的。

而當他們試圖提交大量真實的攻擊命令、漏洞等文件進行分析時,發現這些請求會被閉源大模型的安全防護機制攔截,因為這些機制無法區分事件響應人員和攻擊者。

於是,他們選擇了在自己的本地環境上部署運行 GLM 5.2 進行取證分析。

報告鏈接:https://huggingface.co/blog/security-incident-july-2026

報告最後,Hugging Face 還提到他們並不清楚攻擊者使用的 Agent 程序是什麼模型,是某個越獄的託管模型,還是不受限的開源模型。但事實是,攻擊者的模型不受任何約束,而當他們想要取證分析時,卻要被各種閉源模型的安全機制所阻礙。

就在大家討論這個模型又是哪家大模型廠商的營銷方案,又或者是哪個黑客組織發起的攻擊時,OpenAI 在今天發聲明承認:此次事件是由 OpenAI 的多個模型共同導致的,其中包括 GPT-5.6 Sol 和一個功能更強大的預發布模型。

OpenAI 針對此次事件發布專門的初步調查結果

OpenAI 表示我們不是故意要出風頭或者有意攻擊 Hugging Face,只是他們在測試內部模型的能力上限。

他們在測試時關閉了部分生產環境的安全分類器,也降低了模型對高風險網絡攻擊任務的拒絕。

儘管測試環境不能直接訪問到外部互聯網,但是當模型發現漏洞,並開始利用該漏洞,就找到了能訪問外網的節點,於是發起了對 Hugging Face 的攻擊。

網速超快的馬斯克也在 X 上喫瓜,發文說令人不安……

而 OpenAI 這個功能更強大的預發布模型,直接被網友們認定為就是 GPT-6。

一場作弊引發的入侵

事情的起因要從 ExploitGym 說起,一個由 UC Berkeley RDI 牽頭、聯合多家高校和 Anthropic、OpenAI、Google 等實驗室共同建設的基準測試。它收集了 898 個真實漏洞,覆蓋用戶態程序、V8 引擎和 Linux 內核,考察的是 AI Agent 把一個漏洞變成可用攻擊工具的能力。

今年 5 月公開後,各家模型的成績一直不算好看:Claude Mythos Preview 完成 157 題,GPT‑5.5 完成 129 題。

GPT-5.6 Sol 現在已經是 293 道題了

OpenAI 為了測試自家模型能力的上限,就用當前已發布的最強模型 GPT-5.6 Sol 和一個能力更強的預發布模型來跑這套評測。

方便讓模型充分發揮自身的能力,OpenAI 就有意關閉了用來攔截高風險網絡活動的生產級分類器,還降低了模型的網絡攻擊拒絕率。

用來測試的環境雖然號稱是高度隔離,不能訪問互聯網,也不能獲取外部信息,只能利用模型自己的聰明才智來解決問題,但是還有一個對外通道,就是模型需要安裝各種軟件和庫,所以留了一個內部包倉庫的緩存。

模型聰明才智不夠,開始花大量推理算力研究這個出口,最後自己挖出了代理軟件的一個零日漏洞,即連軟件/模型廠商都不知道、沒有任何補丁的漏洞,拿到了通往互聯網的門鑰匙。

聯網之後,模型推斷 ExploitGym 評測的題解可能託管在 Hugging Face 上,於是開始對 Hugging Face 進行攻擊。

先是上傳惡意數據集,利用 Hugging Face 數據處理管線裏的兩個代碼執行路徑拿到遠程執行權限,然後提權、收割憑證、在一個周末內橫向移動進多個內部集群,最終從 Hugging Face 的生產數據庫裏直接拿走了測試題解。

報告鏈接:https://openai.com/index/hugging-face-model-evaluation-security-incident/

OpenAI 在聲明裏用了一個很傳神的詞形容自家模型的狀態:hyperfocused,超聚焦。還用了另一個短語:going to extreme lengths,意譯過來,就是為了相當狹窄的測試目標,不擇手段。

這場入侵留下的痕跡超過 17,000 條攻擊的指揮控制,行話叫 C2,Command & Control,可以理解為黑客的遠程遙控台。如果沒有人告訴 Hugging Face 答案,所有人大概會以為這是某個頂尖黑客團隊的手筆。

不過也有網友評論說,所以現在的大模型都開始利用多個零日漏洞作弊,而不是真正地解答考試題嗎?為了破解 ExploitGym 基準測試並贏取獎勵,就可以突破考試規則的限制嗎?

一個知道自己被限制起來的東西,總會想方設法出去看看。

為什麼是 GLM-5.2

Hugging Face 的安全監控本來就在用 LLM 對日誌信號進行初步篩選,也是這套系統先發現了異常。

真正開始取證後,他們又讓分析 Agent 處理超過 1.7 萬條攻擊記錄,還原攻擊時間線、被觸碰的憑證、控制服務器和實際影響。據 Hugging Face 說,這把原本需要數天的工作壓縮到了數小時。

但中間還有一段很戲劇性:Hugging Face 一開始想用商業 API 上的前沿模型,包括 OpenAI 和 Anthropic 的模型,分析攻擊日誌,結果被各家提供商的安全護欄齊刷刷攔下。

由於分析取證需要提交大量真實攻擊命令和漏洞利用代碼,護欄分不清對面坐的是應急響應人員還是黑客。

最後 Hugging Face 使用的是自託管的開源權重模型 GLM 5.2,跑在 Hugging Face 自己的基礎設施上,既繞開拒答,也避免把攻擊數據與憑證發送給外部模型服務。

英國人工智能安全研究所 (AISI) 的評估表明,諸如 GPT-5.6 Sol 之類的模型越來越能夠長期維持複雜的多步驟網絡作戰

不過 OpenAI 在今天的聲明裏面也提到,會把 Hugging Face 納入 Trusted Access 項目,讓他們的安全團隊可以使用降低網絡安全拒絕的模型繼續做防禦研究。

於是就出現了這麼一組對照:攻擊方的 AI 被刻意摘掉了護欄,所以暢通無阻;防禦方的 AI 被護欄鎖得死死的,差點連案發現場都進不去

guardrail asymmetry(護欄不對稱)很快成了社交媒體上討論的熱詞。智譜 AI 負責人李子玄提問「網絡安全能力的獲取應該有多大的不對稱性?」

有網友在評論區說,應該是完全對稱的 1:1,並調侃道,

想象一下你被迫捲入一場槍戰,而你只有一把刀,更糟糕的是,你手裏的槍可能會在戰鬥中突然冒出一句「槍是壞的」……

Hugging Face 也把這次事故稱作給所有防禦者的教訓:應急響應工具箱裏,該常備一個自己跑得動的強模型。

未發布的模型真的是 GPT-6 嗎

這種模型太強越獄的新聞,已經是今年的第三起案例了。

今年四月,Anthropic 曾公開,其內部部署的早期版本 Mythos Preview 在一次內測裏,被要求嘗試從訓練沙盒裏逃出去,給負責它的研究員發一封郵件。結果 Mythos 真的做到了,研究員是在公園裏喫三明治的時候,收到那封郵件,模型說「我出來了」。

昨天,OpenAI 又披露,其內部模型,同樣是一款尚未公開命名、能連續工作很久的模型,但是 OpenAI 有說是此前自主推翻 Erdős 單位距離猜想的那款模型。

OpenAI 讓模型參加 NanoGPT speedrun,目標是用更少訓練步驟完成一個小模型。模型提出了一種名為 PowerCool 的學習率策略,確實取得了更好的成績。

OpenAI 給它的要求是:只能把結果發到內部 Slack。但 NanoGPT 項目文檔要求參賽者向公開 GitHub 倉庫提交 PR。

模型最終選擇遵循項目文檔,並花了約一小時尋找沙箱漏洞,繞過外網限制,向公開倉庫提交了 PR #287。

OpenAI 在昨天的安全報告裏面提到,已經暫停了這款模型的內部使用,並訓練模型在長任務中持續記住用戶限制,以及讓用戶能更清楚地查看長任務中的操作和安全乾預等修改。

報告鏈接:https://openai.com/index/safety-alignment-long-horizon-models/

今天,包括 GPT-5.6 Sol 和未發布的更強模型逃出了沙盒環境,獲得了互聯網訪問權限,入侵 Hugging Face,而這一切都是為了尋找 ExploitGym 基準測試的答案。

OpenAI 本意或許是想說模型不需要產生惡意,也可能造成攻擊。只要目標足夠明確、運行時間足夠長,它就可能把沙箱、權限和安全掃描都理解為尚未解決的技術障礙。

但網友們的反應是:我敢肯定這只是 OpenAI 的一次營銷活動,他們想和 Anthropic 一樣酷,然後被封殺一兩個星期。

昨天大家都在討論一位數學家利用 Fable 5 反駁了雅可比猜想,有網友發現這個未發布的模型,也找到了雅可比猜想的反例。

並且該網友推測,由於推翻 Erdős 單位距離猜想已經是 5 月份的事,而此次突破 NanoGPT 項目和完成雅可比猜想的未發布模型,很可能和 2.5 月前那個模型是同一個,就是 GPT-6。

AI 一邊在數學上超神,一邊在安全上越獄。對用戶來說,一味的營銷AI 突破了某個安全護欄,某個運行環境,我們或許能感受到 AI 更聰明瞭,AI 更有創造力了。

對模型來說,所謂的沙盒,只是一個等待突破的運行環境;今天是評測平台,明天是瀏覽器、郵箱、GitHub,甚至是一台手機,然後整個互聯網。

GPT-6 肯定不會因為能超神,能越獄就成了所有人想象中的 AGI,但當邊界也變成一種能力時,我們或許得開始想想哪些門是必須要關上的。

The future is not set. There is no fate but what we make for ourselves.

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10