大模型蒸餾時代結束!Fable 5.1改寫API,徹底切斷蒸餾後路

新智元
09/05

轟轟烈烈的大蒸餾時代,要結束了!

就在9月2日,Anthropic一記重拳,直接改寫了API規則,徹底切斷了套殼大模型和蒸餾者的後路。

曾經,無數公司為了省去巨大的算力成本和漫長的訓練時間,選擇通過API套取頭部頂尖模型的推理過程,然後用這些數據來訓練自己的「小模型」。

但今天以後,這種可能性,不復存在了。

Claude Fable 5.1 封殺「思考塊」篡改

Anthropic這次發布的Fable 5.1,推出了堪稱史上最嚴反蒸餾機制。

核心動作,就是死死鎖住「思考塊」。

什麼是「思考塊」?

簡單來說,就是AI在給你最終答案之前,腦子裏進行的CoT過程。

Claude 進行心算時思維過程中複雜、並行的路徑

在API調用中,Claude會將這些推理步驟以「思考塊」的形式返回給用戶。

在正常的多輪對話中,開發者會把這些思考塊連同系統提示詞、工具和歷史消息一起再發回給Claude,以便讓模型記住上下文,保持對話的連貫性。

但偏偏就是這個機制,成了蒸餾者們的機會。

他們發現了一個巨大的漏洞:只要在多輪對話中,偷偷修改思考塊前後的上下文(比如篡改早期的系統提示或歷史消息),就能打破Claude的防禦機制,甚至能誘導Claude吐出它原本隱藏的底層推理邏輯!

針對這一亂象,Anthropic在Fable 5.1中毫不留情地推出「上下文一致性驗證」的新規。

1.原路返回,一字不差:API現在將嚴格驗證客戶端發回來的「思考塊」,是否與當初產生它的系統提示、工具和歷史消息完全一致。

2.動了手腳?直接報錯!只要系統發現上下文被修改,哪怕一點點都會匹配失敗,API將直接返回錯誤提示,拒絕服務。

而且,為了照顧到那些確實需要修改上下文的合法開發者(比如需要壓縮上下文長度來省錢),Anthropic提供了一個「非嚴格模式」。

在這個模式下,你的請求可以通過,但是,系統會直接把「思考塊」全部刪除! 模型將在完全看不到之前推理過程的情況下,強行作答。

這一招,可謂是釜底抽薪。

當 Claude 被問及一個較簡單與一個較困難的問題時,忠實推理與動機性(不忠實)推理的例子

工業級蒸餾,到底有多瘋狂?

Anthropic至於發這麼大火,搞出這麼嚴格的限制嗎?

答案是:至於,而且極其必要。

因為目前的非法蒸餾,已經演變成了工業級規模。

在過去的一年裏,Anthropic的安全團隊觀測到了令人觸目驚心的濫用現象。

這些專業的「蒸餾黑客」們並不是用一個賬號每天問幾個問題,而是使用數以千計的虛假賬戶,通過自動化的腳本,夜以繼日地在API端瘋狂「薅羊毛」。

他們的操作手法極具隱蔽性和攻擊性。

上文說過,雖然Anthropic早就對Claude的核心思考塊進行了加密,但黑客們使用了「上下文注入」和「對話重寫」的技術。

這種做法就像是給Claude進行「催眠」,讓它在邏輯錯亂中,主動把自己加密的推理過程給解密、打印出來。

因此,很多小參數模型,並沒有經歷從零開始的算力堆疊和算法創新,只是背下了頂尖AI的答題思路,就做到了性能比肩。

更可怕的是,這種做法直接觸及了紅線,導致安全保障的崩塌。

AI失控的最大隱患

如果說商業利益的損失只是讓Anthropic「肉痛」,那麼「能力與安全的脫鉤」,則讓整個AI安全界感到恐懼。

這也是Anthropic決定痛下殺手的核心動機。

衆所周知,像Claude、GPT-4這樣的大模型,在擁有極高智商的同時,也接受了極其嚴苛的「價值觀對齊」和安全訓練。它們知道不能教人制造炸彈,不能編寫惡意勒索軟件,不能發表仇恨言論。

這種「能力+ 安全護欄」的雙重綁定,是大型AI公司耗費上千萬美元進行RLHF和紅藍對抗才建立起來的。

但是,蒸餾模型完美地避開了這道安全網!

當蒸餾者通過修改上下文,強行套取Claude的「思考塊」時,他們只提取了那部分高智商的「推理能力」,卻根本無法繼承底層的安全保障。

就像一個邪惡組織,克隆了愛因斯坦的智商,卻沒有克隆愛因斯坦的道德感和同理心。

用這種非法蒸餾手段訓練出來的系統,會莫名其妙地繼承它們原本不該擁有的高級邏輯和代碼能力。

但由於它們本身是一個「低保障、弱護欄」的底層模型,它們會毫不猶豫地響應黑客的請求,去生成網絡攻擊腳本,或者協助進行生物武器的研發。

「能力和安全的脫鉤,是當今AI最大的風險。」

新規落地:誰受影響?

這次打擊,會影響到正經開發者嗎?

不用怕,Anthropic採取了精準的「分階段執行」策略,力求將誤傷降到最低。

首當其衝的,是「新賬戶」。

根據官方文件,此次限制率先從濫用最集中的新賬戶切入。針對 Fable 5.1 模型,該更新僅適用於在 2026年8月31日 12:00:00 AM UTC 之後創建的新 API 賬戶。

以下人群,可以徹底放心,你們完全不受影響。

1.現有 API 賬戶:現有的老賬戶在 Fable 5.1 上暫不受影響。這給了合法開發者充足的時間去調整。

2.消費端普通用戶:如果你只是在使用網頁版的 Claude.ai,或者是 Claude Code、Claude Cowork 等官方產品的C端用戶,或者通過第三方套殼產品正常聊天,你不會受到任何干擾。

對於受到影響的 API 開發者,你需要注意什麼?

如果你之前的應用集成中,恰好用到了「在對話中途重寫早期輪次」的技術(比如為了省錢而做的上下文壓縮,或者在對話中途強行注入新的系統提醒),你需要立刻開始調整你的代碼邏輯了。

為了應對這一變化,Anthropic提供了完善的遷移指南。開發者有兩個選擇。

選擇一:保持上下文的絕對一致。把原來的思考塊、系統提示和工具一字不差地傳回去。

選擇二:在API請求中選擇加入「非嚴格模式」 。在這個模式下,即便你修改了上下文,API也不會報錯中止,而是會自動且靜默地刪除請求中的受影響的思考塊。

雖然這會讓模型在接下來的對話中「忘掉」之前的具體推理過程,但至少能保證你的對話或任務不被中斷。

需要提醒的是:雖然目前該規定存在豁免期,但 Anthropic 已經明確表態——「保留思考」機制將在未來的模型版本中適用於所有賬戶!

現有的緩衝窗口期,也是有限的。

意外之喜:造福老實人

並且,這次新規之後,還隱藏着一個對於合法開發者的好處——成本的大幅降低和響應速度的飛躍。

這是怎麼做到的?

核心就在於「上下文一致性」。

在過去,因為開發者可以隨意修改上下文,導致模型每次接收到的請求都是「全新」的。這不僅耗費算力,而且速度極慢。

現在,新規強迫所有人必須保持「思考塊」及其周圍的系統提示、歷史消息完全一致,不得篡改。

這在技術上創造了一個完美的條件:提示詞緩存可以實現極高頻率的命中!

現在,API服務器可以輕鬆地將之前的對話上下文直接緩存下來。當下一輪對話請求到來時,系統直接從緩存中調取數據,瞬間完成匹配。

其結果就是:API的響應時間大幅縮短,延遲直線下降,同時開發者的API調用成本也會顯著降低!

這一招「無心插柳」,可以說是真金白銀地補貼了老老實實的開發者。

總之,這次新規,對於整個AI行業來說,無疑是一個分水嶺。

小參數錘爆大模型的故事,或許會少很多。

退潮之後,是誰在裸泳?

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10