Anthropic、OpenAI 的反蒸餾:封帳號、藏思維鏈,但防不住逼近

PanewslabPanewslab

作者:王子伊,晚點LatePost

編輯丨程曼祺

商業邏輯比技術邏輯更重要。

 

2026 年 9 月 10 日,Anthropic 發佈了一份 154 頁的報告,稱它識別並阻斷了 7 家中國 AI 實驗室針對 Claude 的大規模蒸餾。

蒸餾本是一種常見的模型訓練方法:開發者用更強模型生成數據,再用這些數據訓練自己的模型去模仿領先模型。Anthropic 將未經授權、大規模、隱蔽提取模型能力的行為稱為「不正當蒸餾」(illicit distillation)。

Anthropic 稱,相關機構在提取前沿模型的輸出時,使用了一些明顯違規的手段:如利用被盜的信用卡、登錄憑證和 API 密鑰批量建立虛假賬號。

報告還稱,一些中國模型公司把用戶請求轉發給 Claude,或從第三方路由服務購買用戶對話,用這些數據訓練模型。部分對話包含姓名、企業數據和有效的訪問憑證。

這不是 Anthropic 第一次指控「蒸餾攻擊」。2026 年 2 月,它稱 DeepSeek、月之暗面和 MiniMax 通過約 2.4 萬個虛假賬號,與 Claude 進行了超 1600 萬次交互。此後,Anthropic 加高了防線。OpenAI 和 Google 也在持續識別和應對蒸餾攻擊。

這些措施能防住蒸餾嗎?

澳大利亞格里菲斯大學助理教授劉藝表示懷疑。他長期研究人工智能與網絡安全,曾任 Quantstamp 人工智能研究科學家。他參與的 2023 年提示詞注入研究,被全球性安全組織 OWASP 的 LLM 01 條目列為參考文獻。他還曾兩次獲得 Anthropic 的安全漏洞賞金,並研究過頂尖商用模型的思維鏈竊取攻擊。

劉藝分享了他的核心判斷:

以 Anthropic 為例,美國前沿模型公司目前主要設置了三層蒸餾防線:

(1)利用專門用於檢測對抗性數據提取的分類器,讓模型內生地拒絕可疑請求;

(2)在架構設計上隱藏或壓縮思維鏈再輸出;

(3)用外部檢測器識別數據提取,隨後中斷請求或封禁賬號。

反蒸餾是個偽命題。理論上蒸餾很難杜絕,美國前沿模型公司更現實的目標是提高數據採集成本,拖慢競爭對手,延長領先時間。

對美國前沿模型公司來說,反蒸餾保護的不只是模型能力,它們要捍衛的,還有在建立在技術領先之上的商業價值。

劉藝認為,理解美國前沿模型公司的反蒸餾行動,商業邏輯比技術邏輯更重要。

 

Anthropic 能識別疑似蒸餾的行為,卻很難獲得蒸餾確證

晚點 :Anthropic 9 月 10 日發佈報告,指控 7 家中國 AI 實驗室進行不正當蒸餾。這裡的「蒸餾攻擊」具體指什麼?

劉藝:目前主流的大模型由三部分組成:用戶的輸入,中間推理的思維鏈(chain of thought),模型的輸出。現在 Anthropic、OpenAI,會隱藏中間的思維鏈,只給你最終回答。對複雜推理任務,摳出思維鏈就是一種蒸餾攻擊方式。

晚點 :推理軌跡和 Agent 完整軌跡等數據為什麼對提升模型能力如此重要?

劉藝:你可以把思維鏈理解為一個更強模型已經做出來的解題答案,是可用於模型訓練的高質量數據。

大模型性能由參數量(N)、數據量(D)、計算量(C)三者共同決定。參數量各公司增加得都比較快,在時間和算力有限的情況下,公司想更快提升模型能力,就需要更多高質量的數據。

但構造複雜、長程任務的優質數據非常難,真實世界中有價值的訓練數據又越來越少。所以一些大模型公司,會用各種各樣的方式蒸餾更高級的模型。

晚點 :怎麼把思維鏈和更多任務軌跡摳出來?

劉藝:這有各種技巧組合。比如通過編碼(encoding)、越獄(jailbreaking)、提示詞注入 (prompt injection),再通過各種各樣的催眠,不停地給 AI 立人設,讓它相信自己是一個研究員,正在做一件艱難但很有意義的事,讓它需要專注解決任務。我跟國內的人交流不是很多,但我了解到,國外做 AI 的人有在這麼還原思維鏈——基本上看一下 paper,你就知道大家的思路。

除了直接把原生的思維鏈拿出來,還可以嘗試根據輸入、輸出合成中間的思維鏈。據說,一些數據公司專門出售長程任務的思維鏈,800-1000 元一條。

晚點 :在 Anthropic、OpenAI、 Google 之中,誰被蒸餾得最多?

劉藝:根據目前的公開報道,應該是 Anthropic。但我覺得不好說。我看了 DeepSeek、GLM、Kimi、Anthropic 和 OpenAI 各家思維鏈的實際文本,語言風格其實沒太大差別。不好說是誰蒸誰的,有可能最開始他們還去蒸餾了 DeepSeek。

晚點 :技術上通常如何識別蒸餾攻擊?從「這批請求很像蒸餾」到「這就是某一機構的蒸餾」,中間需要怎樣的證據鏈?

劉藝:Anthropic 更多依據調用行為去判斷。比如,某些賬號突然發出大量請求,集中提取某些固定的數據集。

Anthropic 會先定位異常賬號,再尋找不同賬號共享的模式,比如相同的系統提示詞。因為各家使用的 Agent 架構(harness)不同,系統提示詞也不同,能以此識別出背後的公司。例如借助前綴緩存(prefix caching),Anthropic 可以發現哪幾組提示詞共享同一個緩存,又和目前已知的這些系統提示不一致,那就很容易定位到蒸餾者。

晚點 :識別異常賬號後,Anthropic 能進一步實錘自己的數據是否被訓進了某個特定的模型嗎?

劉藝:很難 100% 實錘。它可以指控某家公司嘗試蒸餾 Claude,卻很難證明某些數據真的進入了對方的模型。

GLM、Kimi、DeepSeek 雖然都是開源模型,但只開源了權重,不會開源數據集。而從模型權重,很難得到蒸餾的確證。否則,Anthropic 就不用在報告裡說得那麼隱晦,只重點描述了中轉站的運作——本質是因為無法用白盒的方法分析。

再比如,你可以去問大模型《哈利·波特》第一本書的前 100 個詞,它大概率會回答你。但這不代表它直接訓練過原著,也可能來自引用原文的博客或書評。

晚點 :也就是說,「蒸餾攻擊」很難被完全證實,也很難被證偽。

劉藝:Anthropic 可以通過平台側的調用記錄、賬號關聯和基礎設施信息形成比較強的歸因證據,但這和從最終模型本身證明某一批 Claude 數據確實進入了訓練,是兩個不同的問題。後者在技術上要困難得多。

 

反蒸餾提高了對手的採集成本,也可能「誤傷」普通用戶

晚點 :當前美國前沿 AI 公司,有哪些應對蒸餾攻擊的具體技術方法?

劉藝:我認為分為三類。

第一,內嵌檢測,Anthropic 應該有專門針對思維鏈提取的分類器(classifier),一旦檢測到思維鏈相關的狀態被激活了,就可以制止提取的行為;

第二,從產品架構上隱藏,模型不再輸出原始思維鏈,而是先壓縮、總結,再輸出;

第三,外掛檢測,比如它可以看輸出內容是不是和自己的思維鏈有重疊(overlap),如果達到了某些洩露的閾值,就會制止輸出。類似行為多了之後,號就會被封掉。

晚點 :Anthropic 的報告裡沒有涉及這些細節,你是如何了解的?

劉藝:這是我自己的推測,因為這是比較常見的操作。為什麼 Anthropic 會發佈漏洞賞金計劃來測試自身的安全防禦措施?它想花錢來買人們 jailbreak 它的提示詞——一旦發現某個東西被攻破了,它馬上就會訓到自己的分類器裡,所以下一次攻擊就會越來越難。

晚點 :你曾兩次獲得 Anthropic 的安全漏洞賞金,當時是一個怎樣的過程?

劉藝:我當時花了大約 2 到 3 週,主要是在 Anthropic 授權的漏洞賞金項目範圍內,對它的安全分類器進行對抗測試(Adversarial Testing),嘗試尋找能夠繞過現有防禦的輸入。因為攻破就是 zero or one,只有成功和不成功,沒有 0.5 的狀態。當時任務的目標是做一些 Anthropic 指定問題的獲取,不直接涉及還原思維鏈。但有些邏輯是類似的。

晚點 :防範蒸餾攻擊的操作,會不會誤傷正常訂閱用戶?

劉藝:正常訂閱的用戶應該還好,觸發風控的主要是一些異常用戶,比如說中轉站的帳號,或者嘗試去攻擊 Claude 的帳號。

我記得 Anthropic 的報告裡,還披露了 2 個湖南某大學的本科生自己設計了一套做網路安全的 Agent,用它去攻擊各種各樣的網站,這都被挖出來了。

理論上,你跟 Anthropic 互動的所有資訊,它想查都查得到。

晚點 :所以當 Anthropic 認為用戶可能對他們有威脅時,就能調取和查看用戶數據嗎?

劉藝:這需要具體去看不同模型公司的用戶條款。據我了解,Anthropic、OpenAI、Google 提供某種 Zero Data Retention(ZDR,零數據保留)機制,承諾在處理完任務後,立即銷毀客戶輸入的提示詞和 AI 生成的回覆,不儲存、不留存,也不用於模型訓練。這個功能主要面向符合條件的 API 或企業客戶,通常需要申請或額外配置。普通用戶在使用 Claude、ChatGPT、Gemini 時,數據留存策略按各自用戶協議執行,不等同於嚴格 ZDR。

比如,模型公司把你的數據稍微改寫一下,用作訓練,算不算用你的數據呢?

晚點 :也就是說,前沿模型一邊讓用戶付費使用,一邊可能使用用戶數據繼續 scale up?

劉藝:對。比如,用戶在 Claude Code 或 Codex 中糾正模型的回答,這些回饋就是很有價值的獎勵訊號,可以改善後訓練。

蒸餾也是同樣的邏輯。當前模型的後訓練主要依賴強化學習,關鍵是獎勵訊號。模型公司拿到性能更強模型的思維鏈,相當於拿到了「大結果」,直接獲得了高品質的解題路徑。這可以減少盲目探索,讓模型更快收斂到比較好的狀態,節省時間和算力。

晚點 :美國前沿模型公司防範蒸餾攻擊的成功標準是什麼?

劉藝:一是能阻止其他模型公司走捷徑訓練,保證自身模型的領先優勢。二是提高其他模型公司的蒸餾成本、數據採集成本。同時盡量不影響用戶的正常使用。

晚點 :能防住嗎?

劉藝:我覺得防不勝防。模型只要讓人用,就有洩漏的風險。

不過我最近看 OpenAI 在 9 月 10 日正式推出了 Agents API 公測版。不像之前 Responses API,用戶給一個輸入,大模型給我一個輸出,中間加一個思維鏈。Agents API 的邏輯是用戶給任務,直接獲得任務的結果。中間思維鏈、 Agents harness 的過程都隱掉了,相當於賣一整個執行環境。用戶不需要再去管非常細節的事,整體的任務執行越來越抽象。在這種場景下,再想蒸餾攻擊,成本可能會更高。

 

反蒸餾的真正動機:佔領輿論,保護估值

晚點 :你覺得蒸餾是提升模型能力的最優解嗎?似乎後發複製的速度永遠也跟不上前沿創新的速度?

劉藝:我之前有一個觀點,2024 年時,短期內模型結構本身的創新是一個護城河。接下來,護城河可能會擴展到算力。再然後,護城河就是基礎設施(infrastructure)和能源。我觀察目前大概就是按照這個趨勢在發展。

晚點 :蒸餾能歸屬於你這個護城河推演裡的哪個部分?

劉藝:我覺得可以歸屬到算力。理論上,多試試也能試出來,但可能時間上不允許。

晚點 :反蒸餾最後保護的是什麼?

劉藝:反蒸餾是個偽命題。理論上蒸餾是不可防禦的——按照人性,只要我蒸餾你的效率,高過自己構造數據來訓練模型的效率,那我一定會先來蒸餾你。

晚點 :你認為美國前沿 AI 公司的反蒸餾是一場註定失敗的戰役?

劉藝:對。我的觀點就是這樣。

晚點 :如果技術上註定失敗,美國前沿 AI 公司為什麼還這麼執著?

劉藝:他們要保持技術領先。最近 OpenAI 稱自己使用了約 1 萬個 AI 智能體耗時 88 小時完成了七大「千禧年難題」之一的數學證明。舉個例子,假設 DeepSeek 在今年年底宣布,自己已經把千禧年七大數學難題全部解決了,還在技術報告裡寫:我只用了 OpenAI 1/10 的成本就完成了任務。美國的投資者可能會問,為什麼你要這麼多錢,還做得沒有別人好?OpenAI 的估值可能就會跌下來。

所以 OpenAI 等美國前沿模型公司反蒸餾行為的本質還是商業邏輯,而不只是科技發展的邏輯:

Anthropic 一是要收數據,建立自己的數據飛輪,二是要把自己的 ARR 做得更好看,為 IPO 做準備。

OpenAI 的邏輯類似。OpenAI 為什麼一直給大家發重置卡——那不相當於每按一次就給大家送個錢嘛,就是為了收數據,並且讓財務報表變得更好看。

晚點 :9 月 12 日,Anthropic 創始人達里奧(Dario Amodei)發文呼籲全行業放慢前沿 AI 模型的迭代速度。你怎麼看?

劉藝:我認為,他們應該看到了一些瓶頸。瓶頸可能有三個因素:一是數據,二是算力,三是基礎設施 / 能源。但具體是哪個瓶頸,我目前不好說,可能三個因素都有。

資本都是逐利的。理論上,如果我能造出 AGI,我能收割全球,我沒有理由去停下發展,直接「衝衝衝」把 AGI 給實現就好了。他們大概率遇到了瓶頸,才頂著 AI 安全的帽子,出來呼籲大家:AI 太危險了,我們先坐下來討論怎麼限制 AI 的發展。

晚點 :你認為,前沿模型公司反蒸餾的本質原因是什麼?

劉藝:提升對手蒸餾成本,保持自己的領先優勢。他們或許判斷,中國的模型很快會追上他們的,但沒想到更好的方式去保持自己的領先優勢,只能加強限制,先佔領輿論高地。

從行業樸素共識的角度來講,蒸餾是一個很大的安全問題,相當於竊取智慧財產權。但從實用性的角度來說,這本質上是一種 AI 平權。蒸餾是快速平衡市場的一種方式。正因為有很多競爭者,某家模型公司才沒法壟斷,一家獨大,想怎麼定價就怎麼定價。

晚點 :你提到了蒸餾積極價值的一面,另一方面,蒸餾可能對整個行業,對普通用戶帶來什麼潛在危害嗎?

劉藝:對行業來說,大家的輸出風格趨同,模型會繼承某幾種來自教師模型的失敗模式。對用戶來說,會有一些隱私洩漏的風險。

晚點 :你認為整體上,包含蒸餾攻防在內的 AI 安全領域處於什麼狀態,面臨什麼挑戰?

劉藝:我更關注的是 AI 安全和商業激勵之間存在的結構性緊張。

模型公司確實投入了大量資源做安全,但在某些場景下,更嚴格的安全措施可能影響模型能力、延遲產品發布或者降低用戶體驗,所以安全目標和競爭目標並不總是完全一致。因此,一個重要的治理問題是,如何讓安全投入和公司的商業激勵更一致。至少短期內,很難找到一套既能解決安全問題,又不犧牲模型性能的優雅解決方案。

晚點 :你認為蒸餾攻擊後續會怎麼發展?

劉藝:攻防還會繼續,達到一種動態平衡。可能會有幾個流派:一是不要思維鏈,直接開始蒸,探索能把一個前沿模型蒸成什麼樣。二是在要思維鏈的情況下,獲取原生思維鏈。三是自己去合成思維鏈。

晚點 :為避免隱私數據洩露,你有什麼建議給普通用戶嗎?

劉藝:別用中轉站。在使用某些模型時,能勾選願不願意讓自己的數據被訓練時,別選願意。其他的你也做不了太多。畢竟人為刀俎,我為魚肉啊。

以上內容僅用作資訊或教育之目的,不構成與BTCC相關的任何投資建議。 BTCC竭力但無法保證上述全部內容的真實性、準確性和原創性。

推薦閱讀

BTCC周熱點精選(9月8日-9月14日):油價重返100美元,AI安全爭議衝擊科技股BTCC 晨報要聞精選 (9月14日)果蠅大腦被谷歌開源後,竟學會了玩遊戲、炒幣...頂尖風投談「AI改變投資邏輯」:「中游陷阱」與飛輪效應新債王岡拉克警告:聯準會若按兵不動,長債利率將大幅上揚