AnthropicとOpenAIの逆蒸留対策:アカウント停止と思考連鎖の隠蔽、しかし接近は防げず

PanewslabPanewslab

著者:王子伊、晩点 LatePost

編集:程曼祺

ビジネスロジックは技術ロジックよりも重要である。

2026年9月10日、Anthropicは154ページの報告書を発表し、Claudeに対する大規模な蒸留を行っていた中国のAI研究所7社を特定し、阻止したと述べた。

蒸留は本来、一般的なモデル訓練手法である。開発者はより強力なモデルでデータを生成し、そのデータを使って自社モデルを訓練し、先行モデルを模倣する。Anthropicは、許可なく大規模かつ隠蔽的にモデル能力を抽出する行為を「不正蒸留」(illicit distillation)と呼んでいる。

Anthropicによると、関連機関は最先端モデルの出力を抽出する際、盗難クレジットカード、ログイン認証情報、APIキーを使って大量の偽アカウントを大量に作成するなど、明らかに規約違反の手段を用いていた。

報告書はまた、一部の中国モデル企業がユーザーのリクエストをClaudeに転送したり、第三者ルーティングサービスからユーザー会話を購入したりして、そのデータでモデルを訓練していたと述べている。一部の会話には氏名、企業データ、有効なアクセス認証情報が含まれていた。

Anthropicが「蒸留攻撃」を非難したのはこれが初めてではない。2026年2月、同社はDeepSeek、Moonshot AI、MiniMaxが約2万4000の偽アカウントを通じてClaudeと1600万回以上のやり取りを行ったと発表した。その後、Anthropicは防御を強化した。OpenAIとGoogleも蒸留攻撃の特定と対処を続けている。

こうした対策で蒸留を防げるのだろうか。

オーストラリアのグリフィス大学の劉藝助教は懐疑的だ。彼は人工知能とサイバーセキュリティを長年研究し、QuantstampのAI研究科学者を務めた経験がある。彼が参加した2023年のプロンプトインジェクション研究は、世界的なセキュリティ組織OWASPのLLM 01項目で参考文献として挙げられている。また、Anthropicのセキュリティ脆弱性報奨金を2度獲得し、トップ商用モデルの思考連鎖窃取攻撃を研究したこともある。

劉藝氏は核心的な判断を共有した。

Anthropicを例にとると、米国の最先端モデル企業は現在、主に3層の蒸留防御を設けている。

(1)敵対的データ抽出の検出に特化した分類器を用いて、モデルが内生的に不審なリクエストを拒否するようにする。

(2)アーキテクチャ設計上、思考連鎖を隠蔽または圧縮してから出力する。

(3)外部検出器でデータ抽出を識別し、その後リクエストを中断するかアカウントを停止する。

逆蒸留は偽命題である。理論上、蒸留を完全に根絶するのは難しく、米国の最先端モデル企業のより現実的な目標は、データ収集コストを引き上げ、競合他社を遅らせ、リード期間を延ばすことだ。

米国の最先端モデル企業にとって、逆蒸留が守るのはモデル能力だけではない。技術的優位性の上に築かれた商業的価値も守ろうとしている。

劉藝氏は、米国の最先端モデル企業の逆蒸留行動を理解するには、技術ロジックよりもビジネスロジックが重要だと考えている。

Anthropicは蒸留の疑いのある行為を特定できるが、蒸留の確証を得るのは難しい

晩点:Anthropicは9月10日に報告書を発表し、中国のAI研究所7社による不正蒸留を非難しました。ここでいう「蒸留攻撃」とは具体的に何を指すのでしょうか。

劉藝:現在の主流の大規模モデルは、ユーザーの入力、中間推論の思考連鎖(chain of thought)、モデルの出力の3つの部分で構成されています。現在、AnthropicやOpenAIは中間の思考連鎖を隠し、最終的な回答だけを返します。複雑な推論タスクでは、思考連鎖を抜き出すことが蒸留攻撃の一種になります。

晩点:推論軌跡やエージェントの完全な軌跡などのデータが、モデル能力の向上にそれほど重要なのはなぜですか。

劉藝:思考連鎖は、より強力なモデルがすでに解いた解答であり、モデル訓練に使える高品質なデータだと理解できます。

大規模モデルの性能は、パラメータ数(N)、データ量(D)、計算量(C)の3つで決まります。パラメータ数は各社とも急速に増やしていますが、時間と計算資源が限られている中で、モデル能力をより早く向上させるには、より多くの高品質なデータが必要です。

しかし、複雑で長距離のタスクの良質なデータを構築するのは非常に難しく、現実世界で価値のある訓練データはますます少なくなっています。そのため、一部の大規模モデル企業は、さまざまな方法でより高度なモデルを蒸留しようとします。

晩点:思考連鎖やより多くのタスク軌跡をどうやって抜き出すのですか。

劉藝:さまざまなテクニックの組み合わせがあります。例えば、エンコーディング、ジェイルブレイク、プロンプトインジェクションを使い、さらにさまざまな誘導でAIに人格を設定し、自分は研究者であり、困難だが意義のある仕事をしていると信じ込ませ、タスク解決に集中させるのです。国内の人々との交流はあまり多くありませんが、海外のAI関係者がこのように思考連鎖を復元していることは知っています。論文を見れば、皆の考え方はだいたいわかります。

ネイティブな思考連鎖を直接取り出す以外に、入力と出力から中間の思考連鎖を合成する方法もあります。一部のデータ企業は長距離タスクの思考連鎖を専門に販売しており、1件800~1000人民元だと言われています。

晩点:Anthropic、OpenAI、Googleの中で、最も蒸留されているのはどこですか。

劉藝:現在の公開報道によると、おそらくAnthropicでしょう。しかし、はっきりとは言えません。DeepSeek、GLM、Kimi、Anthropic、OpenAIの各思考連鎖の実際のテキストを見ましたが、言語スタイルに大きな違いはありません。誰が誰を蒸留したのかははっきりとは言えず、最初は中国のAI企業もDeepSeekを蒸留していた可能性もあります。

晩点:技術的には通常、蒸留攻撃をどのように特定するのですか。「このリクエスト群は蒸留に似ている」から「これは特定の機関による蒸留だ」まで、どのような証拠の連鎖が必要ですか。

劉藝:Anthropicは主に呼び出し行動に基づいて判断しています。例えば、特定のアカウントが突然大量のリクエストを送信し、特定の固定データセットを集中的に抽出する場合です。

Anthropicはまず異常なアカウントを特定し、次に異なるアカウント間で共有されるパターンを探します。例えば、同じシステムプロンプトです。各社が使用するエージェントアーキテクチャ(harness)が異なるため、システムプロンプトも異なり、それによって背後にいる企業を特定できます。例えば、プレフィックスキャッシュ(prefix caching)を利用することで、Anthropicはどのプロンプト群が同じキャッシュを共有しているか、またそれが現在知られているシステムプロンプトと一致しないかを発見でき、蒸留者を容易に特定できます。

晩点:異常なアカウントを特定した後、Anthropicは自社のデータが特定のモデルに実際に訓練されたことをさらに確証できますか。

劉藝:100%確証するのは難しいです。ある企業がClaudeを蒸留しようとしたと非難することはできても、特定のデータが実際に相手のモデルに入ったことを証明するのは困難です。

GLM、Kimi、DeepSeekはオープンソースモデルですが、重みのみを公開しており、データセットは公開していません。モデルの重みから蒸留の確証を得るのは非常に難しいのです。そうでなければ、Anthropicは報告書でそこまで遠回しに書かず、中継サーバーの運用だけを重点的に説明する必要はなかったでしょう。本質的には、ホワイトボックス方式で分析できないからです。

別の例として、大規模言語モデルに『ハリー・ポッター』第1巻の最初の100語を尋ねると、おそらく答えてくれます。しかし、それは原作を直接訓練したことを意味するわけではなく、原文を引用したブログや書評から来ている可能性もあります。

晩点:つまり、「蒸留攻撃」は完全に証明することも、完全に反証することも難しいということですね。

劉藝:Anthropicはプラットフォーム側の呼び出し記録、アカウントの関連性、インフラ情報からかなり強力な帰属証拠を形成できますが、それは最終モデル自体からあるまとまりのClaudeデータが実際に訓練に入ったことを証明するのとは別の問題です。後者は技術的にはるかに困難です。

逆蒸留は競合他社の収集コストを引き上げるが、一般ユーザーを「誤って傷つける」可能性もある

晩点:現在、米国の最先端AI企業には、蒸留攻撃に対処する具体的な技術的手法がどのようなものがありますか。

劉藝:3つのカテゴリーに分けられると思います。

第一に、組み込み検出です。Anthropicには思考連鎖抽出に特化した分類器(classifier)があるはずで、思考連鎖に関連する状態が活性化されたことを検出すると、抽出行為を阻止できます。

第二に、製品アーキテクチャ上での隠蔽です。モデルは生の思考連鎖を出力せず、まず圧縮・要約してから出力します。

第三に、外部プラグインによる検出です。例えば、出力内容が自社の思考連鎖と重複(overlap)していないかを確認し、特定の漏洩閾値に達した場合は出力を阻止します。同様の行為が増えると、アカウントは停止されます。

晩点:Anthropicの報告書にはこうした詳細は含まれていませんが、どのように知ったのですか。

劉藝:これは私自身の推測です。よくある操作だからです。Anthropicがなぜバグ報奨金プログラムを発表して自社のセキュリティ防御をテストするのでしょうか。人々がプロンプトをジェイルブレイクするのにお金を払いたいのです。何かが突破されたことを発見すると、すぐに自社の分類器に学習させるので、次の攻撃はますます難しくなります。

晩点:あなたはAnthropicのセキュリティ脆弱性報奨金を2度獲得したそうですが、当時はどのようなプロセスでしたか。

劉藝:当時は約2~3週間かけて、主にAnthropicが認可した脆弱性報奨金プログラムの範囲内で、同社のセキュリティ分類器に対して敵対的テスト(Adversarial Testing)を行い、既存の防御を回避できる入力を探しました。突破は0か1かであり、成功か不成功しかなく、中間の状態はありません。当時のタスクの目標は、Anthropicが指定した問題の取得を行うことで、思考連鎖の復元には直接関わっていませんでした。しかし、一部のロジックは似ています。

晩点:蒸留攻撃を防ぐ操作は、通常のサブスクリプションユーザーを誤って傷つけることはありませんか。

劉藝:通常のサブスクリプションユーザーはおそらく大丈夫です。リスク管理が発動するのは主に異常なユーザー、例えば中継サーバーのアカウントや、Claudeを攻撃しようとするアカウントです。

Anthropicの報告書では、湖南省の某大学の学部生2人が独自にネットワークセキュリティ用のエージェントを設計し、それを使ってさまざまなウェブサイトを攻撃していたことも開示されていたと記憶しています。それもすべて特定されました。

理論上、あなたがAnthropicとやり取りするすべての情報は、同社が調べようと思えば調べられます。

晩点:つまり、Anthropicがユーザーを脅威とみなした場合、ユーザーデータを取得・閲覧できるということですか。

劉藝:これは各モデル企業のユーザー条項を具体的に確認する必要があります。私の知る限り、Anthropic、OpenAI、Googleはある種のZero Data Retention(ZDR、ゼロデータ保持)メカニズムを提供しており、タスク処理完了後、顧客が入力したプロンプトとAIが生成した返信を直ちに破棄し、保存・保持せず、モデル訓練にも使用しないと約束しています。この機能は主に条件を満たすAPIまたはエンタープライズ顧客向けで、通常は申請または追加設定が必要です。一般ユーザーがClaude、ChatGPT、Geminiを使用する場合、データ保持ポリシーは各ユーザー契約に従って実行され、厳格なZDRと同等ではありません。

例えば、モデル企業があなたのデータを少し改変して訓練に使用した場合、それはあなたのデータを使用したことになるのでしょうか。

晩点:つまり、最先端モデルはユーザーに料金を支払わせて利用させる一方で、ユーザーデータを使ってさらにスケールアップしている可能性があるということですか。

劉藝:そうです。例えば、ユーザーがClaude CodeやCodexでモデルの回答を修正すると、そのフィードバックは非常に価値のある報酬信号となり、ポストトレーニングの改善に役立ちます。

蒸留も同じロジックです。現在のモデルのポストトレーニングは主に強化学習に依存しており、鍵となるのは報酬信号です。モデル企業がより高性能なモデルの思考連鎖を入手することは、「大きな成果」を手に入れることに相当し、高品質な問題解決経路を直接得ることになります。これにより、盲目的な探索を減らし、モデルをより早く良好な状態に収束させ、時間と計算資源を節約できます。

晩点:米国の最先端モデル企業が蒸留攻撃を防ぐ成功基準は何ですか。

劉藝:第一に、他のモデル企業が近道をするのを阻止し、自社モデルの優位性を確保することです。第二に、他のモデル企業の蒸留コストとデータ収集コストを引き上げることです。同時に、ユーザーの通常の利用にできるだけ影響を与えないことです。

晩点:防げますか。

劉藝:防ぎようがないと思います。モデルは人に使わせる限り、漏洩のリスクがあります。

ただし、最近OpenAIが9月10日にAgents APIのパブリックベータ版を正式にリリースしたのを見ました。以前のResponses APIとは異なり、ユーザーが入力を与え、大規模モデルが出力を返し、その間に思考連鎖が挟まります。Agents APIのロジックは、ユーザーがタスクを与え、タスクの結果を直接得るというものです。中間の思考連鎖やエージェントハーネスのプロセスはすべて隠され、実行環境を丸ごと提供するようなものです。ユーザーは細かいことを気にする必要がなくなり、タスク実行全体がますます抽象化されます。このシナリオでは、蒸留攻撃を再び行うコストはさらに高くなる可能性があります。

逆蒸留の真の動機:世論を占拠し、評価額を守る

晩点:蒸留はモデル能力を向上させる最適解だと思いますか。後発の複製速度は常に最先端のイノベーション速度に追いつけないように思えますが。

劉藝:以前、私は2024年時点で、短期的にはモデル構造自体のイノベーションが競争優位性であるという見解を持っていました。次に、競争優位性は計算力に拡大する可能性があります。さらにその後、競争優位性はインフラストラクチャーとエネルギーになります。現在はおおよそこの傾向に沿って発展していると観察しています。

晩点:蒸留はあなたの競争優位性の推論のどの部分に帰属しますか。

劉藝:計算力に帰属できると思います。理論上、何度も試せばたどり着けるかもしれませんが、時間的に許されない可能性があります。

晩点:逆蒸留が最終的に守るものは何ですか。

劉藝:逆蒸留は偽命題です。理論上、蒸留は防御不可能です。人間の性として、あなたを蒸留する効率が、自分でデータを構築してモデルを訓練する効率を上回る限り、私は必ずまずあなたを蒸留しに行きます。

晩点:米国の最先端AI企業の逆蒸留は、失敗が運命づけられた戦いだと思いますか。

劉藝:その通りです。私の見解はそういうことです。

晩点:技術的に失敗が運命づけられているなら、米国の最先端AI企業はなぜそこまで執着するのですか。

劉藝:彼らは技術的優位性を維持したいのです。最近、OpenAIは約1万のAIエージェントを使い、88時間かけて7大「ミレニアム懸賞問題」の1つの数学的証明を完了したと発表しました。例えば、DeepSeekが今年末に、ミレニアム7大数学問題をすべて解決したと発表し、技術報告書に「OpenAIの10分の1のコストでタスクを完了した」と書いたとします。米国の投資家は「なぜこんなに多くのお金が必要なのに、他社より劣っているのか」と問うかもしれません。OpenAIの評価額は下落する可能性があります。

したがって、OpenAIなどの米国の最先端モデル企業の逆蒸留行為の本質は、依然としてビジネスロジックであり、単なる技術発展のロジックではありません。

Anthropicは第一にデータを収集し、自社のデータフライホイールを構築すること、第二にARRをより良く見せ、IPOに備えることです。

OpenAIのロジックも似ています。OpenAIがなぜ皆にリセット用のカードを配り続けるのか。それはボタンを押すたびに皆にお金を配っているようなものではないですか。データを収集し、財務諸表をより良く見せるためです。

晩点:9月12日、Anthropicの創業者ダリオ(Dario Amodei)氏は、業界全体に最先端AIモデルの反復速度を遅らせるよう呼びかける文章を発表しました。どう思いますか。

劉藝:彼らは何らかのボトルネックを目にしたのだと思います。ボトルネックには3つの要因が考えられます。第一にデータ、第二に計算力、第三にインフラ/エネルギーです。ただし、具体的にどのボトルネックかは現時点では言いにくく、3つの要因すべてが関係している可能性もあります。

資本は利益を追求するものです。理論上、AGIを実現できれば世界を収穫できるのに、開発を止める理由はなく、そのまま「突き進んで」AGIを実現すればいいはずです。彼らはおそらくボトルネックに直面したため、AI安全の名目で、皆に「AIは危険すぎる。まず座ってAIの発展をどう制限するか議論しよう」と呼びかけているのです。

晩点:最先端モデル企業の逆蒸留の本質的な理由は何だと思いますか。

劉藝:競合他社の蒸留コストを引き上げ、自社の優位性を維持することです。彼らはおそらく、中国のモデルがすぐに追いついてくると判断したが、優位性を維持するより良い方法を思いつかず、制限を強化して、まず世論をリードするしかなかったのでしょう。

業界の素朴なコンセンサスから言えば、蒸留は大きなセキュリティ問題であり、知的財産の窃取に相当します。しかし、実用性の観点から言えば、これは本質的にAIの平等化です。蒸留は市場を急速に平準化する方法です。多くの競合他社がいるからこそ、特定のモデル企業が独占して一強になり、好きなように価格設定することができないのです。

晩点:蒸留の積極的な価値の側面について言及されましたが、一方で、蒸留は業界全体や一般ユーザーにどのような潜在的危害をもたらす可能性がありますか。

劉藝:業界にとっては、皆の出力スタイルが似通ってしまい、モデルは教師モデルからの特定の失敗パターンを継承します。ユーザーにとっては、個人情報漏洩のリスクがあります。

晩点:全体として、蒸留攻防を含むAIセキュリティ分野はどのような状態にあり、どのような課題に直面していると思いますか。

劉藝:私がより注目しているのは、AIセキュリティと商業的インセンティブの間に存在する構造的緊張です。

モデル企業は確かにセキュリティに多くのリソースを投入していますが、一部のシナリオでは、より厳格なセキュリティ対策がモデル能力に影響を与えたり、製品リリースを遅らせたり、ユーザーエクスペリエンスを低下させたりする可能性があるため、セキュリティ目標と競争目標は常に完全に一致するとは限りません。したがって、重要なガバナンス上の問題は、セキュリティ投資と企業の商業的インセンティブをより一致させる方法です。少なくとも短期的には、セキュリティ問題を解決しつつモデル性能を犠牲にしない優雅な解決策を見つけるのは難しいでしょう。

晩点:蒸留攻撃は今後どのように発展すると思いますか。

劉藝:攻防は続き、動的な均衡に達するでしょう。いくつかのアプローチが出てくる可能性があります。第一に、思考連鎖を求めず、直接蒸留を始め、最先端モデルをどのようなものに蒸留できるかを探るアプローチ。第二に、思考連鎖を求める場合に、ネイティブな思考連鎖を取得するアプローチ。第三に、自分で思考連鎖を合成するアプローチです。

晩点:プライバシーデータの漏洩を避けるために、一般ユーザーへのアドバイスはありますか。

劉藝:中継サーバーを使わないことです。一部のモデルを使用する際、自分のデータを訓練に使ってよいかどうかをチェックする項目がある場合は、「同意する」にチェックを入れないことです。他にできることはあまりありません。結局のところ、まな板の上の鯉のようなものですから。

この内容は情報提供および教育目的であり、BTCCに関連する投資助言ではありません。BTCCは信頼性・正確性・独自性に努めていますが、これらを完全に保証するものではありません。

おすすめ

新債券王ガンドラックが警告:FRBが動かなければ長期金利は大幅上昇へBTCC デイリー(9.14)|CLARITY法案「最終版」草案を公表、FRBの9月利上げ確率は87%へiPhone値上げでも販売を守る?JPモルガンが読み解くアップルの「月額戦略」DeepSeek中核エンジニアの長文:「才能を昨日に葬らざるを得なかった」AIバブル崩壊か?3大巨頭が異例の共同声明でAI開発の減速を呼びかけ