Anthropic·OpenAI의 증류 방지: 계정 차단, 사고 연쇄 은닉, 그러나 접근은 막지 못해
Panewslab저자: 왕쯔이, 레이트포스트(LatePost)
편집: 청만치
비즈니스 논리가 기술 논리보다 더 중요하다.
2026년 9월 10일, Anthropic은 154페이지 분량의 보고서를 발표하며 Claude를 대상으로 한 7개 중국 AI 연구소의 대규모 증류를 식별하고 차단했다고 밝혔다.
증류는 원래 일반적인 모델 훈련 방법이다. 개발자가 더 강력한 모델로 데이터를 생성하고, 이 데이터로 자신의 모델을 훈련시켜 선도 모델을 모방하는 방식이다. Anthropic은 무단으로 대규모, 은밀하게 모델 능력을 추출하는 행위를 '불법 증류'(illicit distillation)라고 부른다.
Anthropic에 따르면 관련 기관들은 최첨단 모델의 출력을 추출할 때 도난당한 신용카드, 로그인 자격 증명, API 키를 이용해 대량의 가짜 계정을 만드는 등 명백히 규정을 위반하는 수단을 사용했다.
보고서는 또한 일부 중국 모델 회사들이 사용자 요청을 Claude에 전달하거나 제3자 라우팅 서비스에서 사용자 대화를 구매해 이 데이터로 모델을 훈련시켰다고 밝혔다. 일부 대화에는 이름, 기업 데이터, 유효한 접근 자격 증명이 포함되어 있었다.
이번이 Anthropic의 첫 '증류 공격' 주장은 아니다. 2026년 2월, Anthropic은 DeepSeek, 문샷 AI(Moonshot AI), MiniMax가 약 2만 4천 개의 가짜 계정을 통해 Claude와 1,600만 회 이상 상호작용했다고 밝혔다. 이후 Anthropic은 방어선을 강화했다. OpenAI와 Google도 지속적으로 증류 공격을 식별하고 대응하고 있다.
이러한 조치로 증류를 막을 수 있을까?
호주 그리피스대학교 조교수 류이는 회의적이다. 그는 오랫동안 인공지능과 사이버 보안을 연구했으며, Quantstamp에서 AI 연구 과학자로 근무했다. 그가 참여한 2023년 프롬프트 주입 연구는 글로벌 보안 기구 OWASP의 LLM 01 항목에 참고 문헌으로 등재되었다. 그는 또한 Anthropic의 보안 취약점 포상금을 두 차례 수상했고, 최고 수준 상용 모델의 사고 연쇄 절취 공격을 연구했다.
류이는 자신의 핵심 판단을 공유했다:
Anthropic을 예로 들면, 미국 최첨단 모델 회사들은 현재 주로 세 겹의 증류 방어선을 구축했다:
(1) 적대적 데이터 추출을 탐지하는 전용 분류기를 사용해 모델이 내재적으로 의심스러운 요청을 거부하도록 함;
(2) 아키텍처 설계상 사고 연쇄를 숨기거나 압축한 후 출력함;
(3) 외부 탐지기로 데이터 추출을 식별한 후 요청을 중단하거나 계정을 차단함.
증류 방지는 허위 명제다. 이론적으로 증류를 완전히 근절하기는 어렵다. 미국 최첨단 모델 회사들의 더 현실적인 목표는 데이터 수집 비용을 높여 경쟁사의 속도를 늦추고 선도 시간을 연장하는 것이다.
미국 최첨단 모델 회사들에게 증류 방지가 보호하는 것은 모델 능력만이 아니다. 그들이 지켜야 할 것은 기술적 우위 위에 구축된 상업적 가치이기도 하다.
류이는 미국 최첨단 모델 회사들의 증류 방지 행동을 이해하려면 기술 논리보다 비즈니스 논리가 더 중요하다고 본다.
Anthropic은 증류 의심 행위를 식별할 수 있지만, 증류 확증을 얻기는 매우 어렵다
레이트포스트 : Anthropic이 9월 10일 보고서를 발표해 7개 중국 AI 연구소의 불법 증류를 주장했습니다. 여기서 '증류 공격'은 구체적으로 무엇을 의미하나요?
류이: 현재 주류 대형 모델은 사용자 입력, 중간 추론의 사고 연쇄(chain of thought), 모델 출력의 세 부분으로 구성됩니다. 현재 Anthropic과 OpenAI는 중간 사고 연쇄를 숨기고 최종 답변만 제공합니다. 복잡한 추론 작업의 경우 사고 연쇄를 빼내는 것이 바로 증류 공격 방식입니다.
레이트포스트 : 추론 궤적과 에이전트 전체 궤적 같은 데이터가 모델 능력 향상에 왜 그렇게 중요한가요?
류이: 사고 연쇄는 더 강한 모델이 이미 만들어낸 문제 풀이 답안으로 이해할 수 있습니다. 모델 훈련에 사용할 수 있는 고품질 데이터입니다.
대형 모델 성능은 매개변수 수(N), 데이터 양(D), 계산량(C) 세 가지가 함께 결정합니다. 매개변수 수는 각 회사가 비교적 빠르게 늘리고 있습니다. 시간과 컴퓨팅 자원이 제한된 상황에서 회사가 모델 능력을 더 빨리 향상시키려면 더 많은 고품질 데이터가 필요합니다.
하지만 복잡하고 장기적인 작업의 양질 데이터를 구축하는 것은 매우 어렵고, 현실 세계에서 가치 있는 훈련 데이터는 점점 줄어들고 있습니다. 그래서 일부 대형 모델 회사들은 다양한 방식으로 더 높은 수준의 모델을 증류합니다.
레이트포스트 : 사고 연쇄와 더 많은 작업 궤적을 어떻게 빼내나요?
류이: 다양한 기술 조합이 있습니다. 예를 들어 인코딩(encoding), 탈옥(jailbreaking), 프롬프트 주입(prompt injection)을 통해, 그리고 다양한 최면을 통해 계속해서 AI에 인격을 부여해 자신이 연구원이며 어렵지만 의미 있는 일을 하고 있고, 작업 해결에 집중해야 한다고 믿게 만드는 것입니다. 저는 국내 사람들과 교류가 많지 않지만, 해외에서 AI를 하는 사람들이 이런 식으로 사고 연쇄를 복원한다는 것을 알고 있습니다. 기본적으로 논문만 보면 다들 어떤 생각을 하는지 알 수 있습니다.
원시 사고 연쇄를 직접 꺼내는 것 외에도 입력과 출력을 바탕으로 중간 사고 연쇄를 합성할 수도 있습니다. 일부 데이터 회사는 장기 작업의 사고 연쇄를 개당 800~1,000위안에 판매한다고 합니다.
레이트포스트 : Anthropic, OpenAI, Google 중 누가 가장 많이 증류되나요?
류이: 현재 공개 보도에 따르면 Anthropic일 것입니다. 하지만 확실하지 않습니다. DeepSeek, GLM, Kimi, Anthropic, OpenAI 각 사고 연쇄의 실제 텍스트를 보면 언어 스타일에 큰 차이가 없습니다. 누가 누구를 증류했는지 말하기 어렵습니다. 처음에는 그들이 DeepSeek을 증류했을 수도 있습니다.
레이트포스트 : 기술적으로 증류 공격을 보통 어떻게 식별하나요? '이 요청들이 증류 같다'에서 '이것이 특정 기관의 증류다'까지 어떤 증거 사슬이 필요한가요?
류이: Anthropic은 주로 호출 행동을 근거로 판단합니다. 예를 들어 특정 계정이 갑자기 대량의 요청을 보내 특정 고정 데이터셋을 집중적으로 추출하는 경우입니다.
Anthropic은 먼저 이상 계정을 찾아낸 다음, 서로 다른 계정이 공유하는 패턴(예: 동일한 시스템 프롬프트)을 찾습니다. 각 회사가 사용하는 에이전트 아키텍처(harness)가 다르고 시스템 프롬프트도 다르기 때문에 이를 통해 배후 회사를 식별할 수 있습니다. 예를 들어 프리픽스 캐싱(prefix caching)을 활용하면 Anthropic은 어떤 프롬프트 그룹이 동일한 캐시를 공유하는지, 그리고 현재 알려진 시스템 프롬프트와 일치하지 않는지 발견할 수 있어 증류자를 쉽게 찾아낼 수 있습니다.
레이트포스트 : 이상 계정을 식별한 후, Anthropic이 자신의 데이터가 특정 모델에 실제로 훈련되었는지 확정할 수 있나요?
류이: 100% 확정하기는 매우 어렵습니다. 특정 회사가 Claude를 증류하려 했다고 주장할 수는 있지만, 특정 데이터가 실제로 상대 모델에 들어갔다는 것을 증명하기는 어렵습니다.
GLM, Kimi, DeepSeek은 모두 오픈소스 모델이지만 가중치만 공개했을 뿐 데이터셋은 공개하지 않습니다. 모델 가중치로부터 증류의 확증을 얻기는 매우 어렵습니다. 그렇지 않았다면 Anthropic이 보고서에서 그렇게 모호하게 말할 필요 없이 중계소 운영만 중점적으로 설명하지는 않았을 것입니다. 본질적으로 화이트박스 방식으로 분석할 수 없기 때문입니다.
또 다른 예로, 대형 모델에 《해리 포터》 첫 번째 책의 처음 100개 단어를 물어보면 대부분 답할 것입니다. 하지만 이것이 원작을 직접 훈련했다는 뜻은 아니며, 원문을 인용한 블로그나 서평에서 나왔을 수도 있습니다.
레이트포스트 : 즉, '증류 공격'은 완전히 입증하기도, 반증하기도 어렵다는 말씀이군요.
류이: Anthropic은 플랫폼 측 호출 기록, 계정 연관성, 인프라 정보를 통해 비교적 강력한 귀속 증거를 형성할 수 있습니다. 하지만 이것은 최종 모델 자체에서 특정 Claude 데이터가 실제로 훈련에 들어갔다는 것을 증명하는 것과는 다른 문제입니다. 후자는 기술적으로 훨씬 더 어렵습니다.
증류 방지는 경쟁사의 수집 비용을 높이고, 일반 사용자에게도 '오탐' 피해를 줄 수 있다
레이트포스트 : 현재 미국 최첨단 AI 회사들은 증류 공격에 대응하는 구체적인 기술 방법으로 어떤 것들이 있나요?
류이: 세 가지로 나눌 수 있다고 생각합니다.
첫째, 내장 탐지입니다. Anthropic에는 사고 연쇄 추출을 전문으로 하는 분류기(classifier)가 있을 것입니다. 사고 연쇄 관련 상태가 활성화된 것이 감지되면 추출 행위를 막을 수 있습니다.
둘째, 제품 아키텍처상의 은닉입니다. 모델이 더 이상 원시 사고 연쇄를 출력하지 않고 먼저 압축, 요약한 후 출력합니다.
셋째, 외장 탐지입니다. 예를 들어 출력 내용이 자신의 사고 연쇄와 겹치는지(overlap) 확인하고, 특정 유출 임계값에 도달하면 출력을 중단합니다. 이런 행위가 여러 번 쌓이면 계정이 차단됩니다.
레이트포스트 : Anthropic 보고서에는 이런 세부 내용이 없는데, 어떻게 알게 되셨나요?
류이: 제 추측입니다. 비교적 흔한 작업이기 때문입니다. Anthropic이 자체 보안 방어 조치를 테스트하기 위해 취약점 포상금 프로그램을 운영하는 이유가 무엇일까요? 사람들이 자신의 프롬프트를 탈옥하도록 돈을 주고 사는 것입니다. 어떤 것이 뚫린 것을 발견하면 즉시 자체 분류기에 훈련시켜 다음 공격은 점점 더 어려워지게 만듭니다.
레이트포스트 : Anthropic의 보안 취약점 포상금을 두 번 받으셨는데, 당시 어떤 과정이었나요?
류이: 당시 약 2~3주가 걸렸습니다. 주로 Anthropic이 승인한 취약점 포상금 프로그램 범위 내에서 보안 분류기에 대한 적대적 테스트(Adversarial Testing)를 수행하며 기존 방어를 우회할 수 있는 입력을 찾으려 했습니다. 공격은 0 아니면 1이기 때문에 성공과 실패만 있고 0.5 상태는 없습니다. 당시 작업 목표는 Anthropic이 지정한 문제의 획득이었고 사고 연쇄 복원과 직접 관련되지는 않았습니다. 하지만 일부 논리는 유사합니다.
레이트포스트 : 증류 공격 방어 조치가 정상 구독 사용자에게 피해를 줄 수 있나요?
류이: 정상 구독 사용자는 괜찮을 것입니다. 위험 관리가 작동하는 것은 주로 중계소 계정이나 Claude를 공격하려는 계정 같은 비정상 사용자입니다.
Anthropic 보고서에는 후난성 모 대학의 학부생 2명이 직접 네트워크 보안 에이전트를 설계해 다양한 웹사이트를 공격한 사례도 공개되었습니다. 이런 것까지 다 찾아냈습니다.
이론적으로 Anthropic과 상호작용한 모든 정보는 그들이 확인하려고 하면 다 확인할 수 있습니다.
레이트포스트 : 그렇다면 Anthropic이 사용자가 위협이 될 수 있다고 판단하면 사용자 데이터를 조회하고 열람할 수 있다는 말인가요?
류이: 이는 각 모델 회사의 이용약관을 구체적으로 살펴봐야 합니다. 제가 알기로 Anthropic, OpenAI, Google은 일종의 ZDR(Zero Data Retention, 무데이터 보존) 메커니즘을 제공합니다. 작업 처리가 끝나면 고객이 입력한 프롬프트와 AI가 생성한 답변을 즉시 파기하고 저장하지 않으며, 보존하지 않고, 모델 훈련에도 사용하지 않겠다고 약속하는 것입니다. 이 기능은 주로 조건을 충족하는 API 또는 기업 고객을 대상으로 하며 보통 신청이나 추가 설정이 필요합니다. 일반 사용자가 Claude, ChatGPT, Gemini를 사용할 때 데이터 보존 정책은 각 사용자 계약에 따라 실행되며 엄격한 ZDR과 동일하지 않습니다.
예를 들어 모델 회사가 사용자 데이터를 약간 수정해 훈련에 사용한다면, 이것이 사용자 데이터를 사용한 것으로 간주될까요?
레이트포스트 : 즉, 최첨단 모델이 사용자에게 요금을 받으면서도 사용자 데이터를 사용해 계속 스케일업할 수 있다는 말씀이군요?
류이: 맞습니다. 예를 들어 사용자가 Claude Code나 Codex에서 모델의 답변을 수정하면, 이 피드백은 매우 가치 있는 보상 신호가 되어 사후 훈련을 개선할 수 있습니다.
증류도 같은 논리입니다. 현재 모델의 사후 훈련은 주로 강화 학습에 의존하며 핵심은 보상 신호입니다. 모델 회사가 더 강한 성능 모델의 사고 연쇄를 얻는 것은 '큰 결과'를 얻는 것과 같아 고품질의 문제 해결 경로를 직접 확보하는 셈입니다. 이는 맹목적인 탐색을 줄이고 모델이 더 빨리 좋은 상태로 수렴하도록 하여 시간과 컴퓨팅 자원을 절약할 수 있습니다.
레이트포스트 : 미국 최첨단 모델 회사들의 증류 공격 방어 성공 기준은 무엇인가요?
류이: 첫째, 다른 모델 회사들이 지름길로 훈련하는 것을 막아 자사 모델의 선도 우위를 보장하는 것입니다. 둘째, 다른 모델 회사들의 증류 비용과 데이터 수집 비용을 높이는 것입니다. 동시에 사용자의 정상적인 사용에 최대한 영향을 주지 않는 것입니다.
레이트포스트 : 막을 수 있나요?
류이: 완전히 막기는 어렵다고 생각합니다. 모델은 사람들이 사용하게 하는 한 유출 위험이 있습니다.
하지만 최근 OpenAI가 9월 10일 Agents API 공개 베타를 정식 출시한 것을 보았습니다. 기존 Responses API처럼 사용자가 입력을 주고 대형 모델이 출력을 주며 중간에 사고 연쇄를 추가하는 방식과 달리, Agents API의 논리는 사용자가 작업을 주면 작업 결과를 직접 받는 것입니다. 중간 사고 연쇄와 에이전트 하네스 과정이 모두 숨겨져 사실상 전체 실행 환경을 판매하는 것과 같습니다. 사용자는 더 이상 세부적인 것을 관리할 필요가 없고 전체 작업 실행이 점점 추상화됩니다. 이런 시나리오에서는 증류 공격 비용이 더 높아질 수 있습니다.
증류 방지의 진짜 동기: 여론 장악과 기업가치 보호
레이트포스트 : 증류가 모델 능력 향상의 최적해라고 보시나요? 후발 복제 속도가 최전선 혁신 속도를 영원히 따라잡지 못하는 것 아닌가요?
류이: 제가 이전에 한 가지 견해를 밝힌 적이 있습니다. 2024년 당시 단기적으로 모델 구조 자체의 혁신이 해자입니다. 다음으로 해자는 컴퓨팅 자원으로 확장될 수 있습니다. 그다음 해자는 인프라(infrastructure)와 에너지입니다. 현재 대략 이런 추세로 발전하고 있는 것으로 관찰됩니다.
레이트포스트 : 증류는 이 해자 추론에서 어느 부분에 속하나요?
류이: 컴퓨팅 자원에 속한다고 볼 수 있습니다. 이론적으로 여러 번 시도하면 나올 수 있지만 시간이 허락하지 않을 수 있습니다.
레이트포스트 : 증류 방지가 궁극적으로 보호하는 것은 무엇인가요?
류이: 증류 방지는 허위 명제입니다. 이론적으로 증류는 방어할 수 없습니다. 인간의 본성상 상대를 증류하는 효율이 스스로 데이터를 구축해 모델을 훈련하는 효율보다 높다면 반드시 먼저 상대를 증류할 것이기 때문입니다.
레이트포스트 : 미국 최첨단 AI 회사들의 증류 방지는 실패할 수밖에 없는 전쟁이라고 보시나요?
류이: 네. 제 견해가 그렇습니다.
레이트포스트 : 기술적으로 실패할 수밖에 없다면, 미국 최첨단 AI 회사들은 왜 그렇게 집착하나요?
류이: 기술 선도를 유지하기 위해서입니다. 최근 OpenAI는 약 1만 개의 AI 에이전트를 사용해 88시간 만에 7대 '밀레니엄 문제' 중 하나의 수학 증명을 완료했다고 밝혔습니다. 예를 들어 DeepSeek이 올해 연말에 밀레니엄 7대 수학 난제를 모두 해결했다고 발표하고 기술 보고서에 'OpenAI의 1/10 비용으로 작업을 완료했다'고 쓴다고 가정해 봅시다. 미국 투자자들은 '왜 그렇게 많은 돈이 필요한데 남들보다 못하냐'고 물을 수 있습니다. OpenAI의 기업가치는 하락할 수 있습니다.
따라서 OpenAI 등 미국 최첨단 모델 회사들의 증류 방지 행위의 본질은 여전히 비즈니스 논리이지 단순한 기술 발전 논리만은 아닙니다:
Anthropic은 첫째 데이터를 수집해 자체 데이터 플라이휠을 구축하고, 둘째 ARR을 더 좋게 만들어 IPO를 준비해야 합니다.
OpenAI의 논리도 비슷합니다. OpenAI가 계속해서 리셋 카드를 나눠주는 이유가 무엇일까요? 누를 때마다 돈을 주는 것과 같지 않습니까? 바로 데이터를 수집하고 재무제표를 더 좋게 보이게 하기 위해서입니다.
레이트포스트 : 9월 12일 Anthropic 창립자 다리오(Dario Amodei)가 업계 전체에 최첨단 AI 모델의 반복 속도를 늦추자고 촉구하는 글을 올렸습니다. 어떻게 보시나요?
류이: 그들이 어떤 병목을 보았을 것이라고 생각합니다. 병목 요인은 세 가지일 수 있습니다. 첫째 데이터, 둘째 컴퓨팅 자원, 셋째 인프라/에너지입니다. 하지만 구체적으로 어떤 병목인지는 현재 말하기 어렵고, 세 가지 요인이 모두일 수도 있습니다.
자본은 이익을 추구합니다. 이론적으로 AGI를 만들 수 있다면 전 세계를 수확할 수 있는데, 발전을 멈출 이유가 없습니다. 바로 '돌격 돌격'해서 AGI를 실현하면 됩니다. 그들이 병목에 부딪혔기 때문에 AI 안전이라는 명분을 내세워 'AI가 너무 위험하니 먼저 앉아서 AI 발전을 어떻게 제한할지 논의하자'고 호소하는 것일 가능성이 큽니다.
레이트포스트 : 최첨단 모델 회사들의 증류 방지 본질적 원인은 무엇이라고 보시나요?
류이: 경쟁사의 증류 비용을 높여 자신의 선도 우위를 유지하는 것입니다. 그들은 중국 모델이 곧 따라잡을 것이라고 판단했을 수 있지만, 선도 우위를 유지할 더 나은 방법을 찾지 못해 제한을 강화하고 먼저 여론의 고지를 점령할 수밖에 없었을 것입니다.
업계의 소박한 합의 관점에서 증류는 큰 안전 문제이며 지식재산권 절도에 해당합니다. 하지만 실용성 관점에서 이는 본질적으로 AI 평등화입니다. 증류는 시장을 빠르게 균형 잡는 방식입니다. 경쟁자가 많기 때문에 특정 모델 회사가 독점하여 가격을 마음대로 정할 수 없습니다.
레이트포스트 : 증류의 긍정적 가치 측면을 언급하셨는데, 반면 증류가 업계 전체와 일반 사용자에게 어떤 잠재적 해를 끼칠 수 있나요?
류이: 업계에는 출력 스타일이 수렴하고 모델이 교사 모델의 특정 실패 패턴을 물려받게 됩니다. 사용자에게는 일부 개인정보 유출 위험이 있습니다.
레이트포스트 : 증류 공방을 포함한 AI 안전 분야가 전반적으로 어떤 상태에 있고 어떤 도전에 직면해 있다고 보시나요?
류이: 제가 더 주목하는 것은 AI 안전과 상업적 인센티브 사이에 존재하는 구조적 긴장입니다.
모델 회사들은 실제로 안전에 많은 자원을 투입하지만, 일부 시나리오에서는 더 엄격한 안전 조치가 모델 능력에 영향을 주거나 제품 출시를 지연시키거나 사용자 경험을 저하시킬 수 있습니다. 따라서 안전 목표와 경쟁 목표가 항상 완전히 일치하지는 않습니다. 그래서 중요한 거버넌스 문제는 안전 투자와 회사의 상업적 인센티브를 어떻게 더 일치시키느냐입니다. 적어도 단기적으로는 안전 문제를 해결하면서 모델 성능을 희생하지 않는 우아한 해결책을 찾기 어렵습니다.
레이트포스트 : 증류 공격이 앞으로 어떻게 전개될 것으로 보시나요?
류이: 공방은 계속되며 동적 균형에 도달할 것입니다. 몇 가지 유파가 있을 수 있습니다. 첫째, 사고 연쇄 없이 바로 증류를 시작해 최첨단 모델을 어디까지 증류할 수 있는지 탐구하는 것입니다. 둘째, 사고 연쇄가 필요한 상황에서 원시 사고 연쇄를 획득하는 것입니다. 셋째, 스스로 사고 연쇄를 합성하는 것입니다.
레이트포스트 : 개인정보 데이터 유출을 피하기 위해 일반 사용자에게 어떤 조언을 해주시겠어요?
류이: 중계소를 사용하지 마세요. 일부 모델을 사용할 때 데이터 훈련 동의 여부를 선택할 수 있다면 동의를 선택하지 마세요. 그 외에는 할 수 있는 게 많지 않습니다. 결국 '사람은 칼, 나는 물고기'니까요.
이 콘텐츠는 정보 및 교육 목적으로만 제공되며 BTCC와 관련된 투자 자문을 하지 않습니다. BTCC는 위 내용의 진실성, 정확성 및 독창성을 보장하기 위해 최선을 다하지만, 보장할 수는 없습니다.