A anti-destilação da Anthropic e OpenAI: bloqueio de contas e ocultação de cadeias de raciocínio não travam a concorrência

PanewslabPanewslab

Autor: Wang Ziyi, LatePost

Edição: Cheng Manqi

A lógica comercial é mais importante do que a lógica técnica.

 

Em 10 de setembro de 2026, a Anthropic publicou um relatório de 154 páginas, afirmando ter identificado e bloqueado a destilação em larga escala do Claude por sete laboratórios de IA chineses.

A destilação é um método comum de treino de modelos: os programadores usam um modelo mais forte para gerar dados e depois treinam os seus próprios modelos com esses dados para imitar o modelo líder. A Anthropic designa a extração não autorizada, em larga escala e dissimulada das capacidades do modelo como "destilação ilícita".

A Anthropic afirma que as instituições envolvidas usaram meios claramente violadores ao extrair os resultados do modelo de ponta: como a criação em massa de contas falsas com cartões de crédito roubados, credenciais de início de sessão e chaves de API.

O relatório também refere que algumas empresas chinesas de modelos reencaminham os pedidos dos utilizadores para o Claude, ou compram conversas de utilizadores a serviços de proxy de terceiros, usando esses dados para treinar modelos. Algumas conversas contêm nomes, dados empresariais e credenciais de acesso válidas.

Esta não é a primeira vez que a Anthropic acusa "ataques de destilação". Em fevereiro de 2026, afirmou que a DeepSeek, a Moonshot AI e a MiniMax realizaram mais de 16 milhões de interações com o Claude através de cerca de 24 mil contas falsas. Desde então, a Anthropic reforçou as suas defesas. A OpenAI e a Google também continuam a identificar e a responder a ataques de destilação.

Será que estas medidas conseguem impedir a destilação?

Liu Yi, professor assistente na Universidade Griffith, na Austrália, manifesta dúvidas. Investiga há muito tempo inteligência artificial e cibersegurança, e foi cientista de investigação em IA na Quantstamp. A sua investigação de 2023 sobre injeção de prompts é citada como referência na entrada LLM 01 da organização global de segurança OWASP. Recebeu ainda duas recompensas por vulnerabilidades de segurança da Anthropic e estudou ataques de roubo de cadeias de raciocínio em modelos comerciais de topo.

Liu Yi partilhou as suas avaliações centrais:

Tomando a Anthropic como exemplo, as empresas americanas de modelos de ponta têm atualmente três camadas de defesa contra a destilação:

(1) Utilizar classificadores especificamente concebidos para detetar extração adversária de dados, fazendo com que o modelo recuse intrinsecamente pedidos suspeitos;

(2) Ocultar ou comprimir a cadeia de raciocínio na arquitetura antes de a apresentar;

(3) Usar detetores externos para identificar extração de dados e, em seguida, interromper o pedido ou bloquear a conta.

A anti-destilação é um falso problema. Teoricamente, a destilação é muito difícil de eliminar; o objetivo mais realista das empresas americanas de modelos de ponta é aumentar o custo da recolha de dados, atrasar os concorrentes e prolongar a liderança.

Para as empresas americanas de modelos de ponta, a anti-destilação não protege apenas as capacidades do modelo; elas defendem também o valor comercial construído sobre a liderança tecnológica.

Liu Yi considera que, para compreender as ações anti-destilação das empresas americanas de modelos de ponta, a lógica comercial é mais importante do que a lógica técnica.

 

A Anthropic consegue identificar comportamentos suspeitos de destilação, mas é difícil obter provas concretas

LatePost : A Anthropic publicou um relatório a 10 de setembro, acusando sete laboratórios chineses de IA de destilação ilícita. O que significa concretamente "ataque de destilação"?

Liu Yi: Atualmente, os grandes modelos de linguagem são compostos por três partes: a entrada do utilizador, a cadeia de raciocínio intermédia (chain of thought) e a saída do modelo. A Anthropic e a OpenAI escondem a cadeia de raciocínio intermédia e dão apenas a resposta final. Para tarefas de raciocínio complexo, extrair a cadeia de raciocínio é uma forma de ataque de destilação.

LatePost : Porque é que dados como trajetórias de raciocínio e trajetórias completas de agentes são tão importantes para melhorar as capacidades do modelo?

Liu Yi: Pode entender a cadeia de raciocínio como a solução que um modelo mais forte já produziu; são dados de alta qualidade que podem ser usados para treinar modelos.

O desempenho de um grande modelo é determinado por três fatores: número de parâmetros (N), quantidade de dados (D) e computação (C). O número de parâmetros tem aumentado rapidamente em todas as empresas; com tempo e poder computacional limitados, para melhorar mais rapidamente as capacidades do modelo, as empresas precisam de mais dados de alta qualidade.

Mas é muito difícil construir dados de qualidade para tarefas complexas e de longo alcance, e os dados de treino valiosos no mundo real são cada vez mais escassos. Por isso, algumas empresas de grandes modelos usam várias formas de destilar modelos mais avançados.

LatePost : Como se extraem a cadeia de raciocínio e mais trajetórias de tarefas?

Liu Yi: Há várias combinações de técnicas. Por exemplo, através de codificação (encoding), jailbreaking, injeção de prompts (prompt injection) e várias formas de "hipnose", definindo continuamente uma persona para a IA, fazendo-a acreditar que é um investigador a realizar uma tarefa difícil mas significativa, que exige concentração. Não tenho muito contacto com pessoas na China, mas sei que no estrangeiro há quem reconstrua cadeias de raciocínio desta forma — basicamente, basta ler os artigos para perceber as abordagens.

Além de extrair diretamente a cadeia de raciocínio nativa, também se pode tentar sintetizar a cadeia intermédia a partir da entrada e da saída. Diz-se que algumas empresas de dados vendem cadeias de raciocínio para tarefas de longo alcance por 800-1000 yuan cada.

LatePost : Entre a Anthropic, a OpenAI e a Google, qual é a mais destilada?

Liu Yi: Segundo as notícias públicas, deverá ser a Anthropic. Mas acho difícil dizer. Vi os textos reais das cadeias de raciocínio da DeepSeek, GLM, Kimi, Anthropic e OpenAI, e os estilos de linguagem não diferem muito. É difícil dizer quem destila quem; é possível que inicialmente tenham até destilado a DeepSeek.

LatePost : Tecnicamente, como se identifica normalmente um ataque de destilação? De "este conjunto de pedidos parece destilação" a "esta é a destilação de uma determinada instituição", que cadeia de provas é necessária?

Liu Yi: A Anthropic baseia-se sobretudo no comportamento de utilização. Por exemplo, certas contas fazem subitamente muitos pedidos, extraindo de forma concentrada determinados conjuntos de dados fixos.

A Anthropic localiza primeiro as contas anómalas e depois procura padrões partilhados entre contas diferentes, como o mesmo prompt de sistema. Como cada empresa usa uma arquitetura de agente (harness) diferente, os prompts de sistema também diferem, o que permite identificar a empresa por trás. Por exemplo, com a cache de prefixos (prefix caching), a Anthropic pode descobrir que conjuntos de prompts partilham a mesma cache e não correspondem aos prompts de sistema conhecidos, localizando facilmente o destilador.

LatePost : Depois de identificar contas anómalas, a Anthropic consegue provar de forma conclusiva que os seus dados foram usados para treinar um modelo específico?

Liu Yi: É muito difícil provar a 100%. Pode acusar uma empresa de tentar destilar o Claude, mas é difícil provar que certos dados entraram mesmo no modelo da outra parte.

GLM, Kimi e DeepSeek são modelos de código aberto, mas apenas disponibilizam os pesos, não os conjuntos de dados. E a partir dos pesos do modelo é muito difícil obter provas concretas de destilação. Caso contrário, a Anthropic não precisaria de ser tão vaga no relatório, descrevendo sobretudo o funcionamento dos serviços de proxy — essencialmente porque não é possível analisar por métodos de caixa branca.

Outro exemplo: pode perguntar a um grande modelo as primeiras 100 palavras do primeiro livro de Harry Potter, e ele provavelmente responderá. Mas isso não significa que tenha treinado diretamente com o original; pode vir de blogues ou críticas que citam o texto.

LatePost : Ou seja, o "ataque de destilação" é muito difícil de provar completamente, e também muito difícil de refutar.

Liu Yi: A Anthropic pode formar provas de atribuição relativamente fortes através dos registos de utilização da plataforma, associações de contas e informações de infraestrutura, mas isso é diferente de provar, a partir do modelo final em si, que um determinado lote de dados do Claude entrou mesmo no treino. Esta última é tecnicamente muito mais difícil.

 

A anti-destilação aumenta o custo de recolha dos concorrentes e pode também "atingir" utilizadores comuns

LatePost : Que métodos técnicos concretos têm atualmente as empresas americanas de IA de ponta para responder a ataques de destilação?

Liu Yi: Na minha opinião, dividem-se em três categorias.

Primeiro, deteção incorporada: a Anthropic deve ter classificadores especificamente para extração de cadeias de raciocínio; assim que deteta que o estado relacionado com a cadeia de raciocínio foi ativado, pode impedir a extração;

Segundo, ocultação na arquitetura do produto: o modelo deixa de apresentar a cadeia de raciocínio original, comprimindo-a e resumindo-a antes de a apresentar;

Terceiro, deteção externa: por exemplo, pode verificar se o conteúdo de saída se sobrepõe à sua própria cadeia de raciocínio (overlap); se atingir certos limiares de fuga, impede a saída. Quando comportamentos semelhantes se acumulam, a conta é bloqueada.

LatePost : O relatório da Anthropic não inclui estes detalhes; como os conhece?

Liu Yi: É a minha especulação, porque são operações bastante comuns. Porque é que a Anthropic lança programas de recompensas por vulnerabilidades para testar as suas próprias defesas de segurança? Quer pagar a pessoas para fazerem jailbreak aos seus prompts — assim que descobre que algo foi comprometido, treina imediatamente o seu classificador com isso, tornando o ataque seguinte cada vez mais difícil.

LatePost : Recebeu duas vezes recompensas por vulnerabilidades de segurança da Anthropic; como foi o processo?

Liu Yi: Demorei cerca de 2 a 3 semanas, principalmente a fazer testes adversariais (Adversarial Testing) ao classificador de segurança da Anthropic, dentro do âmbito do programa de recompensas autorizado, tentando encontrar entradas que contornassem as defesas existentes. Porque quebrar é zero ou um, só há sucesso ou insucesso, não há estado de 0,5. O objetivo da tarefa era obter respostas a perguntas específicas da Anthropic, não diretamente reconstruir cadeias de raciocínio. Mas algumas lógicas são semelhantes.

LatePost : As operações de defesa contra ataques de destilação podem afetar utilizadores normais com subscrição?

Liu Yi: Os utilizadores com subscrição normal devem estar bem; o controlo de risco é acionado sobretudo por utilizadores anómalos, como contas de serviços de proxy ou contas que tentam atacar o Claude.

Lembro-me de que o relatório da Anthropic também revelou dois estudantes de licenciatura de uma universidade em Hunan que conceberam um agente de cibersegurança e o usaram para atacar vários sites; até isso foi descoberto.

Em teoria, todas as informações da sua interação com a Anthropic podem ser consultadas por ela, se quiser.

LatePost : Então, quando a Anthropic considera que um utilizador pode ser uma ameaça, pode aceder e consultar os dados do utilizador?

Liu Yi: Isso depende dos termos de utilização de cada empresa de modelos. Tanto quanto sei, a Anthropic, a OpenAI e a Google oferecem um mecanismo de Zero Data Retention (ZDR, retenção zero de dados), comprometendo-se a destruir imediatamente os prompts dos clientes e as respostas geradas pela IA após o processamento, sem armazenar, reter ou usar para treino. Esta funcionalidade destina-se principalmente a clientes API ou empresariais elegíveis, exigindo normalmente candidatura ou configuração adicional. Para utilizadores comuns do Claude, ChatGPT e Gemini, as políticas de retenção de dados seguem os respetivos acordos de utilizador, não equivalendo a ZDR estrito.

Por exemplo, se uma empresa de modelos reescrever ligeiramente os seus dados e os usar para treino, isso conta como usar os seus dados?

LatePost : Ou seja, os modelos de ponta fazem os utilizadores pagar pelo uso e, ao mesmo tempo, podem usar os dados dos utilizadores para continuar a escalar?

Liu Yi: Exato. Por exemplo, quando os utilizadores corrigem as respostas do modelo no Claude Code ou no Codex, esse feedback é um sinal de recompensa muito valioso que pode melhorar o pós-treino.

A destilação segue a mesma lógica. O pós-treino dos modelos atuais depende principalmente de aprendizagem por reforço, e a chave é o sinal de recompensa. Quando uma empresa de modelos obtém a cadeia de raciocínio de um modelo mais forte, é como obter o "grande resultado", acedendo diretamente a caminhos de resolução de alta qualidade. Isto reduz a exploração cega, faz o modelo convergir mais rapidamente para um bom estado e poupa tempo e computação.

LatePost : Qual é o critério de sucesso das empresas americanas de modelos de ponta na defesa contra ataques de destilação?

Liu Yi: Primeiro, impedir que outras empresas de modelos treinem por atalhos, garantindo a vantagem de liderança do próprio modelo. Segundo, aumentar o custo de destilação e de recolha de dados para as outras empresas. Ao mesmo tempo, tentar não afetar o uso normal dos utilizadores.

LatePost : Conseguem impedir?

Liu Yi: Acho que é impossível impedir completamente. Enquanto o modelo estiver disponível para uso, há risco de fuga.

Mas vi recentemente que a OpenAI lançou oficialmente a versão beta pública da Agents API a 10 de setembro. Ao contrário da Responses API anterior, em que o utilizador dá uma entrada e o modelo dá uma saída com uma cadeia de raciocínio pelo meio, a lógica da Agents API é o utilizador dar uma tarefa e obter diretamente o resultado. A cadeia de raciocínio intermédia e o processo do harness do agente ficam ocultos, equivalendo a vender todo um ambiente de execução. O utilizador já não precisa de gerir detalhes muito específicos; a execução global da tarefa torna-se cada vez mais abstrata. Neste cenário, tentar ataques de destilação pode ter custos ainda mais elevados.

 

A verdadeira motivação da anti-destilação: dominar a opinião pública e proteger a valorização

LatePost : Acha que a destilação é a solução ótima para melhorar as capacidades do modelo? Parece que a velocidade de replicação dos seguidores nunca acompanha a velocidade da inovação de ponta?

Liu Yi: Eu tinha uma opinião anterior: em 2024, a inovação na estrutura do modelo em si era uma vantagem competitiva a curto prazo. A seguir, a vantagem competitiva pode alargar-se à computação. Depois, a vantagem competitiva será a infraestrutura e a energia. Observo que a tendência atual segue aproximadamente este desenvolvimento.

LatePost : Em que parte desta sua dedução de vantagens competitivas se enquadra a destilação?

Liu Yi: Acho que se enquadra na computação. Em teoria, tentando muitas vezes também se chega lá, mas pode não haver tempo para isso.

LatePost : O que protege, em última análise, a anti-destilação?

Liu Yi: A anti-destilação é um falso problema. Teoricamente, a destilação é indefensável — pela natureza humana, enquanto a eficiência de te destilar for superior à eficiência de construir os meus próprios dados para treinar o modelo, vou certamente destilar-te primeiro.

LatePost : Considera que a anti-destilação das empresas americanas de IA de ponta é uma batalha condenada ao fracasso?

Liu Yi: Sim. É essa a minha opinião.

LatePost : Se tecnicamente está condenada ao fracasso, porque é que as empresas americanas de IA de ponta são tão persistentes?

Liu Yi: Querem manter a liderança tecnológica. Recentemente, a OpenAI afirmou ter usado cerca de 10 mil agentes de IA durante 88 horas para concluir a prova matemática de um dos sete "Problemas do Milénio". Por exemplo, suponha que a DeepSeek anuncia no final do ano que resolveu todos os sete problemas matemáticos do Milénio, e escreve no relatório técnico: só usei 1/10 do custo da OpenAI para concluir a tarefa. Os investidores americanos podem perguntar: porque precisas de tanto dinheiro e fazes pior do que os outros? A valorização da OpenAI pode cair.

Portanto, a essência do comportamento anti-destilação da OpenAI e de outras empresas americanas de modelos de ponta é a lógica comercial, e não apenas a lógica do desenvolvimento tecnológico:

A Anthropic, por um lado, quer recolher dados e construir o seu próprio flywheel de dados; por outro, quer melhorar a sua ARR para se preparar para a IPO.

A lógica da OpenAI é semelhante. Porque é que a OpenAI tem estado sempre a distribuir cartões de reset — isso não equivale a dar dinheiro às pessoas a cada utilização? É para recolher dados e tornar as demonstrações financeiras mais atraentes.

LatePost : A 12 de setembro, o fundador da Anthropic, Dario Amodei, publicou um apelo à indústria para abrandar o ritmo de iteração dos modelos de IA de ponta. O que acha?

Liu Yi: Acho que devem ter visto alguns gargalos. Os gargalos podem ter três fatores: dados, computação e infraestrutura/energia. Mas não posso dizer qual é o gargalo específico; podem ser os três.

O capital procura sempre o lucro. Em teoria, se eu pudesse criar AGI e dominar o mundo, não teria razão para parar o desenvolvimento; bastaria "ir com tudo" e realizar a AGI. Provavelmente encontraram gargalos e, sob o pretexto da segurança da IA, apelam a todos: a IA é demasiado perigosa, sentemo-nos primeiro para discutir como limitar o desenvolvimento da IA.

LatePost : Na sua opinião, qual é a razão essencial da anti-destilação das empresas de modelos de ponta?

Liu Yi: Aumentar o custo de destilação dos concorrentes e manter a sua vantagem de liderança. Talvez tenham avaliado que os modelos chineses os alcançarão em breve, mas não encontraram melhor forma de manter a vantagem, pelo que só podem reforçar as restrições e assumir primeiro a liderança na opinião pública.

Do ponto de vista do consenso geral da indústria, a destilação é um grande problema de segurança, equivalente a roubo de propriedade intelectual. Mas do ponto de vista prático, é essencialmente uma igualdade de acesso à IA. A destilação é uma forma de equilibrar rapidamente o mercado. É precisamente por haver muitos concorrentes que nenhuma empresa de modelos consegue monopolizar, dominar sozinha e fixar preços como quiser.

LatePost : Mencionou o lado positivo da destilação; por outro lado, que potenciais danos pode a destilação trazer para toda a indústria e para os utilizadores comuns?

Liu Yi: Para a indústria, os estilos de saída tornam-se homogéneos e os modelos herdam certos modos de falha dos modelos-mestre. Para os utilizadores, há riscos de fuga de privacidade.

LatePost : No geral, em que estado se encontra o domínio da segurança da IA, incluindo o ataque e a defesa da destilação, e que desafios enfrenta?

Liu Yi: O que mais me preocupa é a tensão estrutural entre a segurança da IA e os incentivos comerciais.

As empresas de modelos investem de facto muitos recursos em segurança, mas em certos cenários, medidas de segurança mais rigorosas podem afetar as capacidades do modelo, atrasar lançamentos de produtos ou reduzir a experiência do utilizador, pelo que os objetivos de segurança e os objetivos competitivos nem sempre estão totalmente alinhados. Portanto, uma questão de governação importante é como alinhar melhor o investimento em segurança com os incentivos comerciais das empresas. Pelo menos a curto prazo, é difícil encontrar uma solução elegante que resolva os problemas de segurança sem sacrificar o desempenho do modelo.

LatePost : Como acha que os ataques de destilação evoluirão no futuro?

Liu Yi: O ataque e a defesa continuarão, atingindo um equilíbrio dinâmico. Poderão surgir várias correntes: primeiro, dispensar a cadeia de raciocínio e destilar diretamente, explorando até onde se pode destilar um modelo de ponta. Segundo, obter a cadeia de raciocínio nativa quando ela é necessária. Terceiro, sintetizar a própria cadeia de raciocínio.

LatePost : Para evitar fugas de dados privados, que conselhos dá aos utilizadores comuns?

Liu Yi: Não usem serviços de proxy. Ao usar certos modelos, quando puderem escolher se permitem que os vossos dados sejam usados para treino, não escolham permitir. Para além disso, não há muito mais que possam fazer. Afinal, estamos à mercê deles.

Este conteúdo é apenas para fins informativos e educacionais e não constitui aconselhamento de investimento relacionado à BTCC. A BTCC envida todos os esforços, mas não pode garantir a veracidade, a precisão ou a originalidade do conteúdo acima.

Recomendada

BTCC Diário (11/9) | Rendimento dos Treasuries a 10 anos dos EUA aproxima-se de 5%, Brent recua acentuadamente após aproximar-se dos 110 dólaresEleições intercalares nos EUA: Wall Street aposta num Congresso dividido e antecipa alívio moderado para os mercadosCapitalistas de risco de topo debatem como a IA está a mudar a lógica de investimento: a armadilha do meio e o efeito volanteRei das Obrigações Gundlach alerta: se a Fed não agir, as taxas de longo prazo vão dispararCérebro de mosca-da-fruta aberto pela Google aprende a jogar e a negociar criptomoedas