A OpenAI informou na quarta-feira que identificou e interrompeu uma campanha coordenada de destilação criada para extrair ilegalmente o raciocínio protegido de seus modelos de inteligência artificial (IA).
A empresa atribuiu o “principal cluster da atividade”, que remonta à primeira semana de julho, a pessoas ligadas à Moonshot AI, empresa chinesa de IA sediada em Pequim. A OpenAI não apresentou evidências técnicas para sustentar essa avaliação, provavelmente por razões de segurança.
“Os responsáveis não quebraram nossa criptografia, não comprometeram um banco de dados nem obtiveram acesso direto aos históricos de conversas armazenados dos usuários”, afirmou a OpenAI. “Em vez disso, manipularam as interações com os modelos para reproduzir o raciocínio protegido em formatos visíveis a quem fazia as solicitações, de maneira coordenada e em grande escala, em violação aos nossos termos de serviço.”
Segundo a empresa, a atividade começou em 1º de julho de 2026, inicialmente em baixo volume. O número de tentativas aumentou em 24 e 25 de julho, quando foram registradas 16.000 solicitações com um padrão significativo de extração, feitas por mais de 4.000 usuários. Após uma investigação adicional, a OpenAI identificou atividades relacionadas, com padrões de instruções semelhantes, envolvendo mais de 15.000 usuários. A campanha foi totalmente interrompida em 28 de julho de 2026.
A startup de IA classificou a atividade como destilação adversarial, prática que consiste no uso sistemático e não autorizado das respostas de um modelo para treinar, reproduzir ou aprimorar outro. A OpenAI afirmou que implementou medidas adicionais para combater o ataque e baniu as contas fraudulentas envolvidas.
A empresa também fechou uma brecha que permitia a algumas pessoas que já possuíam o raciocínio criptografado de outro usuário reproduzi-lo e recuperar seu conteúdo. Além disso, adicionou verificações para detectar e reter respostas transmitidas em fluxo que pudessem revelar o raciocínio.
Em um estudo publicado em agosto de 2026, um grupo de pesquisadores identificou uma vulnerabilidade de arquitetura que tornava os rastros de raciocínio criptografados “totalmente compatíveis e intercambiáveis entre diferentes sessões, usuários e modelos dentro do ecossistema de um mesmo fornecedor”. Um invasor poderia explorar essa falha para criar, em grande escala, uma técnica para contornar os mecanismos de descriptografia e driblar as proteções contra destilação.
“Ao inserir o rastro de raciocínio criptografado de um determinado modelo em um modelo mais fraco e menos protegido do mesmo fornecedor, forçamos o modelo a decodificar e reproduzir o rastro literalmente, em texto simples, sem jamais contornar diretamente as proteções do modelo mais capaz”, afirmaram pesquisadores da MATS Research, do ELLIS Institute Tübingen e da Synk.
A vulnerabilidade também permite a extração de dados privados em grande escala, abre espaço para injeções invisíveis de instruções por meio da inclusão de conteúdo malicioso em blocos criptografados e pode revelar inadvertidamente informações perigosas ocultas no processo de raciocínio, mesmo quando a resposta final e visível do modelo rejeita uma solicitação prejudicial.
Como o raciocínio protegido oferece pistas sobre como um modelo executa uma tarefa, sua extração pode revelar dados sensíveis e ajudar terceiros a reproduzir as capacidades do sistema, acrescentou a OpenAI.
“A destilação adversarial representa riscos para a segurança dos sistemas e para a segurança nacional”, afirmou a empresa. “O raciocínio extraído pode ser usado para treinar outro modelo sem preservar as proteções aplicadas às respostas do modelo original voltadas aos usuários.”
“Em grande escala, a destilação também pode acelerar a transferência de capacidades avançadas sem exigir o mesmo investimento em segurança. Essas preocupações aumentam à medida que os modelos desenvolvem capacidades em áreas de uso duplo.”
Não é a primeira vez que a Moonshot AI enfrenta acusações de destilação. No mês passado, a concorrente Anthropic acusou a empresa de encaminhar secretamente solicitações de clientes ao Claude, em vez de processá-las com o Kimi, e depois exibir as respostas do Claude aos usuários.
A empresa também teria retido parte dessas interações para treinar seu modelo de cadeia de pensamento. A atividade foi identificada pelo código GTG-16002.
Publicidade
Exclusivo para leitores do CaveiraTech, de R$ 89 por R$ 49/mês, para sempre. Hospedado em São Paulo com AntiDDoS, backup grátis e BGP grátis. Use Linux, Windows ou BSDs. Valide seu projeto agora sem dor de cabeça, sem IOF e com pagamentos via Pix. Ativação em 120s. Saiba mais...