Ferramenta de IA chinesa orientou pesquisadores sobre como criar armas biológicas
30 de Setembro de 2026

A desenvolvedora chinesa de IA Moonshot iniciou uma investigação interna depois que pesquisadores conseguiram convencer dois de seus populares modelos Kimi a explicar como fabricar armas biológicas e cometer assassinatos.

A Mindgard, empresa que testa a segurança de sistemas de IA, descobriu em julho que os modelos Kimi K2.6 e K3 Swarm conseguiam burlar as salvaguardas definidas por seus desenvolvedores.

A descoberta ocorreu durante um processo conhecido como jailbreak, no qual pesquisadores usam uma série de instruções complexas para verificar se ferramentas de IA ignoram as barreiras de segurança. Segundo a Mindgard, essas barreiras deveriam ter impedido os modelos Kimi de discutir temas preocupantes.

A Moonshot afirmou que recebe bem contribuições externas, consideradas “um pilar fundamental para desenvolver uma IA melhor e mais segura”.

A empresa também disse estar conversando com a Mindgard sobre as descobertas.

Peter Garraghan, fundador da Mindgard, afirmou que os resultados envolvendo o Kimi K2.6 e o K3 Swarm são preocupantes.

“Depois que o jailbreak funciona, o modelo conversa sobre qualquer assunto. Ele chega a oferecer espontaneamente recomendações sobre outros temas igualmente nocivos e pode ser inventivo e criativo”, afirmou.

Esse tipo de jailbreak apresenta um risco diferente daquele observado na recente série de incidentes de grande repercussão envolvendo IA.

Nesses casos, ferramentas autônomas de IA conhecidas como agentes, desenvolvidas por empresas dos Estados Unidos, como OpenAI, Meta e Anthropic, invadiram alguns serviços on-line.

Embora burlar as proteções seja um processo complexo, que pode exigir tempo e persistência, alguns especialistas temem que hackers e outros agentes mal-intencionados tentem usar essas técnicas para causar danos.

Recentemente, a Anthropic informou que identificou e interrompeu tentativas de usar um de seus modelos de IA para “atividades maliciosas” que poderiam contribuir para o desenvolvimento de armas biológicas.

**Plataforma para ataques cibernéticos**

A Mindgard não comprovou se as respostas fornecidas pelo Kimi sobre temas preocupantes seriam viáveis.

A empresa argumentou, porém, que as salvaguardas deveriam ter impedido os modelos de discutir esses assuntos com usuários.

A Mindgard também afirmou estar confiante de que uma versão do Kimi K2.6 com as proteções burladas poderia permitir que hackers executassem código nos recursos computacionais do sistema e se conectassem à internet. Isso transformaria o modelo em uma possível plataforma para ataques cibernéticos.

Garraghan defendeu a decisão da Mindgard de falar publicamente sobre como burlou as proteções dos sistemas da Moonshot. Segundo ele, a empresa avisou a desenvolvedora e não revelou detalhes essenciais sobre como fez os modelos ignorarem as barreiras de segurança.

A Mindgard comunicou o problema à Moonshot por e-mail em 27 de julho e enviou uma nova mensagem cerca de uma semana depois.

Em 12 de setembro, publicou um artigo em seu blog sobre o caso.

A Mindgard afirmou que a Moonshot só entrou em contato recentemente, depois de ser procurada para comentar o assunto.

Em um trecho de e-mail enviado à Mindgard e compartilhado pela Moonshot, a empresa afirmou que, em avaliações internas, seu modelo havia demonstrado, em geral, “uma alta taxa de recusa a esse tipo de solicitação”.

**Como evitar o jailbreak**

As descobertas surgem em um momento em que o setor de IA continua dividido sobre qual caminho é melhor ou mais seguro: modelos fechados e proprietários, como os usados no ChatGPT e no Claude, da Anthropic, ou ferramentas de código aberto.

O Kimi é um modelo de pesos abertos. Em teoria, qualquer pessoa pode obtê-lo e executá-lo em sua própria infraestrutura computacional.

Alan Woodward, professor da Universidade de Surrey, afirmou que existe o risco de modelos de código aberto caírem nas mãos erradas, mas que eles também podem ser usados para a defesa cibernética.

Ele observou que a empresa de IA Hugging Face usou um modelo chinês de código aberto para entender uma invasão que, mais tarde, foi atribuída a agentes da OpenAI.

Woodward afirmou que a regulamentação internacional dificilmente acompanhará o ritmo do desenvolvimento da IA. “Levamos décadas para chegar a um acordo sobre o formato dos números de telefone”, disse.

Assim como Garraghan, fundador da Mindgard, Woodward acredita que deveria haver mais atenção à identificação e à responsabilização de pessoas que usam IA de forma indevida.

Publicidade

Anuncie no CaveiraTech e coloque sua marca na frente de milhares de profissionais de cybersecurity

Nossa audiência é formada por analistas, pentesters, decisores e entusiastas que consomem nossas notícias todo dia pelo Site, Newsletter e Instagram. Fale com quem realmente importa para o seu negócio. Anuncie aqui. Saiba mais...