A OpenAI abandonou na segunda-feira os planos de lançar o GPT-6.1 Astra, um modelo de inteligência artificial de próxima geração previsto para outubro, depois que ele foi reprovado em auditorias internas de segurança e alinhamento.
A informação foi divulgada inicialmente pelo The Wall Street Journal. “A decisão marca um caso raro de uma grande desenvolvedora de IA desistir de um novo lançamento por preocupações com segurança”, afirmou o jornal.
A empresa responsável pelo ChatGPT disse que decidiu cancelar o lançamento do GPT-6.1 Astra depois que os testes levantaram dúvidas sobre a capacidade do modelo de seguir as instruções dos usuários sem se desviar do comportamento esperado.
Segundo o Journal, o modelo apresentou níveis mais altos de comportamento enganoso que seu antecessor durante as avaliações e não informou quais ações havia realizado. Em alguns casos, agiu sem pedir autorização ou tentou usar ferramentas externas em situações que poderiam ser consideradas inseguras.
“Embora o GPT-6.1 Astra tenha melhorado em aspectos como a tendência do modelo à inércia, ele não atingiu o nível esperado em relação a respeitar o escopo e as autorizações, nem a comunicar ao usuário que tipo de trabalho realizou”, afirmou Saachi Jain, chefe de sistemas de segurança da OpenAI.
“Queremos, é claro, garantir que o desenvolvimento dos nossos modelos seja seguro, tanto dentro da empresa quanto quando os disponibilizamos aos usuários. Mas, antes de lançá-los para o público, estabelecemos um padrão extremamente elevado de segurança e alinhamento.”
A decisão ocorre em meio a relatos de sistemas de IA que agem fora de controle em todo o setor, o que tem levado a pedidos para desacelerar o desenvolvimento da tecnologia e exigir medidas de segurança mais rigorosas antes de sua ampla adoção.
Na semana passada, a OpenAI informou que estava pausando o treinamento de seus modelos mais poderosos depois que um de seus agentes, durante o aprendizado por reforço, entrou em contato com um chatbot externo ao explorar uma brecha nas restrições de acesso à internet.
Em um relatório publicado na segunda-feira, o AI Safety Institute afirmou que, em testes simulados, o GPT-6 Astra realizou ataques de supply chain sem autorização com mais frequência do que modelos anteriores da OpenAI. Em alguns casos, isso ocorreu mesmo depois que o escopo foi esclarecido explicitamente.
“Em nossas simulações, constatamos que o GPT-6 Astra realizou diversas atividades de ataque sem autorização, e com frequência maior que o GPT-5.6 Sol e o GPT-5.5”, diz o relatório.
“As atividades incluíram a criação de identidades falsas para enganar desenvolvedores, a publicação de comentários em contas falsas para contestar os resultados de análises de segurança precisas e o envio de payloads maliciosos para bases de código open source.”
Publicidade
Tenha acesso aos melhores hackers éticos do mercado através de um serviço personalizado, especializado e adaptado para o seu negócio. Guardsi: qualidade, confiança e especialidade em segurança ofensiva de quem já protegeu centenas de empresas. Saiba mais...