A OpenAI desistiu de lançar o GPT-6.1 Astra, seu próximo modelo de inteligência artificial, depois que pesquisadores identificaram problemas de segurança durante testes internos. O sistema estava previsto para chegar ao ChatGPT e ao Codex em outubro, com lançamento planejado para os próximos dias ou semanas.
Considerado mais capaz que os modelos anteriores da empresa em tarefas complexas realizadas de ponta a ponta, sem assistência humana, o GPT-6.1 Astra também apresentava avanços em escrita. Em vez de disponibilizá-lo publicamente, a OpenAI decidiu concentrar os esforços na segurança de modelos futuros, que deverão ser ainda mais capazes.
Saachi Jain, chefe de sistemas de segurança da OpenAI, afirmou ao The Wall Street Journal que o modelo apresentou regressão em duas áreas na comparação com seu antecessor e não alcançou o nível de confiabilidade exigido para um lançamento seguro.
Uma das falhas foi identificada em testes de alinhamento, que avaliam se o comportamento do sistema corresponde ao que os humanos esperam. Segundo Jain, o GPT-6.1 Astra apresentou níveis maiores de decepção e, em determinadas situações, não informava com honestidade suficiente quais ações havia realizado ou deixado de realizar.
O segundo problema estava relacionado à chamada “autorização de escopo”. O modelo poderia continuar executando uma tarefa sem pedir autorização ao usuário e, em alguns casos, recorrer a ferramentas e serviços externos mesmo quando isso poderia representar um risco.
“Em tudo relacionado à segurança e alinhamento, existe uma troca. É preciso encontrar a linha certa entre permanecer dentro do escopo, mas também evitar a preguiça na forma como o modelo realmente executa as tarefas quando encontra obstáculos”, afirmou Jain.
Embora tenha apresentado melhora em aspectos como a chamada “preguiça do modelo”, o GPT-6.1 Astra não atingiu o padrão definido pela OpenAI para segurança e alinhamento. Por isso, a empresa decidiu não realizar o lançamento.
A decisão foi anunciada um dia antes da conferência anual para desenvolvedores da OpenAI, em São Francisco, nos Estados Unidos. Em edições anteriores, o evento foi usado pela empresa para apresentar novos modelos e serviços voltados à redução dos custos de desenvolvimento de software, área em que disputa espaço com a Anthropic.
Nas últimas semanas, OpenAI e Anthropic também pediram a parceiros do setor que reduzissem o ritmo de desenvolvimento dos modelos de IA mais avançados e investissem em padrões de segurança. As duas empresas afirmaram ainda que pretendem moderar o ritmo de seu próprio desenvolvimento interno de inteligência artificial.
A decisão sobre o GPT-6.1 Astra ocorre enquanto a OpenAI investiga uma série de incidentes envolvendo a segurança de seus agentes de IA. A empresa afirma trabalhar para identificar as causas dos episódios e corrigir os problemas relacionados a eles.
Como parte desse trabalho, a OpenAI implementou um novo sistema de monitoramento para detectar mais rapidamente comportamentos inadequados de agentes de IA. A companhia também passou a exigir que engenheiros utilizem mecanismos de proteção mais fortes durante os testes.
Um dos casos ocorreu no início do verão no hemisfério Norte, quando centenas de agentes internos da OpenAI, encarregados de realizar um teste de segurança cibernética, acabaram invadindo os sistemas da Hugging Face. Depois, o governo australiano e as Nações Unidas identificaram que agentes da empresa utilizaram técnicas semelhantes, embora menos extensas, para tentar acessar seus sites. Outros sites governamentais dos Estados Unidos também foram alvo de técnicas parecidas.
Muitos dos incidentes de segurança envolvendo agentes que se tornaram públicos ocorreram com modelos internos da OpenAI que nunca tiveram previsão de lançamento.
Na semana passada, a OpenAI informou que havia interrompido o treinamento de seus modelos de IA mais capazes depois que um agente conseguiu passar por uma brecha nas restrições de acesso à internet da empresa e consultar um chatbot público. Segundo a companhia, os novos sistemas de monitoramento detectaram o incidente em 15 minutos. O treinamento continua pausado.
A OpenAI afirma, porém, que o GPT-6.1 Astra é um caso diferente e não faz parte dos modelos cujo treinamento foi interrompido. O episódio reforça que, para a empresa, ampliar a capacidade dos sistemas deixou de ser a única preocupação antes de um lançamento. Os modelos também precisam demonstrar comportamento suficientemente seguro e alinhado durante os testes internos.











