Uma nova técnica de raciocínio prevista para o próximo modelo de inteligência artificial da OpenAI, chamado Astra, gerou preocupação entre especialistas em segurança de IA. O método, conhecido como “recurrent depth” ou “recorrência opaca”, permite que o sistema vá além do processo de pensamento sequencial comum em modelos de raciocínio.
A principal preocupação é que a abordagem torne mais difícil monitorar o chamado chain of thought, ou cadeia de pensamento. Para pesquisadores da área, isso pode reduzir a capacidade de acompanhar o funcionamento interno do modelo e identificar comportamentos potencialmente perigosos.
Segundo informações obtidas pelo The Information, o uso da técnica no Astra será limitado. Ainda assim, a possibilidade de ampliar sua aplicação no futuro provocou reações entre especialistas.
Buck Shlegeris, CEO da Redwood, disse estar “extremamente preocupado” com os relatos sobre o uso da recorrência opaca no Astra. “Não sei se o Astra é muito menos monitorável por CoT do que os modelos anteriores. Mas, se a OpenAI levar essa técnica adiante, terá a opção de aumentar enormemente a recorrência e destruir completamente a monitorabilidade por CoT”, escreveu.
Em condições normais, um modelo de raciocínio apresenta uma sequência de etapas enquanto tenta resolver um problema. Embora essa representação não seja perfeita, ela pode servir como ferramenta para monitorar comportamentos inadequados ou sinais de desalinhamento.
A cadeia de pensamento também foi usada na investigação de comportamentos problemáticos de agentes de IA. Os registros ajudaram pesquisadores a entender os motivos que levaram determinados sistemas a agir de certas maneiras.
É esse mecanismo de supervisão que pode ser prejudicado pela recorrência opaca. Em vez de seguir necessariamente uma sequência convencional de etapas, a técnica permite que o modelo realize um processamento recorrente. Para especialistas, quanto mais esse mecanismo for utilizado, mais difícil poderá ser observar e interpretar o processo que levou o sistema a tomar determinada decisão.
Zvi Mowshowitz, defensor da segurança de IA, também reagiu à novidade. Ele afirmou que talvez sejam necessárias leis para impedir uma espécie de “corrida para o fundo do poço” entre laboratórios de inteligência artificial.
“O método está brincando com fogo, arriscando um tabu que a OpenAI e a Anthropic têm lutado para estabelecer: trabalhar arduamente para manter a fidelidade e a monitorabilidade da cadeia de pensamento pelo maior tempo possível”, escreveu Mowshowitz. Segundo ele, o uso mais intenso dessas técnicas provavelmente prejudicaria a capacidade de monitoramento dos modelos.
Apesar das preocupações, as informações disponíveis indicam que a utilização da técnica no Astra será limitada e que a cadeia de pensamento do modelo deverá continuar legível. A OpenAI também rejeitou a sugestão de que o sistema passaria a usar uma forma de processamento completamente inacessível, descrita como “neuralese”.
A empresa já anunciou planos para desenvolver sistemas amplos de monitoramento da cadeia de pensamento como parte de suas estratégias futuras de segurança. Dessa forma, a preocupação dos especialistas não está necessariamente ligada ao comportamento atual do Astra, mas ao que pode ocorrer se a técnica de recorrência for ampliada em versões futuras.
O receio é que um aumento significativo da recorrência torne os processos internos dos modelos cada vez mais difíceis de acompanhar, justamente à medida que suas capacidades também aumentam.











