A OpenAI lançou recentemente três modelos de áudio que prometem revolucionar a interação por voz em tempo real. Com essa novidade, a empresa busca aprimorar a experiência de usuários e desenvolvedores, permitindo que agentes de software se tornem mais conversacionais e eficientes.
Os novos modelos, chamados GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper, foram apresentados em 7 de maio de 2026. Eles estão disponíveis para testes na plataforma de desenvolvedores da OpenAI, ampliando as capacidades além da simples transcrição e chat.
Funcionalidades dos Novos Modelos
O GPT-Realtime-2 é projetado para gerenciar solicitações complexas, permitindo que os agentes chamem ferramentas e mantenham o contexto em conversas mais longas. Isso significa que, em um ambiente de atendimento ao cliente, por exemplo, o agente pode lidar com múltiplas perguntas sem perder a linha de raciocínio.
Já o GPT-Realtime-Translate oferece suporte à tradução de mais de 70 idiomas, facilitando a comunicação em diversos contextos, como educação e suporte técnico. Essa funcionalidade é especialmente útil em um mundo cada vez mais globalizado, onde a barreira do idioma pode ser um obstáculo significativo.
Por fim, o GPT-Realtime-Whisper permite a conversão de fala para texto em tempo real. Essa tecnologia pode ser aplicada na geração de legendas automáticas, notas de reuniões e atualizações de fluxo de trabalho, tornando o dia a dia mais produtivo e inclusivo.
Empresas como Zillow, Priceline e Deutsche Telekom já estão testando esses modelos, o que demonstra o potencial de aplicação no mercado. Os preços para utilização variam, com o GPT-Realtime-2 custando a partir de US$ 32 por milhão de tokens de áudio.
Com essas inovações, a OpenAI não apenas expande suas ofertas, mas também redefine a forma como interagimos com a tecnologia. No Brasil, essas ferramentas podem transformar o atendimento ao cliente e a educação, proporcionando uma comunicação mais fluida e acessível.











