Uberlandia, MG Sex, 02 de outubro
21° Máx. 26° · Mín. 20° Nublado
Previsão para Uberlândia Hoje: nublado
Amanhã, 03/10 28° 20° 92% chuva
dom, 04/10 29° 20° 87% chuva
seg, 05/10 27° 20° 59% chuva
ter, 06/10 27° 20° 71% chuva
qua, 07/10 29° 19° 67% chuva
qui, 08/10 30° 20° 40% chuva
sex, 09/10 30° 22° 31% chuva
Dados meteorológicos fornecidos por Open-Meteo.
Meta apresenta IA que transcreve conversas em tempo real e identifica participantes
Foto original adaptada visualmente por IA.
Inteligência Artificial

Meta apresenta IA que transcreve conversas em tempo real e identifica participantes

Compartilhar Facebook X WhatsApp Telegram

A Meta apresentou nesta terça-feira (1º) o Muse Voice Transcribe, seu primeiro modelo de inteligência artificial voltado à percepção de áudio em tempo real. A tecnologia transcreve conversas enquanto elas acontecem, identifica quem está falando e consegue lidar com mais de 20 pessoas simultaneamente.

Desenvolvido pelo Meta Superintelligence Labs (MSL), o modelo também trabalha com diferentes idiomas em uma mesma conversa. Segundo a empresa, o sistema foi treinado com mais de 70 idiomas, dos quais 25 foram amplamente validados para o lançamento.

Uma das funções do Muse Voice Transcribe é o chamado code-switching, quando uma pessoa alterna entre idiomas durante uma conversa. A IA consegue reconhecer a mudança mesmo no meio de uma frase.

Em uma demonstração divulgada pela Meta, oito pessoas conversam simultaneamente, e o sistema identifica cada participante e associa corretamente suas falas. A tecnologia também lida com interrupções, sobreposição de vozes e diferentes sotaques.

O modelo reúne três funções principais: reconhecimento automático de fala em fluxo contínuo, identificação dos participantes da conversa, conhecida como speaker diarization, e identificação dos momentos em que uma fala começa ou termina.

O Muse Voice Transcribe processa o áudio em blocos de 80 milissegundos. A cada novo trecho, o sistema decide se deve continuar ouvindo ou começar a produzir o texto. A Meta chama esse mecanismo de “atraso adaptativo”.

Na prática, a IA pode esperar um pouco mais quando encontra uma palavra difícil e gerar a transcrição mais rapidamente ao identificar uma palavra simples. A estratégia busca equilibrar velocidade e precisão: quanto mais tempo o modelo espera antes de transcrever, maior tende a ser a precisão, mas também aumenta o atraso na resposta.

O sistema ainda pode usar informações sobre o idioma, palavras-chave e contexto para melhorar a precisão das transcrições. Segundo a Meta, o Muse Voice Transcribe alcançou a primeira posição nos rankings da Artificial Analysis para reconhecimento de fala em streaming e em benchmarks públicos de identificação de participantes. A classificação considera os resultados disponíveis em 1º de setembro de 2026.

O novo modelo já é utilizado em recursos de ditado do aplicativo Meta AI para Mac. Como o aplicativo oferece recursos de voz para outros serviços, o Muse Voice Transcribe também pode ser usado em diferentes aplicações.

A tecnologia está disponível para desenvolvedores por meio do Muse Code e da API de modelos da Meta. O acesso custa US$ 3, cerca de R$ 15,50, por mil minutos de áudio. A empresa também disponibilizou uma demonstração em sua página de pesquisa, permitindo testar a transcrição de áudio em tempo real.

O lançamento ocorreu menos de uma semana após a apresentação do Gemini 3.5 Transcribe, do Google, que também aposta em recursos avançados de reconhecimento de áudio. A diferença, segundo a Meta, é que o Muse Voice Transcribe combina transcrição, identificação de múltiplos participantes e processamento multilíngue em tempo real.

0 votos: 0 positivos, 0 negativos (0 pontos)

Deixe uma resposta
Miramontes 350×700
Notíciasletter
Receba nossas noticias
Um resumo direto no seu e-mail.
Sign In/Sign Up Pesquisar
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...