OpenAI abandona o Whisper: novo modelo de transcrição erra menos

OpenAI Replaces Whisper: gpt-transcribe Cuts Errors

A OpenAI deixou para trás a arquitetura original do Whisper e passou a recomendar novos modelos como ponto de partida para quem integra transcrição de voz em texto, substituindo os antigos padrões gpt-realtime-whisper-1 e whisper-1.

Pelo que a OpenAI está a substituir o Whisper

A grande novidade não é só a precisão bruta. É a capacidade de entender o contexto.

Os modelos tradicionais de reconhecimento automático de fala (ASR) analisam cada trecho de áudio isoladamente, uma limitação que a nova abordagem foi feita para resolver.

Como o Whisper tem sido avaliado por outros

Uma análise concluiu que o GPT-4o-Transcribe produz texto de alta qualidade mas não gera timestamps, enquanto o Whisper fornece timestamps mas entrega texto de qualidade inferior, segundo um estudo de caso real citado pelo promptt.dev8.

Outra análise de 2026 apresentou números concretos de benchmark: uma taxa de erro de palavras (WER) de 4,1% para o GPT-4o-Transcribe contra 5,3% do Whisper-v3, o que representa cerca de 22% menos erros pelo mesmo preço de $0,006 por minuto9. Essa análise apontou três variantes disponíveis, incluindo uma versão com diarização que identifica quem fala e custa 2,5 vezes mais9.

A própria documentação para desenvolvedores da OpenAI explica como transcrever ficheiros de áudio gravados, transmitir transcrições em streaming e usar funcionalidades específicas de conversão de voz em texto através da API7.

Outros movimentos no reconhecimento de fala

A Cohere, conhecida sobretudo como empresa de modelos de linguagem para empresas, lançou o Cohere Transcribe a 26 de março de 202610.

Esse modelo assumiu o primeiro lugar no Open ASR Leaderboard da Hugging Face, ultrapassando o OpenAI Whisper, o ElevenLabs Scribe, o Zoom Scribe e o IBM Granite Speech10.

Em paralelo, uma plataforma chamada WhisperAI, construída sobre a tecnologia do OpenAI Whisper, anunciou em julho de 2026 o lançamento de uma API avançada de transcrição, tanto para áudio pré-gravado como para conversão de voz em texto em tempo real4.

Porque é que isto importa para as ferramentas de transcrição do dia a dia

O Whisper foi treinado com 680 mil horas de dados multilingues e multitarefa supervisionados, o que o tornou muito resistente a ruído de fundo, jargão técnico e outras condições reais de áudio6.

A variante whisper-1 disponibilizada via API da OpenAI é mais antiga e suporta JSON detalhado com timestamps por segmento, enquanto o Whisper Large v3 é descrito como o lançamento open-source mais recente, com melhor precisão em áudio com ruído ou sotaque5.

Estas diferenças são relevantes para quem está a escolher um motor de transcrição, quer seja para uma API na nuvem, quer para software que corre diretamente no computador.

O que isto significa para quem usa Mac

Se dita notas, rascunhos ou mensagens num Mac, a concorrência entre os modelos da OpenAI, da Cohere e de vários revendedores de API acontece sobretudo ao nível do programador/API, não na própria aplicação.

  • As APIs de transcrição na nuvem descritas acima são pensadas para programadores que integram voz em texto em apps e serviços, não para ditar texto no dia a dia9.
  • A transcrição local, feita diretamente no dispositivo, como acontece com os modelos baseados em Whisper usados pela Voicci, mantém o áudio no computador em vez de o enviar para uma API na nuvem1.
  • Os modelos locais baseados em Whisper continuam a ser uma base prática para ditado privado e offline num Mac1.

A Voicci é uma aplicação de barra de menu para macOS de voz para texto, construída em torno da transcrição privada, usando reconhecimento de fala local baseado em Whisper para funcionar offline, um atalho global para ditar e inserção universal de texto em qualquer aplicação do Mac1.

Para gravações confidenciais, manter a transcrição no próprio dispositivo em vez de enviar o áudio para uma ferramenta na nuvem desconhecida é sempre a opção mais segura, seja qual for o motor usado pela aplicação.

O que observar a seguir

O panorama da transcrição por voz está a mudar rapidamente, com a OpenAI, a Cohere e fornecedores de API terceiros a fazer afirmações concorrentes sobre precisão e custo910.

Os valores de taxa de erro de palavras e o preço por minuto variam consoante o benchmark e o fornecedor, por isso vale a pena consultar a documentação original antes de trocar o motor de transcrição de um sistema em produção79.

Se procura uma opção privada e local para ditar no dia a dia no Mac, a Voicci foi construída precisamente para isso, com transcrição local baseada em Whisper1.

Sources and image credit

  • Voicci Mac voice-to-text app
  • WhisperAI Surpasses 330,000 Professionals Worldwide and Launches ...
  • Whisper Versions — whisper-1 vs Large v3 vs Distil - transcript.you
  • Whisper Review - Cost, Use Cases & Alternatives [2026]
  • Audio API FAQ - OpenAI Help Center
  • Whisper-1 vs GPT-4o-Transcribe: Full Comparison (2025)
  • GPT-4o-Transcribe Review: vs Whisper Pricing & Latency 2026
  • Cohere Transcribe: Open-Source ASR Beats Whisper with 5.4% Word Error ...

Image: Photo by Mariia Shalabaieva on Unsplash

Try private voice-to-text on your Mac

Voicci turns speech into clean text locally, with workflows built for writers, meetings, notes, and long-form drafting.

Download Voicci

Or skip the trial — get a license for $8.49, one-time