Adiós a Whisper: gpt-transcribe de OpenAI reduce los errores de transcripción

OpenAI Replaces Whisper: gpt-transcribe Cuts Errors

OpenAI ha dejado atrás su arquitectura original Whisper y presenta sus nuevos modelos como el punto de partida recomendado para integrar transcripción de voz a texto, sustituyendo a los anteriores valores predeterminados gpt-realtime-whisper-1 y whisper-1.

Con qué sustituye OpenAI a Whisper

La gran mejora no es solo la precisión en bruto. Es la comprensión contextual.

Los modelos tradicionales de reconocimiento automático de voz (ASR, por sus siglas en inglés) tratan cada fragmento de audio de forma aislada, una limitación que el nuevo enfoque está diseñado para resolver.

Cómo se ha evaluado Whisper en otros análisis

Un análisis descubrió que GPT-4o-Transcribe genera un texto de alta calidad pero sin marcas de tiempo, mientras que Whisper sí incluye marcas de tiempo pero ofrece un texto de menor calidad, según un caso de estudio en producción real citado por promptt.dev8.

Otro análisis de 2026 reportó cifras concretas de referencia: una tasa de error de palabra (WER) del 4,1% para GPT-4o-Transcribe frente a un 5,3% para Whisper-v3, lo que supone aproximadamente un 22% menos de errores al mismo precio de 0,006 USD por minuto9. Ese análisis señaló que existen tres variantes disponibles, incluida una versión con diarización que añade identificación de hablantes por 2,5 veces el coste9.

La propia documentación para desarrolladores de OpenAI explica cómo transcribir archivos de audio grabados, transmitir transcripciones en streaming y usar funciones especializadas de voz a texto a través de su API7.

Otros movimientos en el reconocimiento de voz

Cohere, conocida sobre todo como empresa de modelos de lenguaje para el sector empresarial, lanzó Cohere Transcribe el 26 de marzo de 202610.

Ese modelo se situó en el primer puesto del Hugging Face Open ASR Leaderboard, superando a OpenAI Whisper, así como a ElevenLabs Scribe, Zoom Scribe e IBM Granite Speech10.

Por otro lado, una plataforma llamada WhisperAI, basada en la tecnología de OpenAI Whisper, anunció en julio de 2026 el lanzamiento de una API avanzada de transcripción WhisperAI tanto para audio pregrabado como para voz a texto en tiempo real4.

Por qué esto importa para las herramientas de transcripción del día a día

Whisper se entrenó con 680.000 horas de datos supervisados multilingües y multitarea, lo que lo hizo excepcionalmente robusto frente al ruido de fondo, la jerga técnica y otras condiciones de audio del mundo real6.

La variante whisper-1 que OpenAI ofrece a través de su API es más antigua y admite JSON detallado con marcas de tiempo por segmento, mientras que Whisper Large v3 se describe como la última versión de código abierto, con mejor precisión en audios con ruido o acento5.

Estas diferencias son relevantes para cualquiera que esté eligiendo un motor de transcripción, ya sea para una API en la nube o para un software que funcione directamente en un ordenador personal.

Qué significa esto para los usuarios de Mac

Si dictas notas, borradores o mensajes en un Mac, la competencia entre modelos de OpenAI, Cohere y varios revendedores de API ocurre sobre todo a nivel de desarrollador/API, no en la propia aplicación.

  • Las API de transcripción en la nube como las descritas arriba están pensadas para desarrolladores que integran voz a texto en apps y servicios, no para el dictado del día a día9.
  • La transcripción local, en el propio dispositivo, como la que usa Voicci con modelos basados en Whisper, mantiene el audio en el dispositivo en lugar de enviarlo a una API en la nube1.
  • Los modelos locales basados en Whisper siguen siendo una base práctica para el dictado privado y sin conexión en un Mac1.

Voicci es una app de dictado por voz para la barra de menú de macOS centrada en la transcripción privada, que utiliza reconocimiento de voz local basado en Whisper para funcionar sin conexión, incluye un atajo de teclado global para dictar y permite insertar texto en cualquier aplicación de tu Mac1.

Para grabaciones confidenciales, mantener la transcripción en tu propio dispositivo en lugar de subir el audio a una herramienta en la nube desconocida es la opción más segura por defecto, sea cual sea el motor que use cada app.

Qué vigilar a partir de ahora

El panorama de la transcripción de voz cambia rápido, con OpenAI, Cohere y proveedores externos de API compitiendo con afirmaciones sobre precisión y coste910.

Las cifras de tasa de error de palabra y el precio por minuto varían según el benchmark y el proveedor, así que conviene revisar la documentación oficial antes de cambiar un flujo de trabajo en producción79.

Si buscas una opción privada y local para el dictado diario en tu Mac, Voicci está diseñada precisamente para eso, con transcripción local basada en Whisper1.

Sources and image credit

  • Voicci Mac voice-to-text app
  • WhisperAI Surpasses 330,000 Professionals Worldwide and Launches ...
  • Whisper Versions — whisper-1 vs Large v3 vs Distil - transcript.you
  • Whisper Review - Cost, Use Cases & Alternatives [2026]
  • Audio API FAQ - OpenAI Help Center
  • Whisper-1 vs GPT-4o-Transcribe: Full Comparison (2025)
  • GPT-4o-Transcribe Review: vs Whisper Pricing & Latency 2026
  • Cohere Transcribe: Open-Source ASR Beats Whisper with 5.4% Word Error ...

Image: Photo by Mariia Shalabaieva on Unsplash

Try private voice-to-text on your Mac

Voicci turns speech into clean text locally, with workflows built for writers, meetings, notes, and long-form drafting.

Download Voicci

Or skip the trial — get a license for $8.49, one-time