Tecnología

OpenAI lanzó GPT Transcribe: la tasa de error cae a la mitad y ahora entiende jerga técnica

OpenAI GPT Transcribe y GPT Live Transcribe modelos de transcripción de audio

OpenAI anunció el 28 de julio dos modelos nuevos de transcripción que reemplazan a la familia Whisper como opción recomendada para desarrolladores: GPT Transcribe y GPT Live Transcribe. La diferencia principal con lo que había antes no es solo precisión — es que ahora los modelos entienden contexto.

GPT Transcribe vs. GPT Live Transcribe: para qué sirve cada uno

GPT Transcribe está pensado para archivos de audio ya grabados: reuniones, podcasts, entrevistas, grabaciones de voz. Procesás el archivo y te devuelve la transcripción. Cuesta USD 0,0045 por minuto, que es 25% más barato que el modelo gpt-4o-transcribe anterior (que salía $0,006/min).

GPT Live Transcribe es la versión de baja latencia para transcripción en tiempo real — mientras alguien está hablando. El caso de uso claro es subtitulado en vivo, accesibilidad, y herramientas tipo caption para streaming. Cuesta USD 0,017 por minuto, igual que gpt-realtime-whisper que OpenAI lanzó en mayo 2026.

La diferencia que importa: contexto y jerga técnica

Los modelos de transcripción anteriores procesaban cada fragmento de audio en aislamiento. Si alguien mencionaba "Valorant", "BG3" o el nombre de un colega con apellido raro, Whisper podía transcribirlo mal porque no tenía contexto de qué tipo de audio era.

Los nuevos modelos aceptan varios tipos de input adicional: texto libre describiendo el audio, una lista de palabras clave para nombres o terminología técnica, y el idioma esperado. GPT Transcribe también puede tomar los turnos anteriores de la conversación como contexto. Según las pruebas de OpenAI, esto ayuda especialmente con números, frases cortas y audio grabado con ruido de fondo.

Los benchmarks: cuánto mejoró realmente

En el dataset Common Voice (22 idiomas), la word error rate de GPT Transcribe bajó del ~40% de Whisper-1 a ~19%. GPT Live Transcribe también supera a gpt-realtime-whisper en las pruebas publicadas por OpenAI. Son mejoras significativas, no cosméticas.

Dicho eso, los nuevos modelos no tienen todo: faltan timestamps a nivel de palabra, exportación a SRT/VTT para subtítulos, diarización de hablantes y traducción al inglés. Para esos casos, OpenAI dice que hay que seguir usando Whisper-1 o gpt-4o-transcribe-diarize por ahora. No hay fecha de cuándo se agregan esas funciones.

¿Para qué sirve si no sos desarrollador?

Si usás herramientas de transcripción automática — Notion AI, Otter.ai, Fireflies, cualquier app de notas de voz — es probable que en los próximos meses actualicen al backend de GPT Transcribe y veas mejoras sin hacer nada. La baja en el costo por minuto también va a empujar a muchas apps a mejorar sus planes gratuitos o bajar precios.

Para los que hacen contenido en video y generan subtítulos, el Live Transcribe puede volverse la opción estándar para subtitulado automático en tiempo real cuando los servicios lo adopten. OpenAI lo está posicionando claramente para accesibilidad y comunicación multilingüe.