El 29 de julio xAI lanzó Grok Voice Think Fast 2.0, su nuevo modelo de voz speech-to-speech. Pasó relativamente desapercibido en el ruido de noticias de IA de las últimas semanas, pero los números son lo suficientemente interesantes como para prestarle atención: supera a GPT-Realtime de OpenAI en el benchmark más reconocido del sector y responde casi dos veces más rápido que su versión anterior.
Qué cambió respecto a la versión anterior
El salto más visible es la velocidad: el tiempo hasta el primer audio pasó de 1,25 segundos a 0,70 segundos. En una conversación de voz real, esa diferencia entre medio segundo y más de uno se nota. Gemini 3.1 Flash, para comparar, tarda 2,98 segundos en responder con voz. GPT-Realtime no publica su tiempo, pero el benchmark general los deja por debajo del nuevo Grok.
En el índice de calidad de Artificial Analysis —el benchmark más usado para modelos de voz en tiempo real— Grok Voice Think Fast 2.0 logró 82,9%, contra 75,7% de su predecesor, 79,1% de GPT-Realtime-2.1 y 69,5% de Gemini 3.1 Flash.
Razona mientras habla
La característica técnica más interesante del modelo es que piensa y habla al mismo tiempo. En lugar de procesar la consulta completa antes de empezar a responder (como hacen la mayoría de los modelos de voz), Think Fast 2.0 razona en paralelo con la generación de audio. El resultado es que los tool calls —cuando el modelo necesita consultar datos externos o ejecutar una acción— terminan antes de que el agente llegue a su primera pausa natural en la frase. Sin esperas extra para el usuario.
Además, es 2,5 veces más eficiente en tokens de razonamiento que la versión anterior: usa 0,4x los tokens relativos que usaba TF 1.0 para el mismo tipo de tarea.
Transcripción que le gana a los modelos dedicados
Uno de los puntos más llamativos: en transcripción de audio corto, Grok Voice TF 2.0 supera a Deepgram Nova 3 y ElevenLabs Scribe v2, dos modelos dedicados exclusivamente a convertir voz en texto. La mejora es de 1,5x a 2x en condiciones normales y sube a 10x en entornos ruidosos o con compresión telefónica. xAI dice que se enfocaron específicamente en escenarios del mundo real: fondos ruidosos, líneas de baja calidad, ese tipo de cosas.
Mejor en conversación natural
El modelo también mejoró en dinámica conversacional: frases más cortas, una pregunta a la vez, menos relleno. En el benchmark de Full Duplex —que mide qué tan bien un modelo maneja interrupciones y el ritmo natural del diálogo— subió de 77,8% a 95,1%, casi empatando con GPT-Realtime (95,7%).
Para qué sirve en la práctica
Think Fast 2.0 no es para el usuario común de Grok en la app —eso sigue siendo texto y algunos features de voz básicos. Este modelo está orientado a desarrolladores que construyen agentes de voz: bots de atención al cliente, asistentes de ventas, sistemas de soporte que atienden por teléfono. xAI probó el modelo en Starlink (+1 888 GO STARLINK) y reporta mejoras en tasa de conversión de ventas y en contención de soporte sin escalar a humano.
El precio es USD 0,08 por minuto de audio, disponible en la API de xAI y en el Voice Agent Builder. Quienes ya usaban grok-voice-latest fueron actualizados automáticamente el 5 de agosto sin cambios necesarios de su lado.
El panorama de IA de voz en tiempo real está avanzando rápido. Grok era el rezagado en este segmento hace unos meses; ahora es el que lidera el ranking general. OpenAI, Google y los otros tienen tarea.