Tecnología

Grok 4.6 de xAI: 1753 ELO, mitad de precio y trabaja solo 22 minutos sin parar

Grok 4.6 de xAI - anuncio y benchmarks

xAI (la empresa de IA de Elon Musk, que hoy opera bajo el paraguas de SpaceX) lanzó el 12 de agosto Grok 4.6, la nueva versión de su modelo insignia. La presentación fue directa: 1753 de ELO en LMSYS Chatbot Arena, primer puesto en el leaderboard de Databricks y un precio de USD 2 por millón de tokens de entrada — la mitad de lo que cobran los modelos de frontera de OpenAI y Anthropic.

Qué cambió exactamente respecto de Grok 4.5

Grok 4.6 usa la misma base arquitectónica que 4.5: 1,5 billones de parámetros V9. Lo que cambió es el entrenamiento encima: xAI hizo una pasada más larga de fine-tuning supervisado y reinforcement learning con datos curados. En otras palabras, el cerebro es el mismo pero entrenó más. El resultado es un modelo que completa tareas en aproximadamente la mitad de turnos que 4.5.

También suma un nuevo nivel de razonamiento llamado xhigh (además de low, medium y high), mantiene la ventana de contexto de 500.000 tokens y agrega soporte para CAD, extendiéndose a flujos de trabajo de diseño de ingeniería.

Lo que más sorprendió: trabajo autónomo de 22 minutos

El caso que más circuló en la comunidad fue el de un creador de contenido que le dio a Grok 4.6 un único prompt y lo dejó trabajar solo. El modelo estuvo 22 minutos completando un proyecto de código con shaders personalizados, un minimapa y función de cambio de hora del día — todo sin que nadie le diera más instrucciones. Este tipo de autonomía extendida es exactamente para lo que fue diseñado: Grok Build, la plataforma de xAI para agentes, se optimizó específicamente para este tipo de asignaciones largas.

Ojo: xAI aclaró que el modelo funciona significativamente mejor dentro del harness de Grok Build. Los benchmarks de 1753 ELO se midieron en ese contexto, no en uso API crudo, así que hay que tener eso en cuenta al comparar con otras herramientas.

Dónde lo podés usar hoy

Grok 4.6 está disponible en Grok Build, el editor de código Cursor (con 2x de uso incluido durante la primera semana del lanzamiento), Grok Bot en X, y la API de xAI. También llegó a Pi y OpenCode. Desarrolladores que usen OpenRouter, Vercel o Cloudflare ya pueden apuntar al nuevo modelo sin cambiar de proveedor.

Los suscriptores de Grok en X deberían verlo rotar automáticamente. En Cursor hay que seleccionarlo desde el menú de modelos para activar el doble de uso.

Contexto: ¿dónde queda respecto de ChatGPT, Gemini y Claude?

Según el Artificial Analysis Intelligence Index, Grok 4.6 empata con GPT-5.6 Sol en una puntuación compuesta de 61. Eso lo pone en la misma liga que los modelos de frontera actuales, a la mitad del precio. Claude Opus 5 y Gemini 3.7 Flash están en ese mismo rango de competencia.

Lo que sigue: xAI ya tiene en camino Grok 4.7, un modelo más grande de 2,1 billones de parámetros que según se reportó llega en semanas. Y Grok 5 apunta a antes de fin de 2026. El ritmo de releases de xAI en este momento es de los más agresivos del sector.