Tecnología

OpenAI lanzó GPT-Live-1 en la API y la Agents API: voz full-duplex a USD 0,05 el minuto y agentes que corren solos por horas

OpenAI GPT-Live-1

OpenAI metió dos lanzamientos el mismo día: llevó su modelo de voz "full-duplex" a la API bajo el nombre GPT-Live-1, y abrió en beta pública la Agents API, que expone el mismo motor que usa Codex (su agente de código) para que cualquier desarrollador arme sus propios agentes.

Qué es GPT-Live-1

Es la versión para desarrolladores del modelo de voz que ya venía potenciando el modo Voice de ChatGPT desde julio. La palabra clave es "full-duplex": el modelo puede escuchar y hablar al mismo tiempo, como en una llamada real, en vez de esperar a que el usuario termine de hablar para recién ahí procesar y responder. Eso significa que puede tirar un "ajá" mientras seguís hablando, dejarse interrumpir a mitad de frase y retomar el hilo sin perder contexto — algo que los sistemas anteriores (que encadenaban voz-a-texto, un modelo de razonamiento y texto-a-voz por separado) no lograban sin sonar robóticos y con delay.

El precio es de USD 0,05 por minuto por la capa de voz. Si el modelo necesita delegar razonamiento más profundo o usar herramientas, ahí entra un modelo de backend como GPT-6 Astra, que se cobra aparte. Entre las mejoras técnicas: doce voces nuevas y un salto de 30% en el benchmark interno de conversación full-duplex respecto a la versión anterior, GPT-Realtime-2.1. También soporta telefonía full-duplex, pensada para call centers y sistemas de reservas.

Qué es la Agents API

La Agents API expone el mismo motor de orquestación que usa Codex, para que cualquier developer pueda construir agentes que corran solos durante horas o días: ejecutan código, usan herramientas y coordinan sub-agentes en paralelo sin que alguien esté mirando cada paso. Con una sola llamada definís el modelo, las herramientas y el entorno de ejecución (sandbox), y OpenAI se encarga de mantener las sesiones activas, comprimir el contexto cuando hace falta y recuperarse si algo falla. No tiene costo adicional por usar la API en sí: se paga solo por los tokens y las herramientas que efectivamente se usen. Ya hay soporte confirmado de varios proveedores de sandbox, entre ellos Vercel y DigitalOcean.

Por qué le importa a alguien de gaming

Ninguno de los dos anuncios está pensado específicamente para gaming, pero las aplicaciones prácticas están ahí. GPT-Live-1 habilita NPCs con conversación de verdad (que te escuchan mientras hablás, no que esperan a que termines), asistentes de comunidad o streaming que responden en tiempo real, y soporte al jugador por voz sin la latencia incómoda de los sistemas anteriores. La Agents API, por su lado, le sirve más a estudios o creadores de contenido que quieran automatizar tareas largas —generación de assets, testing, moderación de comunidad, análisis de partidas— sin tener que armar toda la infraestructura de orquestación desde cero.

Por ahora ambos productos están orientados a developers, no a un uso directo del usuario final. Pero si en los próximos meses empezás a notar que algún juego o app tiene un asistente de voz que de golpe se siente mucho menos robótico, probablemente esté corriendo sobre esto.