OpenAI abrió el jueves la beta pública de su Agents API, y el titular es más literal de lo que suelen ser estas cosas: el arnés que mueve Codex ya es algo que puedes llamar por HTTP.
No un modelo. El arnés. El bucle que rodea al modelo y decide cuándo llamar a una herramienta, dónde viven los ficheros, qué se tira cuando el contexto se llena y qué pasa cuando la máquina donde estaba corriendo se evapora en silencio a las tres de la mañana.
Mi primera reacción fue la fea, que es que ese bucle lo he escrito yo. Y tú. Es una tarde de trabajo: una lista de mensajes, un switch sobre las tool calls, añades el resultado, vuelves a empezar. Venderlo como producto se parece bastante a vender un for.
Luego me acordé de la última vez que dejé un agente corriendo seis horas y se cayó en la quinta.
El bucle es fácil; la quinta hora, no
La versión honesta de mi reacción fea: escribir el bucle es fácil. Escribir el bucle que sobrevive a su propia duración no lo es, y son dos programas completamente distintos que en una demo se ven exactamente igual.
Fallan tres cosas, siempre las mismas tres:
Se llena el contexto. Vas por 180k tokens y al modelo aún le queda faena. Ahora necesitas una política de qué tirar, y todas las políticas ingenuas están mal de una forma que solo descubres más tarde: si resumes demasiado, el agente olvida que ya probó justo lo que está a punto de volver a probar; si guardas de más, estás pagando por releer en cada turno un listado de directorio de hace cuatro horas.
Se muere el estado. Reciclan el contenedor, el OOM killer se lleva el proceso, cierras la tapa del portátil. Si la ejecución solo existía en memoria, empiezas de cero, y «empezar de cero» en una tarea con cuatro horas de profundidad no es un reintento, es tirar el trabajo.
Y se enreda el fan-out. En cuanto un agente lanza tres, tienes un planificador entre manos. Quién recibe qué ficheros, qué contexto guarda cada uno, qué pasa cuando dos tocan lo mismo.
La Agents API se come las tres. Las sesiones son duraderas y sobreviven entre turnos, la compactación ocurre sola al acercarte al límite, cada subagente mantiene su propio contexto mientras el principal coordina, y todo está pensado para aguantar días corriendo. Las herramientas las pones tú; los servidores MCP se enchufan; el progreso va en streaming.
Eso ya no es un for. Eso es la infraestructura aburrida sobre la que nadie escribe un post porque no tiene gracia, y OpenAI lleva el tiempo suficiente ejecutándola en producción contra Codex como para haberse cortado con todos los bordes. Vale. Se lo concedo.
No quieren tu contenedor
La parte que no me esperaba: el sandbox está deliberadamente abierto.
Puedes ejecutar el cómputo en el sandbox de OpenAI —la misma infraestructura que hay detrás de Codex y ChatGPT, facturada a tarifa normal de contenedor—, en tu propia infraestructura, o con un socio. La lista de lanzamiento es Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop y Vercel, y son integraciones de primera, no una página de logos. El SDK de Cloudflare trae un backend de verdad: contenedores aislados, instalar paquetes, gestionar ficheros.
Nueve proveedores de sandbox el primer día te dicen dónde cree OpenAI que está la capa valiosa, y no es la caja. Les parece estupendo que el cómputo sea de otro mientras la orquestación sea suya.
Encima no cobran nada por la API. Pagas tokens y herramientas, como siempre. El equivalente de Anthropic lleva en beta pública desde abril y cobra por hora de sesión además de los tokens, así que OpenAI ha entrado a cero, que es un precio que dice bastante sobre qué están comprando en realidad.
Las dos líneas de las notas de la beta
Los datos se quedan en Estados Unidos. Zero Data Retention no está soportado.
Para mucha gente ahí se acaba el artículo. Si estás en la UE y tu agente toca algo que se parezca a datos de clientes, esto no es una pega que pones en la balanza frente a la ergonomía: es una respuesta, y puedes dejar de leer la lista de características.
Me resulta incómodo escribirlo, porque la ingeniería es buena y lo que decide es la disponibilidad. Todo lo de arriba sobre compactación y durabilidad es real y útil y me gustaría usarlo, y da igual, porque la beta no puede acercarse a las dos bases de Notion que hacen funcionar este blog. Hay una versión de esa frase para casi cualquier equipo europeo.
Que es beta, que lo arreglarán, claro. Eso lo dice toda beta que sale solo para Estados Unidos. Algunas lo cumplen.
Mientras tanto, hace quince días
Detalle pequeño de calendario que merece la pena mirar. La Assistants API se retiró el 26 de agosto, un año exacto después de quedar obsoleta, con todo el mundo empujado hacia Responses y Conversations. Dos semanas después: aquí tienes una primitiva nueva de agentes con estado, en servidor y de larga duración.
Es el tercer intento de «OpenAI te guarda el estado» en unos dieciocho meses. No lo digo por vacilar —Responses es de verdad mejor de lo que era Assistants, y esto pinta mejor todavía—. Pero si migraste desde Assistants este verano y ahora te llega un post de lanzamiento sobre sesiones duraderas en servidor, te perdono que quieras dejar pasar un trimestre antes de tocarlo.
Dónde se ha movido el lock-in
Esta es la parte que yo sí me pararía a pensar.
Cambiar de proveedor de modelo lleva un tiempo siendo, básicamente, una URL base y un poco de baile de esquemas de herramientas. Molesto, pero se hace, y la gente lo hace. Justamente por eso todos los proveedores llevan un año vendiéndote algo que no es el modelo.
Mete el estado de tus sesiones, tu comportamiento de compactación y la topología de tus subagentes dentro de la API de alguien y nada de eso se mueve. No hay exportación para «cómo decidió este arnés qué olvidar a los 180k tokens», y el comportamiento de tu agente en tareas largas es esa decisión. Ya no dependes de un modelo: dependes de un bucle que no puedes leer.
La mitigación no es heroica, solo hay que hacerla pronto. Herramientas simples. Y lo que produzca la ejecución —ficheros, diffs, artefactos— guardado en algún sitio tuyo, no solo dentro de la sesión. Si la respuesta a «qué hacemos cuando nos vayamos» es «rehacemos cuatro horas de estado de agente desde cero», tienes el mismo problema que venían a resolver las sesiones duraderas, solo que ahora es contractual.
Entonces
La Agents API es un buen producto que resuelve la mitad poco lucida de los agentes, a coste cero por encima de los tokens, sobre infraestructura que lleva un año recibiendo golpes. Si estás en Estados Unidos y mantienes tu propio arnés, ve a leerlo en serio: hay bastantes posibilidades de que sea mejor que el tuyo, y lo digo desde el bando de quien lo primero que quiso fue ser borde.
Si estás en Europa, apúntalo para cuando llegue la residencia de datos y sigue manteniendo tu bucle. Que es, molestamente, donde acaban últimamente muchos de estos posts.
Y si esta semana ibas a construir un arnés desde cero: no empieces por el bucle. Empieza por lo que pasa en la quinta hora.
Comentarios