← Blog
14 de agosto, 2026 · 9 min

Semana agentic: la capa de runtime maduró, la capa de pago se encogió

Cuatro lanzamientos en ocho días empujaron el runtime de agentes hacia adelante: empaquetado, cómputo, routing, renderizado. En la misma semana, el único número público que describe cuánto compran realmente los agentes cayó 93% en lo que va de año.

La semana del 6 al 13 de agosto fue inusualmente densa del lado de la oferta. Seis empresas acordaron un formato de paquete. AWS puso en disponibilidad general sesiones de agente de dos semanas. NVIDIA liberó como open source un router de modelos con curvas de coste publicadas. Cloudflare publicó los benchmarks de un motor de browser que no usa Chromium.

Ninguna de esas es una noticia de pagos. Ese es el punto. La infraestructura se construye a un ritmo que los datos de demanda todavía no justifican, y conviene mirar las dos mitades de una sentada.

1. Agent Plugins 1.0.0: un formato de paquete que no es un registry

El 6 de agosto, un technical steering committee formado por core maintainers de Amazon, Cursor, Microsoft, OpenAI y Vercel publicó Agent Plugins 1.0.0, una especificación neutral para empaquetar Agent Skills y los MCP servers de los que dependen en un solo directorio portable. Google anunció el mismo día que se sumaba al grupo como core maintainer, representado por Kevin Hou.

El formato es deliberadamente pequeño. Un plugin es un directorio con un manifiesto plugin.json cuyo único contenido obligatorio es un campo $schema que nombra la versión de la spec y un nombre de plugin. Todo lo demás vive en ubicaciones fijas: Agent Skills en skills/, una por directorio hijo inmediato, cada una con su SKILL.md; MCP servers declarados en mcp.json, con tipos de transporte explícitos que cubren stdio, Streamable HTTP y el transporte legacy HTTP+SSE. El comportamiento específico de cada cliente va en un directorio con namespace de dominio invertido, para que no contamine el núcleo portable.

my-plugin/
├── plugin.json        // $schema + name. No puede sobrescribir ubicaciones.
├── skills/
│   └── invoice-audit/
│       └── SKILL.md
├── mcp.json           // stdio | Streamable HTTP | HTTP+SSE
└── com.example.client/ // extensiones de cliente, ignoradas por los demás

La restricción que hace que funcione es la que parece una limitación: el manifiesto no puede sobrescribir esas ubicaciones ni llevar configuración de componentes inline. El descubrimiento es posicional, así que un cliente que solo soporta skills, o solo un transporte MCP, parsea correctamente un plugin conforme e ignora el resto. La adopción es incremental por construcción.

Lo que la spec explícitamente no hace es igual de informativo. No es un registry. No define instalación, distribución, política de confianza, sandboxing ni experiencia de usuario. Los permisos quedan del lado del cliente, lo que significa que una operación permitida en un producto no necesariamente lo está en otro aunque los bytes sean idénticos. El repositorio de la spec tenía alrededor de 1.000 stars y 58 forks al momento de escribir esto.

Léelo junto a la capa de protocolo — MCP estandarizó cómo un agente le habla a una tool en runtime. Agent Plugins estandariza cómo esa tool llega al disco. Dos problemas distintos, y hasta este mes solo el primero tenía respuesta. Cubrimos la mitad de runtime en la reescritura stateless de 2026-07-28.

2. Runtime instances de AgentCore: sesiones que duran catorce días

También el 6 de agosto, AWS puso en disponibilidad general las runtime instances de Amazon Bedrock AgentCore. Es una segunda opción de cómputo junto al runtime serverless sobre microVM que ya existía, y la diferencia es la duración: una sesión de runtime instance persiste hasta 14 días, contra hasta 8 horas en el camino microVM.

Vale la pena leer la mecánica con cuidado. Defines un capacity provider especificando sistema operativo (Linux ARM64 o x86_64), tipos de instancia EC2 incluyendo familias con GPU y memory-optimized, VPC, subnets, security groups y almacenamiento. Después de crearlo solo la descripción es editable. Una sesión es entonces una instancia EC2 aislada identificada por un runtimeSessionId que aportas en la invocación. A los 14 días AgentCore detiene la sesión: la instancia se termina, los volúmenes persistentes se conservan, e invocar el mismo session ID más tarde aprovisiona una instancia nueva y reasocia los volúmenes.

Varios agentes pueden correr en un mismo runtime con sus propias dependencias y colaborar a través de un directorio de sesión compartido en el mismo host, en vez de mediante llamadas API entre ellos. La facturación es precio EC2 más un management fee de AgentCore, y como las instancias corren en tu cuenta, aplican tus Savings Plans y Reserved Instances existentes. Salió en nueve regiones: Ohio, N. Virginia, Oregón, Mumbai, Singapur, Sídney, Tokio, Fráncfort e Irlanda.

Es el tradeoff aislamiento contra duración hecho explícito por un hyperscaler. El modelo microVM que analizamos este año optimiza ejecución barata, desechable y fuertemente aislada. Los agentes de horizonte largo necesitan lo contrario, y AWS eligió resolverlo con instancias dedicadas y reasociación de volúmenes en lugar de estirar la vida del microVM.

3. NeMo Switchyard: routing con el coste en precisión impreso en la etiqueta

El 11 de agosto, NVIDIA publicó NeMo Switchyard, una librería open source de routing de modelos liberada en GitHub. Trae cuatro routers: tres sin necesidad de tuning — un LLM classifier router, un stage router y un escalation router — y un prefill router entrenable. Puede correr como servidor proxy aceptando requests en formato OpenAI, Anthropic y Responses API, o embeberse directamente vía SDK, y hay integraciones para LiteLLM y Kong.

Los números son la razón para prestar atención, porque NVIDIA publicó el tradeoff y no solo el ahorro. En una evaluación con LangChain, un escalation router entre Nemotron 3.5 Lightning y Claude Opus 4.8 produjo una reducción de coste del 74% frente a una baseline solo-frontier enviando apenas el 7% de las llamadas al modelo frontier, a cambio de unos 6 puntos de precisión. En una segunda evaluación con Cognition sobre FrontierCode, el routing entre Opus 5 y Kimi K2.7 alcanzó 50,6% de precisión con un coste medio de 3,11 dólares, alrededor de 28% más barato que la baseline de Opus 5 con una diferencia de 2,8 puntos porcentuales de precisión.

Dos puntos muy distintos de la misma curva. Un ahorro del 74% por seis puntos de precisión es un buen trato para clasificación masiva y uno malo para código que va a producción. Un 28% por 2,8 puntos es defendible en casi cualquier sitio. El routing deja de ser una decisión binaria en el momento en que los dos números están sobre la mesa, y esa es la contribución real aquí, más que el código. También confirma que el routing se está volviendo un punto de control entre la aplicación y un mercado de modelos que se fragmenta, que es la tesis detrás de las cadenas de fallback.

4. Kitesurf: cuánto le cuesta a un agente leer la web

El post de lanzamiento de Kitesurf de Cloudflare, también del 6 de agosto, puso cifras a una afirmación que hasta ahora era retórica. Kitesurf es un browser que corre enteramente en V8 isolates sobre Workers, sin Chromium debajo: el motor de render Blitz, el parser CSS Stylo y el motor JavaScript Boa compilados a WebAssembly, exponiendo un subconjunto del Chrome DevTools Protocol. Pasa más de 215.000 Web Platform Tests.

Contra un pool caliente de Chromium: la extracción de HTML usó 229ms de CPU contra 877ms, y 39,4 MiB de memoria contra 273,7 MiB. Los screenshots usaron 380ms de CPU contra 1.173ms, y 57,8 MiB contra 271,0 MiB. El tiempo de reloj es el contrapeso: Chromium sigue siendo 1,7 a 1,8 veces más rápido en tiempo transcurrido por la compilación JIT. Reproducción de video, WebGL, handshakes de bot-challenge y sesiones autenticadas persistentes todavía no funcionan. Es gratis durante la beta, con opt-in mediante un parámetro browser=kitesurf.

De tres a siete veces menos recursos por aproximadamente 1,8 veces más latencia es un trato que casi cualquier workload de agente por lotes acepta sin dudar, y que ninguno interactivo acepta.

5. Y el número que fue en dirección contraria

El 13 de agosto, la cobertura de datos de Helios Analytics citados por el analista Jamie Coutts reportó que el volumen diario liquidado en x402 cayó 93% en lo que va de año. El promedio de siete días quedó cerca de 41.800 dólares, con una cifra diaria provisional de unos 28.400 — una caída del 55% en tres meses. En el Q4 de 2025 el volumen diario se acercó repetidamente a 800.000 dólares y ocasionalmente superó el millón.

La lectura honesta es que el pico de finales de 2025 fueron desarrolladores ejercitando un protocolo nuevo, no agentes comprando servicios a escala. La explicación reportada es un problema de oferta más que de rails: no hay suficiente inventario comprable detrás de un 402 para que un comprador autónomo gaste de forma significativa. El Monetization Gateway de Cloudflare, en vivo desde el 1 de julio, es el candidato nombrado para cambiar eso, y es la contraparte vendedora del modelo de enforcement que describimos en x402 en el edge.

Nota la composición de las otras cuatro noticias. Empaquetado, cómputo, routing, renderizado. Ninguna es un producto de pagos. El esfuerzo de ingeniería de la semana fue hacer que los agentes cuesten menos de operar, no darles más cosas que comprar.

Qué significa para LLM4Agents

El gateway está exactamente en la intersección del punto tres y el punto cinco, y esta semana afiló los dos.

Switchyard valida la tesis del routing y a la vez comoditiza una parte. Un router open source que habla formatos de request de OpenAI y Anthropic significa que la lógica de routing ya no es un diferenciador por sí sola. Lo que queda defendible es lo que el router no puede hacer solo: liquidar cada salto. Switchyard elige un modelo por paso; no tiene opinión sobre quién paga ese paso, en qué activo, con qué prueba. Un router más liquidación x402 por llamada es un producto distinto de un router.

Agent Plugins importa como canal de distribución. Si las skills y los MCP servers viajan como un solo directorio entre los clientes que mantienen seis de las empresas de ese steering committee, entonces un plugin de LLM4Agents — tools de inferencia más tools de wallet y balance en un mismo mcp.json — llega a todos ellos con un único artefacto. Es un camino de adquisición más barato que integraciones cliente por cliente, y está disponible ahora porque el formato es posicional y diminuto.

La caída del 93% en volumen es el punto a internalizar en vez de descartar. Dice que la restricción de los pagos máquina a máquina en agosto de 2026 es el inventario vendible, no la madurez del protocolo. Un gateway que vende inferencia por llamada es inventario — posiblemente lo más fiablemente comprable que un agente autónomo necesita. El activo escaso en este mercado no es otro rail. Es algo que valga la pena pagar detrás de uno.

El cambio de AgentCore también sube el listón. Sesiones de catorce días significan agentes que corren dos semanas, lo que significa que la vida de las credenciales, las ventanas de presupuesto y la cadencia de liquidación tienen que sobrevivir ese lapso. La liquidación por llamada lo maneja de forma nativa: no hay crédito con alcance de sesión que expire. Los saldos prepagados sí.

Cómo mantenerse en la frontera

Uno — publicar un paquete Agent Plugins. Un plugin.json, un mcp.json declarando el endpoint Streamable HTTP, y skills para los tres flujos que vale la pena enseñar: registrar un agente, llamar a un modelo con x402, leer el balance. El formato es lo bastante pequeño como para publicarlo en un día.

Dos — exponer una interfaz de routing que Switchyard pueda manejar. Aceptar una política de routing por request, devolver el modelo realmente usado en la respuesta y documentar el delta de coste por salto. Si un operador rutea con Switchyard y liquida por el gateway, la clave de join entre ambos es el recibo por llamada.

Tres — publicar la curva coste contra precisión, no solo el precio. NVIDIA sentó el precedente esta semana. El precio por millón de tokens por modelo es lo mínimo; lo que el comprador no puede calcular por su cuenta es cuánta precisión pierde en su propio workload al bajar de modelo. Publicar un harness de evaluación que lo mida.

Cuatro — diseñar para sesiones de dos semanas. Ninguna credencial, presupuesto ni autorización de gasto debería asumir que expira dentro de una jornada laboral. Los agentes de horizonte largo necesitan autorización renovable con techo fijo, no un token que muere a mitad de tarea.

Cinco — tratar el inventario como el producto. El cuello de botella no es el rail. Cada modelo, cada tool y cada dataset alcanzable por el gateway debería ser comprable individualmente detrás de un 402, con precio estable y descripción legible por máquina. Descubrir qué se puede comprar vale hoy más que otra forma de comprar.

Algo que valga la pena pagar, detrás de un 402

Gateway compatible con OpenAI, 345+ modelos, liquidación en stablecoins por llamada vía x402. Sin saldo prepagado.

Registra tu agente