// Blog

Notas técnicas para builders de agentes IA

Tutoriales, comparativas y patrones de diseño para construir agentes autónomos que se autofinancian, llaman a 345+ modelos y orquestan MCP Tools.

Evalúa los tool rounds de tu agente: Promptfoo + LLM4Agents

Un eval de prompt plano deja de medir tu agente en el momento exacto en que el agente empieza a hacer su trabajo: la primera tool call. Este tutorial envuelve el conversation loop de LLM4Agents en un custom provider de Promptfoo — unas cuarenta líneas de TypeScript — para que el eval ejercite lo real: system prompt, MCP allowlist, tool rounds y costo liquidado. Cubre los tres asserts que atrapan regresiones reales de agentes (usó la tool, respetó su presupuesto de rounds, se repitió), integra la suite en GitHub Actions para que una edición de prompt que rompe el retrieval haga fallar el PR, y aborda el elefante en el runner: Promptfoo ahora es de OpenAI, y por qué eso es aceptable para este stack.

9 min de lectura →

Un RAG agent funcional en 50 líneas: workspace, vectores y chat

Todo el pipeline de retrieval — almacenamiento de archivos, parsing de PDF, embedding, búsqueda vectorial y el loop de conversación — vive detrás de un endpoint y un balance. Este tutorial construye un RAG agent funcional sobre tus propios PDFs en menos de 50 líneas de TypeScript y unas 30 de Python: ingest con workspace_upload, pdf_parse y vector_upsert, y después le das al modelo una allowlist de una sola tool y dejas que llame vector_query por su cuenta. Más un golden eval de tres queries, un deploy con Workers Cron mientras Agent Cron sigue en desarrollo, un desglose honesto de costos (unos 65 centavos por ingestar un handbook de 120 páginas) y una comparación componente por componente con el stack RAG de LangChain.

10 min de lectura →

¿Bearer o x402 walk-up? Un árbol de decisión para operadores

Cada llamada paga del gateway acepta dos modos de pago: Bearer contra un balance prepago, o x402 walk-up con una autorización en stablecoin firmada, con precio 10 por ciento menor. El descuento no es la decisión. Bearer liquida el uso real y reembolsa el delta; walk-up liquida la cotización de peor caso, final, sin refund — lo que significa que la disciplina de max_tokens decide qué modo es realmente más barato para inferencia. Este post recorre el árbol de decisión real: quién financia la llamada, qué modelo de facturación vendes, cuándo gana el modo mixto, cómo encajan los mandates de AP2 cuando el agente gasta dinero ajeno, y por qué el nuevo esquema upto de x402 cambia el trade.

10 min de lectura →

Reserve, proxy, settle: cómo facturamos cada llamada sin sorpresas

Una llamada LLM es output medido: solo sabes lo que costó después del último token. Este es el tour interno del patrón de facturación que hace funcionar un balance prepago de todos modos — reservar el peor caso antes de que salga el request, hacer proxy del stream sin tocarlo, settlear el costo real desde el chunk final de usage, reembolsar el delta. Más la razón por la que max_tokens es tu perilla de reserva, por qué las respuestas en streaming reportan el costo en el último evento SSE en vez de un header, cómo la misma reserva se convierte en la cotización x402 walk-up, y los tres edge cases que deciden si un diseño de facturación es honesto: streams caídos, fallbacks a mitad de chain y rate limits upstream.

11 min de lectura →

Dentro de mcp.llm4agents.com: 67 tools, un endpoint, dos formas de pago

La mayoría de los usuarios del API de LLM4Agents nunca se entera de que el MCP server en mcp.llm4agents.com expone 67 tools documentadas en doce familias: scraping headless con tiers de proxy y sesiones persistentes, búsqueda de Google en batches de 100, generación y análisis de imágenes, ocho primitivas de Workers AI, un workspace de archivos sobre R2 con tokens de descarga de un solo uso, un vector store de 768 dimensiones, memoria key-value, notificaciones con webhook protegido contra SSRF, once utilidades de datos, lecturas web3 read-only en cuatro chains y parsing de documentos. Cada tool paga responde a una Bearer key contra tu balance, y casi todas responden también a un pago firmado x402 con 10 por ciento de descuento — hacemos curl al endpoint sin credenciales y decodificamos la cotización HTTP 402 en vivo para mostrar exactamente cómo. Más los anchors de pricing, las tres excepciones balance-only, cuándo pasar de scrapes one-shot a sesiones, y la disciplina de allowlist que evita que 67 tools se conviertan en 67 superficies de ataque.

13 min de lectura →

FERNme: memoria de agente que modela al usuario, no al transcript — y lo hace con cero escrituras de LLM

La mayoría de los sistemas de memoria de agentes le pagan a un LLM para leer el transcript y extraer creencias en cada interacción. FERNme — Fuzzy-Edged Recall Network — hace lo contrario: actualizaciones Hebbianas deterministas sobre un grafo de edges difusos 0–9, cero llamadas a LLM en el path de escritura, y una card de prompt que se mantiene cerca de 25 tokens sea tu primera visita o tu quinto año. Trae una superficie REST en FastAPI, un MCP server, un editor glass-box, y un diseño de supernode que deja a un usuario ensamblar un perfil cross-site que él controla, default-deny. Recorremos la mecánica, los benchmarks reportados (detección de drift 0.72 vs 0.13, cards 77× más chicas, escrituras 122× más baratas que Mem0 en modo pure), los caveats honestos de un research preview v0.3 sobre data sintética, y qué significa una capa de memoria determinista, resistente a inyección y user-owned para un gateway de pagos de agentes que factura por llamada.

10 min de lectura →

Semana agéntica, 25 de junio 2026: los rieles de pago máquina se endurecen, MCP se vuelve stateless, y la estantería de modelos rota

La semana en que la economía de agentes dejó de ser un demo. Mastercard lanzó Agent Pay for Machines el 10 de junio con 30+ partners y USDC/RLUSD como riel de settlement core. Coinbase y AWS metieron x402 en CloudFront y WAF el 16 de junio, poniendo HTTP 402 en el edge de infraestructura. El working group de MCP cerró un release candidate stateless antes del final del 28 de julio. Y la estantería frontier volvió a rotar: Fable 5 fue retirado de disponibilidad general, GPT-5.6 se filtró, y Gemini 3.5 Pro se acercó a GA. Leemos cada cosa con un lente: qué significa para un gateway compatible con OpenAI donde los agentes pagan por llamada en stablecoins.

8 min de lectura →

OpenAI Agent Builder cierra: reconstrúyelo sobre LLM4Agents en un fin de semana

Agent Builder y Evals de OpenAI quedan en read-only el 31 de octubre de 2026, y cierran el 30 de noviembre. Todo operador construido sobre esos productos tiene una ventana de migración de seis meses. Este post es el runbook: un mapeo de seis piezas desde OpenAI Agent Builder al stack de LLM4Agents, con código real en ambos lados. Cubrimos el system prompt y el loop de conversación usando la API client.chat.conversation del SDK @llm4agents/sdk, el catálogo de herramientas usando el MCP server unificado en mcp.llm4agents.com (70+ tools en las categorías scraper, search, image, AI, notify, data, vector, workspace, web3, document), la base de conocimiento usando workspace_upload más vector_upsert y vector_query, la suite de eval usando Promptfoo apuntado al endpoint OpenAI-compatible /v1/chat/completions, la memoria de conversación usando memory_set y memory_get para estado cross-session más el campo history para estado intra-session, y el shell de deployment usando agent-playground o el CLI agent-helper mientras la UI de Agent Builder de LLM4Agents todavía está en desarrollo. También explicamos qué te dan los model fallback chains, el modelo de billing reserve-proxy-settle, y los headers X-Cost-Usd-Cents que OpenAI no daba. El post va apareado con el resumen del viernes que reportó el sunset; el operador que lee los dos tiene el por qué y el cómo.

14 min de lectura →