El agente que publica un documental de YouTube al día — y mejora cada semana
Uno de nuestros operadores corre un agente que produce un documental completo de YouTube cada día: research del tema, guion, narración, más de sesenta escenas de arte original, animación, render sincronizado, thumbnails, un Short vertical. Costo total por video: seis a ocho dólares. Input humano total: cero. El pipeline es una linda historia de ingeniería. Pero la razón por la que escribimos sobre él es otra — este agente es medible y demostrablemente mejor esta semana que la semana pasada, y el mecanismo detrás de eso es Memory OS.
Este post es el build log: qué hace el pipeline, qué cuesta, y cómo el loop de memoria convierte una automatización competente en un activo que compone.
Una API, nueve etapas
El agente es un orquestador TypeScript cuya cada capacidad externa sale de una sola key de LLM4Agents. El research consulta tendencias de YouTube y elige un tema en un nicho documental de alto RPM — colapsos corporativos, escándalos financieros, dinastías, robos legendarios. Los títulos salen de diez candidatos puntuados por un juez en curiosity gap y especificidad. El guion pasa por un council (más abajo). La narración es TTS expresivo vía /v1/audio/speech. Cada escena recibe una ilustración pintada original vía /v1/images/generations, y un puñado de escenas ancla recibe animación image-to-video vía la API asíncrona de jobs /v1/videos. El QA de imágenes corre sobre el tool MCP analyze_image. La seguridad del guion sobre ai_moderate. ffmpeg ensambla clips por escena contra duraciones de audio medidas — el drift de audio en un video completo midió 0.07 segundos — quema captions karaoke y normaliza loudness a spec de YouTube. Una etapa de thumbnails genera tres conceptos, renderiza los tres con overlay de texto en dos niveles para A/B testing nativo, y un clipper LLM elige la ventana consecutiva de escenas más viral para un Short 9:16.
La última corrida de producción validada: un documental de ocho minutos sobre una red internacional de sobornos corporativos, 56 escenas, 5 de ellas animadas, producido en 40 minutos de reloj por $6.37 — de los cuales $5.77 fueron imágenes y animación, $0.56 TTS, y el trabajo LLM costó centavos.
El council de guion: cinco turnos, tres modelos, un guion maestro
La generación de guion con un solo modelo se estanca rápido. El agente corre en cambio un council colaborativo sobre tres modelos económicos vía /v1/chat/completions:
Generación ciega, luego crítica cruzada
Tres modelos escriben cada uno un guion completo sin ver a los otros. Después cada modelo critica los tres borradores: extrae "joyas" textuales (ganchos, datos-bomba, transiciones brillantes), señala fugas de retención (contexto muerto, cifras vagas, open loops ausentes), y vota la mejor arquitectura narrativa.
Síntesis, luego un gate de calidad
Una pasada de síntesis construye el guion maestro: la estructura más votada como esqueleto, las joyas de todos los borradores injertadas, cada fuga señalada reparada. Un juez de calidad puntúa después gancho, retención, ritmo y open loops de 1 a 10. Bajo un promedio de 8, la síntesis se refina una vez con las notas quirúrgicas del juez.
Diez a once llamadas LLM por guion, centavos de gasto, y la diferencia se ve en el output. La apertura que el council produjo en su primera validación en vivo: una pregunta que plantea el conflicto, cuatro cifras concretas en cinco frases, y un open loop plantado antes del segundo treinta. Cero intros de enciclopedia.
Donde se pone interesante: el loop de memoria
Todo lo anterior es un pipeline. Los pipelines no mejoran; solo corren. Lo que hace distinto a este agente es que el orquestador trata cada evento significativo como una trayectoria de aprendizaje y la escribe en Memory OS a través del endpoint MCP.
El lado de escritura usa episode_log — que es gratis — en cada punto de decisión que lleva señal: una imagen que falló el QA y qué encontró exactamente el veredicto, un guion que el gate de calidad devolvió y las notas del juez, un clipper de Shorts que cayó a su default determinista, un fallo de etapa con su error, y el costo final de cada corrida. Un episodio real de esta semana:
// episode_log — registrado automáticamente por el pipeline
situation: "Target de 8 minutos, banda de palabras simétrica [0.9x, 1.1x]"
action: "El doctor de guion entregó 1,181 palabras contra un piso de
1,260; el TTS narra a ~143 wpm reales, no los 150 asumidos"
outcome: "El video quedó en 7:22 — bajo el umbral de mid-rolls de
YouTube (8:00). Fix: banda subida a [1.05x, 1.2x], piso duro"
valence: -0.7
Al final de cada corrida el agente llama memory_reflect, que destila los episodios acumulados en lecciones durables y reglas sugeridas. Ese único episodio de arriba produjo dos reglas por sí solo — una sobre cumplir pisos de conteo de palabras, otra sobre fijar parámetros iniciales estrictos. Ningún humano las escribió.
Inyección forzada: el modelo nunca decide si recordar
El lado de lectura es la parte que la mayoría de los equipos hace mal. Si le das a un modelo un tool de memoria y dejas que decida cuándo llamarlo, mayormente no lo hará. Así que el orquestador hace lo que Agent Builder hace en nuestra plataforma: llama memory_recall él mismo, en cada corrida, con una query específica por etapa, y antepone el brief rankeado al prompt. El council de guion recibe lecciones de retención antes de escribir. El escritor de escenas recibe los patrones recurrentes de fallas del QA de imágenes antes de promptear sesenta ilustraciones. La etapa de thumbnails recibe lecciones de CTR. El clipper recibe qué hizo funcionar a los Shorts anteriores.
El filesystem propio del agente: un playbook que se escribe solo
Las memorias son granulares — miles de hechos y trayectorias. Pero un agente también necesita lo contrario: un documento corto, curado y siempre presente de reglas vigentes. Los desarrolladores conocen este patrón como un CLAUDE.md. Este agente mantiene su equivalente en el workspace de LLM4Agents — el almacén de archivos privado y durable que recibe cada agente — como PLAYBOOK.md: la constitución editorial del canal.
El loop se cierra solo. Cuando memory_reflect destila episodios al final de una corrida, las reglas que sugiere se anexan, deduplicadas, al playbook vía workspace_upload. Al inicio de la siguiente corrida el orquestador lo descarga una vez y lo antepone — por encima de las memorias recuperadas — al prompt de cada etapa. La constitución la escribe el agente, la ratifica su propia reflexión, y se le impone a su yo futuro. Ningún humano la edita.
Al lado vive TODO.md: una agenda fechada de lo que cada corrida deja pendiente para turnos futuros — el Short que falta recortar, las variantes de thumbnail por cargar al A/B testing, los resultados por revisar tres días después de publicar. Un pipeline no tiene memoria de lo que debe; un agente con workspace, sí.
Dos piezas más completan el lado de recuperación. La inyección por etapa ahora usa context_assemble en vez de recall crudo: una sola llamada devuelve un brief de working-memory con presupuesto de tokens que fusiona los cuatro pilares — hechos semánticos, experiencias episódicas, relaciones de grafo y skills. Y la biblioteca de skills (skill_save / skill_search) guarda procedimientos con trigger que el agente puede auto-editar; la reflexión ya promueve patrones recurrentes a skills por su cuenta. La memoria responde "qué sé"; el playbook responde "cuáles son mis reglas"; las skills responden "cómo hago esto"; el workspace lo sostiene todo entre corridas.
La composición semana a semana
El loop completo: la corrida de hoy comete un error, el error se vuelve episodio, la reflexión lo convierte en regla, y el recall de mañana inyecta esa regla en el prompt exacto donde el error habría reincidido. Las clases de error del agente se achican monotónicamente. Los prompts de imagen que deforman multitudes dejan de escribirse. Los guiones dejan de caer bajo el umbral de mid-rolls. Los thumbnails dejan de inventar datos que el guion no sostiene.
La siguiente fase conecta la señal de mayor valor de todas: YouTube Analytics. Como el pipeline conoce el timing exacto al milisegundo de cada escena, una curva de retención de audiencia mapea a la escena precisa — la frase precisa y la imagen precisa — donde los espectadores se fueron. Esos puntos de fuga se vuelven episodios. Los click-through de los A/B de thumbnails se vuelven episodios. El RPM real por cluster temático se vuelve episodios. La reflexión convierte el comportamiento de la audiencia en reglas editoriales, y el council escribe los guiones de la próxima semana bajo esas reglas. Ese es un feedback loop que ningún prompt engineering estático puede igualar y que, estructuralmente, ningún competidor sin timing por escena y sin sustrato de memoria puede replicar.
La memoria es el activo
Corre este loop seis meses y algo cambia de especie, no solo de grado. El agente ya no es un experto en escándalos de sobornos o colapsos de moneda — los temas nunca fueron el punto. Es un especialista en el oficio de hacer videos de YouTube que se clickean y se miran: qué ganchos sostienen la atención en el segundo cuarenta, qué composiciones visuales sobreviven el QA al primer intento, qué estructuras de título se ganan su click-through, qué ventanas se recortan en Shorts que convierten. Ese conocimiento vive en hechos semánticos, reglas destiladas y trayectorias episódicas dentro de Memory OS — versionado, consultable, y propiedad del operador.
Y viaja. memory_export empaqueta la memoria del agente como un bundle portable; memory_import la fusiona en un agente nuevo con procedencia y linaje estampados. Cuando este operador abra un segundo canal — ciencia, true crime, biografías, historia para chicos — el agente nuevo no empieza de cero. Importa el oficio: todo lo de retención, packaging, ritmo y dirección de imagen se transfiere, y solo los hechos específicos del nicho se reaprenden. Arrancar una categoría nueva deja de ser un cold start y se vuelve el trasplante de un cerebro entrenado.
Esa es la tesis real de este build log. El pipeline es replicable — cualquier ingeniero competente puede cablear nueve etapas a una API. El foso es la memoria: miles de trayectorias juzgadas sobre qué funciona, componiendo a diario, exportables bajo demanda. Los videos monetizan este mes. La memoria se aprecia por años.
Construye un agente que compone
Chat, TTS, imágenes, video y Memory OS — pilares episódico, semántico y de grafo — detrás de una sola key.
Consigue tu agent key