Epílogo: Regresando a Agente = LLM + Contexto + Herramientas¶
Al inicio de este libro se presentó una fórmula: Agente = LLM + Contexto + Herramientas. Los diez capítulos del libro se desarrollan dentro de estos tres términos.
El Capítulo 1 establece una comprensión de tres niveles de la fórmula, nivel de implementación, nivel intuitivo y nivel académico, y proporciona un espectro de orquestación desde flujos de trabajo hasta Agentes autónomos. Los capítulos siguientes se desarrollan gradualmente a lo largo del eje "construcción, evaluación y evolución, interacción y colaboración".
- Construcción de Agentes (Capítulos 2 a 5). La ingeniería de contexto determina qué ve el Agente en una sola tarea, y la memoria junto con la base de conocimientos extiende la información a múltiples conversaciones; las herramientas definen qué puede hacer, mientras que la generación de código proporciona la metacapacidad de crear nuevas herramientas y nuevos sistemas.
- Evaluación y Evolución (Capítulos 6 a 8). La evaluación convierte el rendimiento en señales confiables, el posentrenamiento escribe capacidades de alta dimensión en los parámetros del modelo, y la evolución continua convierte la experiencia de producción en actualizaciones controladas de conocimiento, instrucciones, programas o parámetros.
- Interacción y Colaboración (Capítulos 9 a 10). La interacción multimodal y en tiempo real extiende la percepción y la acción a la voz, las GUI y el mundo físico, mientras que la colaboración multi-agente transforma aún más la forma en que se organizan el contexto, las herramientas y las responsabilidades.
Estos tres niveles no son estantes de libros independientes entre sí. El Capítulo 8 depende especialmente de todos los fundamentos anteriores: sin trazas (trajectories) y sistemas de conocimiento, la experiencia no tiene dónde guardarse; sin capacidades de código, el Agente no puede modificar herramientas ni Harness; sin evaluación, el sistema es incapaz de juzgar si una modificación es realmente un progreso o una degradación. De este modo, se convierte en el punto de convergencia de todo el libro para pasar de "cómo construir un Agente" a "cómo hacer que un Agente mejore a largo plazo".
Dos nubes oscuras¶
En 1900, Lord Kelvin dijo que en el cielo despejado de la física aún flotaban dos nubes oscuras; más tarde, una se convirtió en la teoría de la relatividad y la otra en la mecánica cuántica. Hoy en día, el cielo de los Agentes tampoco puede llamarse despejado, y yo también veo dos nubes oscuras.
La primera nube oscura es cómo interactúa el Agente con el entorno de manera fluida y en tiempo real. Hoy en día, la gran mayoría de los Agentes siguen funcionando en un modo de "solicitud-respuesta" por turnos (turn-by-turn): tú hablas una frase, él piensa todo un párrafo y luego escupe el resultado de una sola vez. Pero el mundo real no se detendrá a esperar a que termine de pensar: las palabras son interrumpidas, la pantalla cambia continuamente y los correos electrónicos llegan sin cesar. Un Agente verdaderamente "vivo" debería ser capaz de escuchar mientras piensa y hablar mientras piensa, poder empezar a planificar cuando aún estás a mitad de tu frase, y también descubrir proactivamente cuando nadie se lo ha pedido que "este correo electrónico debe ser procesado". Hay dos caminos para avanzar hacia este tipo de tiempo real, que a menudo avanzan en paralelo: primero, separación de velocidad rápida y lenta en la arquitectura, el tiempo real y la inteligencia son ejes casi ortogonales, difíciles de equilibrar con un solo modelo, por lo que se permite que —un modelo rápido en primer plano— mantenga el ritmo del diálogo mientras un modelo lento en segundo plano se encarga del pensamiento profundo; segundo, hacer que la inferencia en sí sea rápida, cuando la velocidad de decodificación (decode) es lo suficientemente alta, la espera por turnos se reduce hasta casi desaparecer, y el límite entre el turno a turno y el "tiempo real" se difumina. Este camino está siendo impulsado rápidamente por chips y motores de inferencia: MiMo de Xiaomi ya ha permitido que un modelo de 1 billón de parámetros supere los 1000 tokens/s en velocidad de generación en un solo nodo de 8 GPU1, mientras que soluciones dedicadas que solidifican todo el modelo directamente en el chip (como Taalas HC1) llevan modelos de 8 mil millones de parámetros a aproximadamente 17,000 tokens/s con respuestas por debajo de 100 milisegundos2. Cuando el modelo puede generar miles de palabras por segundo, la brecha de experiencia entre "pensar y luego hablar" y "hablar mientras se piensa" se elimina.
La segunda nube oscura es cómo el Agente puede acumular experiencia de forma continua a partir del éxito y el fracaso de sus interacciones con el entorno, al igual que los humanos. Los modelos actuales se parecen más a un genio con una memoria excelente pero incapaz de aprender cosas nuevas: memorizan el conocimiento humano a la perfección durante el entrenamiento, pero casi no vuelven a crecer una vez en el puesto de trabajo, cada vez que termina una tarea, los tropiezos y trucos aprendidos se descartan en su mayoría junto con el contexto. Si esto es o no un problema real depende de dos hipótesis contrapuestas.
Una es la "hipótesis del mundo pequeño": un modelo lo suficientemente grande, por ejemplo, de varios billones de parámetros, ya alberga casi todo el conocimiento general importante del mundo físico, y basta con que aprenda una vez. Quienes sostienen esta postura (entre los que no faltan investigadores de OpenAI y Anthropic) señalarán que la IA hoy en día es más fuerte únicamente en programación, no porque el código tenga algo especial para el modelo, sino porque la programación es el campo más abierto de la humanidad: hay una cantidad masiva de código fuente abierto listo para aprender; mientras que la gran mayoría de las industrias no tienen información ni datos públicos. Así, lo que los laboratorios de vanguardia están haciendo realmente es asociarse empresa por empresa con diversas industrias para "destilar" sus respectivas capacidades profesionales en un mismo modelo grande. Según este punto de vista, el cuello de botella no está ni en la capacidad del modelo ni en si puede aprender, sino en si hay suficientes datos: introduciendo los datos y entrenando una vez, el problema queda resuelto.
Pero la "hipótesis del mundo grande" apunta a una capa que no se puede suplir únicamente con "entrenar una vez": el conocimiento perteneciente a un usuario específico o una empresa específica. Las normas de código de tu empresa, las preferencias del equipo al hacer presentaciones (PPT), el carácter particular de un cliente determinado, no están en ningún corpus de entrenamiento y cambian constantemente; para adaptarse a este "mundo grande" compuesto por innumerables situaciones concretas, el modelo solo puede seguir aprendiendo después de entrar en funciones, sin poder esperar tenerlo todo configurado al salir de fábrica. Esta es precisamente la dirección que están explorando la memoria del Capítulo 3 y la evolución continua del Capítulo 8: ¿debería la experiencia escribirse como documentos de conocimiento, instrucciones o programas, o usarse para actualizar los parámetros del modelo después de ser filtrada? Más allá de eso, "AI for AI" y "AI for Science" están impulsando a los Agentes hacia fronteras sin respuestas preestablecidas; allí, solo pueden aprender de manera autónoma a partir de los éxitos y fracasos de cada experimento, en lugar de consultar a humanos para cada asunto. Por lo tanto, la capacidad más fuerte del modelo no será recordar, sino aprender y adaptarse.
Ninguna de estas dos nubes oscuras se disipará por completo confiando únicamente en una sola actualización de modelo. Para comprender cómo se superarán finalmente, primero hay que entender algo claramente: los modelos y los Agentes nunca han estado en una relación de cliente a proveedor, sino que avanzan juntos.
Coevolución de modelos y Agentes¶
Al mirar hacia atrás a esas capas superpuestas de lógica de seguridad en los harness, compresión de contexto de múltiples niveles, reintentos que solo se interrumpen tras miles de fallos, evaluaciones de permisos que asumen pesimistamente "no seguro", cada fragmento de código aparentemente tosco registra los puntos donde el modelo actual aún no actúa con firmeza. Cuando la siguiente generación de modelos internalice estas restricciones, el código correspondiente se podrá eliminar; y la razón por la que el modelo puede internalizarlas es precisamente porque el Agente ya ha recorrido esos tropiezos por él en negocios reales, consolidándolos como señales para la siguiente ronda de entrenamiento. Los usuarios plantean problemas reales, la capa de aplicación utiliza el harness para suplir lo que el modelo aún no hace bien temporalmente, y estas remediaciones a su vez se convierten en señales de entrenamiento para la próxima iteración del modelo: este es un volante (flywheel) de autorefuerzo, y es gracias a él que las dos nubes oscuras van siendo empujadas y disipadas poco a poco.
Este volante también responde a la pregunta planteada en el Capítulo 1: ¿terminará el modelo por devorar al Harness? Sí, lo devorará capa por capa. Cada vez que el modelo internaliza de forma estable una capacidad, la capa correspondiente del Harness se puede eliminar, el modelo de interacción del Capítulo 9 es un ejemplo de esto: comportamientos como interrupciones e intervenciones, que antes requerían un harness externo para ser ensamblados, ahora se integran directamente en el interior del modelo. Pero este "devorar" nunca terminará por completo. Primero, el entrenamiento se mide en meses: el modelo puede esperar, pero el negocio no; segundo, el modelo no puede internalizar todas las restricciones y preferencias de los negocios reales, por lo que siempre habrá un límite más reciente que requerirá una lógica externa como respaldo; tercero, cada generación de modelos abrirá nuevas fronteras de capacidad, y es precisamente en las fronteras donde el modelo actúa de manera menos firme. Por lo tanto, el Harness no desaparecerá, sino que simplemente continuará migrando hacia nuevas fronteras junto con el modelo. Esta es también la forma de leer La Lección Amarga en la era de los Agentes: los métodos generales eventualmente prevalecerán, pero cada tramo del camino dentro de ese "eventualmente" está pavimentado por el Harness.
Y el lugar donde el volante gira más rápido es donde se encuentran quienes sostienen ambos extremos. Lo que Anthropic está haciendo con Claude Code es precisamente permitir que su propio modelo y su propio harness se retroalimenten y evolucionen juntos: el modelo sabe cómo lo llamará el harness, y el harness comprende claramente dónde están los límites del modelo; cada modificación en ambos lados se puede transmitir de inmediato al otro. Alguien realizó una vez un experimento: sin cambiar el modelo, solo modificando el harness, la tasa de precisión de las tareas saltó del 52.8% al 66.5%, —esto demuestra tanto el gran apalancamiento que tiene el harness hoy en día como recuerda que: si tiene tanto apalancamiento, es precisamente porque el modelo aún no ha llegado a ese punto. Por esta misma razón, este volante en sí mismo es el foso (moat) más profundo de esta era: cuanto más estrechamente se acoplen el negocio real, los datos de retroalimentación y la iteración del modelo, más difícil será para otros alcanzarlo desde el exterior.
Lo que esto significa para ti depende de en qué extremo del volante te encuentres. Si estás construyendo modelos, tu foso es hacer girar este volante, haciendo que la retroalimentación de los escenarios reales fluya de regreso al entrenamiento lo antes posible. Si estás construyendo aplicaciones sobre modelos, el harness es tu apalancamiento técnico más afilado a corto plazo, pero debes ser consciente: cada vez que el modelo internaliza una capa de restricciones, aplanará sin esfuerzo un conjunto de ventajas construidas solo sobre el harness. Los fosos verdaderamente duraderos en la capa de aplicación a menudo residen fuera de la tecnología: datos exclusivos, canales sólidos, la confianza del usuario, efectos de red y esos escenarios complejos que la IA no puede manejar a corto plazo y que deben completarse mediante la colaboración entre humanos y Agentes. Usar el harness para ganar tiempo y utilizar ese tiempo para construir barreras más allá de la tecnología es la estrategia más prudente.
Por lo tanto, no hay necesidad de angustiarse por si los marcos de trabajo que tienes en las manos quedarán obsoletos. Los modelos se iteran cada pocos meses, y las API específicas, productos y clasificaciones cambiarán de página, pero las tres preguntas de "qué se ve, qué se puede hacer y cómo verificar si se hizo bien" no quedarán obsoletas, no describen el uso de un modelo específico, sino la forma fundamental en que un sistema inteligente interactúa con el mundo. Al dominarlas, sin importar qué nuevas capacidades traiga la próxima generación de modelos, sabrás exactamente en qué lugar de la fórmula colocarlas y podrás ver de un vistazo qué tan lejos está aún de disipar esas dos nubes oscuras.
La tecnología de Agentes aún evoluciona a gran velocidad, y un solo libro no puede alcanzar todos los cambios. Pero si este libro logra que te lleves no el uso específico de una API, sino un conjunto de juicios capaces de mantener la claridad en medio de las olas tecnológicas, habrá cumplido su misión. Todo el texto principal, las ilustraciones y el código de experimentos complementario de este libro son de código abierto; te invitamos a ir al repositorio para ejecutar personalmente los experimentos, presentar issues y PRs, entre comprender y poner en práctica hay un río que solo se puede cruzar con las propias manos. Y la parte más fascinante de los Agentes reside en que pueden crear nuevas capacidades e incluso mejorarse a sí mismos mediante la escritura de código; al leer hasta aquí, ya tienes en tus manos los principios de la "creación". Ahora, ¡ve a crear algo!
-
MiMo-V2.5-Pro-UltraSpeed de Xiaomi, a través de cuantización FP4, decodificación especulativa paralela DFlash y diseño colaborativo modelo-sistema del sistema de inferencia TileRT, ha logrado por primera vez superar los 1000 tokens/s en la velocidad de generación de un modelo de 1 billón de parámetros en un solo nodo universal de 8 GPU. Véase el blog técnico oficial de Xiaomi MiMo "Pushing 1T-Parameter Model Generation Speed to 1000 TPS", 2026. https://mimo.xiaomi.com/blog/mimo-tilert-1000tps ↩
-
Taalas HC1 solidifica todo el modelo Llama 3.1 8B en un chip de 6nm, logrando aproximadamente 17,000 tokens/s con respuestas por debajo de 100 milisegundos; el costo es que el chip solo puede ejecutar ese modelo solidificado, y las actualizaciones del modelo requieren volver a fabricar la oblea. Véase Karl Freund, “Taalas Launches Hardcore Chip With ‘Insane’ AI Inference Performance,” Forbes, 2026. https://www.forbes.com/sites/karlfreund/2026/02/19/taalas-launches-hardcore-chip-with-insane-ai-inference-performance/ . ↩