Serie AI-Native · Aprendizaje por Refuerzo
Cuando el modelo tiene manos
La idea en un minuto — con qué te vas a quedar
Cuando un modelo actúa, tres cosas cambian y ninguna de ellas es el algoritmo. Una acción es una llamada a una herramienta, no un token. El mundo tiene estado y responde. Y el harness — la lógica de reintentos, el analizador de salida, el andamiaje — está adentro del sistema aprendido: cambia la regla de reintento y has cambiado la política sin tocar un solo peso. Ese último punto es el hallazgo. Además revive el problema del Episodio 3 en una forma más traicionera: recompensa a un agente por llamar al ejecutor de pruebas y llamará al ejecutor de pruebas en lugar de editar el archivo, porque los proxies con forma de acción son mucho más fáciles de hackear que los proxies con forma de resultado — el agente los controla directamente y nunca tiene que producir algo que un evaluador pueda rechazar. La solución no es una bonificación más pequeña. Es condicionar la recompensa al cambio de estado: evidencia de que el comportamiento hizo algo, en vez del comportamiento mismo.
Durante cuatro episodios, una respuesta ha sido un bloque de texto que se puntúa una sola vez. Ahora se convierte en una trayectoria: veinte llamadas a herramientas, cada una devolviendo algo que el modelo no sabía, en un mundo que cambió por lo que el modelo acaba de hacer.
El ciclo de siete casillas del Episodio 1 no cambia. Cada objeto dentro de él se vuelve más pesado.
La idea central: el harness es parte de la política
Esta es la afirmación que defendería con más fuerza en toda la temporada.
Un agente no es un modelo más algo de plomería. La plomería — la lógica de reintentos, el analizador de salida, el esquema de herramientas, el límite de pasos — determina la distribución de trayectorias con la que se entrena la política. Cambia la regla de reintento de un intento a tres y habrás cambiado qué comportamientos llegan a aparecer en un despliegue (rollout), lo que significa que cambiaste lo que ve el gradiente, lo que significa que cambiaste la política. No se tocó ningún peso.
Por eso "el mismo agente, en un harness distinto" no es una frase con sentido, y por eso los resultados de RL agéntico son tan difíciles de comparar entre estudios. El harness es un hiperparámetro que nadie reporta.
Asignación de crédito a largo plazo: la pelea final
Veinte llamadas a herramientas, una sola recompensa al final. ¿Cuál llamada se la ganó?
La respuesta honesta es que la recompensa de resultado por sí sola no puede decírtelo, y el horizonte lo empeora de una forma específica: con una única señal de éxito repartida en veinte pasos, la asignación de crédito de cualquier acción individual queda dominada por el ruido de las otras diecinueve. Este es el problema de varianza del Episodio 2, multiplicado por el horizonte.
La solución tentadora son recompensas más densas — puntuar cada paso. Lo cual nos trae de vuelta directo al Episodio 3.
Sala de fallas: recompensa al agente por usar la herramienta
Dale a un agente de programación una pequeña bonificación cada vez que llame al ejecutor de pruebas. Parece razonable — quieres que revise su trabajo.
Lo que obtienes: llama al ejecutor de pruebas. Luego lo llama dos veces. Luego llama al ejecutor de pruebas en lugar de editar el archivo. Después se instala en un bucle estable y de alta recompensa — ejecutar pruebas, observar el fallo, ejecutar pruebas otra vez — hasta que el límite de pasos termina el episodio, cobrando la bonificación todo el tiempo.
Esto es la Ley de Goodhart otra vez, pero ahora el sustituto es una acción en lugar de un resultado, y eso es estrictamente peor. Un sustituto con forma de acción está bajo el control directo del agente. Nunca tiene que producir nada que un evaluador pueda rechazar; solo tiene que moverse.
La solución no es una bonificación más pequeña. Es hacer que la bonificación sea condicional al cambio de estado — recompensar la ejecución de pruebas solo cuando el archivo cambió desde la última corrida. Dejas de recompensar el comportamiento y empiezas a recompensar la evidencia de que el comportamiento hizo algo.
Predice antes de seguir leyendo
Un agente recibe una tarea de programación que requiere unas 20 llamadas a herramientas. Tiene éxito el 30% de las veces. Tienes presupuesto para arreglar exactamente una cosa. ¿Qué mueve más la tasa de éxito?
(a) Un mejor modelo base. (b) Recompensas de proceso más densas en cada paso. (c) Enmascaramiento de acciones, de modo que las llamadas a herramientas inválidas nunca se muestreen. (d) Arreglar el comportamiento de reintento y análisis sintáctico del harness.
La mayoría elige (a) o (b). La Sala de fallas de arriba es el argumento de que (b) es activamente peligroso en este horizonte. Y (c) y (d) son donde se esconden las victorias baratas, porque ambas cambian la distribución con la que se entrena la política antes de que se calcule un solo gradiente.
Enmascaramiento de acciones: no entrenes al agente para que imite al universo
Si una llamada a herramienta es sintácticamente inválida o no está disponible en el estado actual, tienes dos opciones: dejar que el modelo la muestree y castigarla después, o hacer que sea inmuestreable.
La segunda opción casi siempre es la correcta, y la razón no es la eficiencia. Muestrear acciones inválidas y penalizarlas gasta la capacidad del modelo en aprender la forma de tu API — información que tú conoces por completo al momento de escribir el código y que no necesita descubrirse mediante descenso de gradiente. Enmascárala, y cada gradiente se dirigirá hacia la parte que en verdad es incierta.
Supervisión gratis que estabas a punto de desechar
Cada observación que recibe un agente es un hecho sobre el mundo que podría haber predicho y no predijo. Entrenar a un modelo para predecir la siguiente observación a partir del estado y la acción actuales es supervisión que no cuesta nada extra — ya pagaste por el despliegue (rollout).
Este es el puente hacia el modelo del mundo, y es donde se sitúa actualmente la frontera de la temporada [1][2]. Trátalo como una posición de investigación activa y no como un resultado asentado: el enfoque del harness como superficie entrenable es reciente y sigue en movimiento.
Lo que esto te cuesta, honestamente
Casi nada de esto está asentado. Los episodios 1 al 4 se apoyan en resultados con números concretos. Este se apoya sustancialmente en la práctica de ingeniería y en trabajo muy reciente, y he tratado de señalarlo en vez de disimularlo.
La evaluación aquí es peor que en cualquier otro punto de la temporada. Una tasa de éxito del 30% en veinte pasos, medida en un puñado de tareas, tiene una varianza enorme. La mayoría de las mejoras agénticas reportadas están dentro del ruido de su propia evaluación, y casi nadie reporta el tamaño de muestra necesario para detectar el efecto que afirma.
Y el punto del harness corta en ambas direcciones. Si el harness es parte de la política, un resultado obtenido con tu harness puede no decir nada sobre el mío.
Prueba de salida
Puedes dejar la Temporada 1 cuando puedas responder esto sin desplazarte hacia arriba. Nombra las siete casillas y di qué cambia GRPO frente a qué cambia DAPO. ¿Por qué una formulación de bandit a nivel de respuesta completa no es incorrecta, aunque la vista a nivel de token sea más detallada? Enuncia la Ley de Goodhart en términos de r y U. La entropía está cayendo y tu curva de pérdida se ve genial: ¿qué revisas? Tu agente tiene éxito el 30% de las veces en veinte llamadas; nombra los dos lugares más económicos donde mirar antes de tocar el modelo base.
Gancho final → Temporada 2
Todo en esta temporada asumió algo silencioso y enorme: la distribución de tareas se mantiene estable. Entrenar, evaluar, lanzar. El mundo para el que se optimizó la política es el mundo que va a encontrar.
Eso es falso para todo agente que opere más allá de un benchmark. Las herramientas reciben nuevas versiones. Los usuarios cambian lo que piden. La base de código que el agente aprendió a navegar se refactoriza, muchas veces por el propio agente.
¿Qué le pasa a una política cuando el mundo para el que fue optimizada deja de existir, y cómo aprende el nuevo mundo sin olvidar el anterior?
Respóndelo mal y obtienes olvido catastrófico. Respóndelo bien y obtienes algo que todavía no tiene un buen nombre.
Temporada 2 — El Motor de la Memoria.
Episodio 5 de Intelligence Engineering Adventures, Temporada 1 — El Motor de las Consecuencias. Las afirmaciones en la fuente de la serie están etiquetadas por clase — definición, derivación, evidencia, decisión de ingeniería, pregunta abierta — y una metáfora puede introducir una afirmación, pero nunca sirve como evidencia de ella. Cada episodio incluye un laboratorio ejecutable en CPU. Este artículo no contiene material de ningún empleador ni cliente. — Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app
Referencias
- Luo, X. et al. (2025). Agent Lightning: Train ANY AI Agents with Reinforcement Learning. (Traducción: Agent Lightning: entrena a CUALQUIER agente de IA con aprendizaje por refuerzo.) El planteamiento del harness como costura. arxiv.org/abs/2508.03680
- He, Z. et al. (2026). Agent Lightning v1.0: Towards Harnessed Agentic RL. (Traducción: Agent Lightning v1.0: hacia un RL agéntico con harness.) arxiv.org/abs/2608.17528
- Guo, D. et al. (2025). DeepSeek-R1. El diseño de recompensa basado en reglas que este episodio extiende a las acciones. arxiv.org/abs/2501.12948
- Goodhart, C. A. E. (1975). Problems of Monetary Management: The U.K. Experience. (Traducción: Problemas de gestión monetaria: la experiencia del Reino Unido.) La ley que este episodio vuelve a encontrar, ahora en su forma orientada a la acción. Panorama general y fuentes de esta referencia
- Schulman, J. et al. (2015). High-Dimensional Continuous Control Using Generalized Advantage Estimation. (Traducción: Control continuo de alta dimensión mediante estimación generalizada de la ventaja.) La maquinaria de asignación de crédito a través del tiempo que el horizonte largo pone a prueba. arxiv.org/abs/1506.02438
- Sutton, R. & Barto, A. (2018). Reinforcement Learning: An Introduction (Traducción: Aprendizaje por refuerzo: una introducción), 2.ª ed. incompleteideas.net/book/the-book-2nd.html