Serie AI-Native · Aprendizaje por refuerzo
La Forja de Probabilidades
La idea en un minuto — con qué te vas a quedar
Un gradiente de política no le enseña un hecho a un modelo: mueve masa de probabilidad. Empuja hacia arriba lo que funcionó, y todo lo demás baja un poco. Esa sola frase vuelve legible toda la familia de algoritmos, porque expone lo único sobre lo que todos discuten: ¿qué tan sorprendidos deberíamos haber estado? Recompensa una trayectoria afortunada y habrás hecho más probable la suerte. Resta primero una expectativa y recompensarás solo la parte que superó el pronóstico. REINFORCE no resta nada. RLOO resta el promedio de las trayectorias hermanas. El actor-crítico aprende la expectativa con un segundo modelo. GRPO despide a ese modelo y usa el grupo. Eliminar la línea base no hace que el estimador esté mal: sigue siendo insesgado. Lo que hace es volverlo costoso, y un problema de varianza no produce un error, razón por la cual esto le tomó años al campo en lugar de una tarde.
Esto suena como un detalle técnico, pero en realidad es todo el tema.
Una actualización de gradiente de política no instala un hecho en un modelo. redistribuye masa de probabilidad. Un despliegue (rollout) sale bien, subes la probabilidad de los tokens que lo produjeron y —como la distribución debe seguir sumando uno— todo lo demás baja un poco.
Ese enfoque produce de inmediato el problema más antiguo del campo. Supongamos que un modelo resuelve algo correctamente una de cada diez veces, y entrenas con el éxito. No necesariamente le enseñaste el método. Puede que simplemente hayas hecho ese camino afortunado en particular más probable.
La idea central: resta lo que deberías haber esperado
Todo en este episodio es una sola reparación, aplicada de cinco maneras.
¿Fue este resultado mejor de lo que deberíamos haber esperado?
Recompensa el retorno bruto y recompensarás la suerte. Recompensa la diferencia entre el retorno y su expectativa y recompensarás solo la parte que superó el pronóstico. Esa diferencia tiene nombre —la ventaja— y cada algoritmo a continuación responde de forma distinta a la pregunta de dónde viene la expectativa.
REINFORCE [1] no resta nada. Es insesgado, es honesto y tiembla. RLOO [2] muestrea varias generaciones para el mismo prompt y usa el promedio de las demás como la expectativa — las hermanas son la línea base. Actor-crítico contrata a una segunda red para predecir la expectativa. GRPO [3] elimina ese segundo modelo y vuelve al grupo, lo cual es más barato en memoria y, como muestra el Episodio 4, trae consigo una nueva familia de fallas.
Cinco nombres. Un solo término.
El mecanismo un nivel más abajo: el problema no es el sesgo, es la varianza
Esta es la parte que entendí mal durante mucho tiempo, y vale la pena ser preciso al respecto.
Quitar la línea base no hace que el estimador del gradiente sea incorrecto: restar cualquier cantidad que no dependa de la acción deja el estimador insesgado, la actualización esperada sigue siendo la misma. Lo que cambia es la varianza de esa actualización.
Y un problema de varianza no se anuncia. No hay error, ni NaN, ni aserción fallida. Obtienes una curva de aprendizaje irregular en lugar de suave, dos semillas aleatorias que no coinciden, y una corrida que necesita cuatro veces más muestras para llegar al mismo lugar. Cada una de esas señales se lee como mala suerte o un mal hiperparámetro, razón por la cual arreglar esto le tomó al campo años en lugar de una tarde.
Predice antes de seguir leyendo
Corre el gradiente de política dos veces en una tarea fácil — una con línea base de la media, otra sin ella — mismas semillas, todo lo demás igual. ¿Qué le pasa al brazo sin línea base?
(a) No logra aprender. (b) Aprende, pero llega a un puntaje final peor. (c) Aprende hasta llegar al mismo lugar, pero más lento y de forma más errática.
La respuesta es (c), y es la incómoda, porque un método insesgado pero ruidoso parece un método que funciona en cualquier tarea lo bastante pequeña como para resolverla por fuerza bruta. El laboratorio de este episodio vuelve eso visible: observa la banda de varianza, no el número final.
El limitador de velocidad: por qué existe PPO
Una vez que puedes estimar la ventaja, aparece un segundo problema. Has muestreado comportamiento de la política anterior, y quieres hacer varias actualizaciones a partir de ella. Pero después de la primera actualización, la política que generó los datos ya no es la política que estás mejorando.
El ratio de muestreo por importancia mide qué tan lejos se han distanciado las dos políticas. El aporte de PPO es un limitador de velocidad: recortar ese ratio, de modo que un solo lote nunca pueda empujar la política más allá de lo que permite una región de confianza. Eso es todo. El objetivo sustituto recortado es un gobernador atornillado a una máquina que, de otro modo, se aceleraría sin control con sus propios datos obsoletos.
Fíjate en lo que les pasó a las siglas: REINFORCE, RLOO y GRPO son argumentos sobre la expectativa. PPO es un argumento sobre qué tan lejos puede llegar una sola actualización. No son competidores; son pernos distintos.
Lo que esto te cuesta, honestamente
El marco de "una sola resta" es una simplificación, y deja cosas importantes en el camino.
GAE no está incluido. El estimador de ventaja generalizada (GAE) es un dial de sesgo-varianza a lo largo de los pasos temporales, y reducirlo a "la expectativa" oculta la disyuntiva que existe precisamente para exponer.
Se confunden dos KL distintos. La política antigua y la política de referencia son objetos distintos que cumplen funciones distintas: una acota la actualización, la otra acota la deriva respecto al modelo del que partiste. Llamar "KL" a ambas es lo que lleva a la gente a terminar regularizando hacia el objetivo equivocado.
Y que algo no tenga sesgo no es lo mismo que sea seguro. Un estimador puede no tener sesgo y aun así concentrar la probabilidad en una región afortunada más rápido de lo que tu evaluación puede detectar.
Ejecútalo tú mismo, en unos quince minutos
El laboratorio ejecuta tres brazos sobre la misma tarea y las mismas semillas: sin línea base, con línea base de media y —si lo extiendes— una aprendida. Grafica la varianza de las actualizaciones, no solo el retorno.
Una advertencia sobre tu propia extensión, que aplica mucho más allá de este laboratorio: if you compare arms across three seeds and see no difference, you have learned about your budget, not about baselines. (Traducción: si comparas brazos con tres semillas y no ves diferencia, has aprendido algo sobre tu presupuesto, no sobre las líneas base.) Las afirmaciones sobre varianza necesitan suficientes semillas para detectar el efecto que estás alegando. Anota cuántas necesitarías antes de ejecutarlo.
Hacia dónde va esto
Cada algoritmo aquí optimiza un número que alguien eligió. Ninguno puede decirte si ese número era el correcto para perseguir.
El Episodio 3 trata sobre qué pasa cuando el marcador mismo está equivocado, y sobre el hecho de que un economista describió ese modo de falla en 1975, medio siglo antes de que alguien entrenara un modelo de recompensa.
Episodio 2 de Intelligence Engineering Adventures, Season 1 — The Consequence Engine. Las afirmaciones en la fuente de la serie están etiquetadas por clase —definición, derivación, evidencia, decisión de ingeniería, pregunta abierta— y una metáfora puede introducir una afirmación, pero nunca sirve como evidencia de ella. Cada episodio incluye un laboratorio ejecutable en CPU. Este artículo no contiene material de ningún empleador o cliente. — Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app
Referencias
- Williams, R. J. (1992). Simple statistical gradient-following algorithms for connectionist reinforcement learning. Machine Learning. El REINFORCE original. link.springer.com/article/10.1007/BF00992696
- Ahmadian, A. et al. (2024). Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs. La línea base leave-one-out para el aprendizaje por retroalimentación humana en LLMs. arxiv.org/abs/2402.14740
- Shao, Z. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. Introduce GRPO. arxiv.org/abs/2402.03300
- Schulman, J. et al. (2017). Proximal Policy Optimization Algorithms. El objetivo sustituto recortado. arxiv.org/abs/1707.06347
- Schulman, J. et al. (2015). High-Dimensional Continuous Control Using Generalized Advantage Estimation. GAE, y el equilibrio entre sesgo y varianza. arxiv.org/abs/1506.02438
- Sutton, R. & Barto, A. (2018). Reinforcement Learning: An Introduction, 2.ª ed. incompleteideas.net/book/the-book-2nd.html