Serie AI-Native · Aprendizaje por Refuerzo
El Motor de las Consecuencias
La idea en 1 minuto: qué te llevas
El aprendizaje por refuerzo para modelos de lenguaje parece un zoológico: REINFORCE, RLOO, PPO, GRPO, DAPO, Dr.GRPO, GSPO, CISPO, RLVR. Se lee como nueve temas distintos. Es un solo bucle con siete casillas —tarea, política, despliegue (rollout), recompensa, crédito, actualización, evaluación— y casi todas las siglas modifican una o dos casillas, nunca el conjunto entero. Alinéalas y cinco de siete están discutiendo sobre un solo término: cuánto crédito merece un comportamiento determinado. Esto no es una simplificación para principiantes; es el mapa que te dice qué artículo leer cuando algo falla. La prueba de que esto importa: DeepSeek-R1-Zero llevó AIME 2024 de 15,6 % a 71,0 % cambiando la casilla de recompensa y la casilla de crédito, sin ajuste fino supervisado y sin crítico aprendido. Las mismas siete casillas. Dos ediciones.
Existe un tipo particular de cansancio que surge al leer sobre aprendizaje por refuerzo para modelos de lenguaje.
Empiezas con PPO. Luego alguien dice que PPO ya no se usa, que ahora es GRPO. Luego resulta que GRPO tiene un sesgo, así que ahora es Dr.GRPO. Luego GRPO colapsa a gran escala, así que ahora es DAPO. Luego GSPO, porque el ratio estaba a la granularidad equivocada. Luego CISPO, porque el recorte eliminaba los tokens interesantes. Luego TIS, porque el motor de entrenamiento y el motor de inferencia no coinciden en qué probabilidad asignaron.
Después de nueve siglas, el monólogo interno honesto es: am I supposed to have read nine papers to understand one idea? (Traducción: ¿se supone que debí leer nueve artículos para entender una sola idea?)
No. Se supone que debes tener una sola imagen.
La idea central: siete casillas, y todos editan dos de ellas
El preentrenamiento y el ajuste fino supervisado le hacen al modelo la misma pregunta con dos acentos distintos: ¿puedes predecir o imitar la salida deseada?
El aprendizaje por refuerzo pregunta algo categóricamente distinto:
¿Puedes actuar, observar las consecuencias y cambiar la probabilidad de tu comportamiento futuro para que los resultados útiles se vuelvan más probables?
Ese es el tema entero en una sola frase, y funciona como un bucle con siete pasos. Tarea — en qué situación se encuentra el modelo. Política — qué probabilidades asigna a las acciones posibles. Despliegue (rollout) — qué hizo realmente cuando lo muestreamos. Recompensa — qué tan buena fue la consecuencia. Crédito — cuál de sus comportamientos merece el elogio o la culpa. Actualización — cambiar los parámetros. Evaluación — si ese cambio generalizó, o si solo complació el marcador.
Ahora viene la parte útil. Toma los nueve acrónimos y pregunta, para cada uno, qué caja toca.
Cinco de siete coinciden en la misma caja. No son nueve temas. Son un único argumento largo sobre una sola pregunta — was this outcome better than what we should have expected? (Traducción: ¿fue este resultado mejor de lo que deberíamos haber esperado?) — protagonizado por gente que no paraba de encontrarle nuevas grietas a la respuesta anterior.
Esa observación te salvará de lo que solo puedo describir como una deshidratación espiritual inducida por acrónimos.
Por qué el bucle no es un recurso didáctico
Sería razonable sospechar que las siete cajas son un diagrama amigable inventado para artículos como este, y que los sistemas reales son más desordenados. Aquí está el contraejemplo que me hizo cambiar de opinión.
DeepSeek-R1-Zero tomó un modelo base y mejoró su puntaje pass@1 en AIME 2024 de 15,6 % a 71,0 % [1]. Aproximadamente cuatro veces más, en una prueba de referencia de matemáticas de competencia. El modelo R1 final alcanza cerca de 79.8% tras un proceso adicional de ajuste supervisado y RL [1].
¿Qué cambiaron? No la arquitectura. No el preentrenamiento. Cambiaron la caja de recompensa — reemplazando un crítico neuronal aprendido por señales basadas en reglas: si la respuesta final, en su casilla requerida, es correcta, y si la salida sigue el <think>…</think><answer>…</answer> formato requerido [1]. Y cambiaron la caja de crédito, usando GRPO, que descarta el modelo de valor aprendido y calcula la línea base a partir de un grupo de despliegues (rollouts) hermanos [2].
Dos cajas. Una mejora de cuatro veces. El bucle es la columna vertebral del sistema.
El mecanismo, un nivel más abajo: RL desplaza masa de probabilidad
Esto es algo que tardé un tiempo vergonzoso en interiorizar, y que hace legible cualquier acrónimo posterior.
Una actualización de gradiente de política no le enseña un hecho al modelo. redistribuye masa de probabilidad. Cuando un despliegue (rollout) sale bien, la actualización aumenta la probabilidad de la secuencia de tokens que lo produjo y —como las probabilidades deben sumar uno— reduce un poco todo lo demás. Eso es todo lo que hace.
Lo cual te revela de inmediato el peligro. Supongamos que el modelo resuelve un problema correctamente una vez de cada diez intentos, y entrenas sobre ese único éxito. ¿Aprendió el procedimiento de razonamiento? ¿O tuvo suerte, y ahora acabas de hacer más probable el camino afortunado?
El resultado por sí solo no puede decírtelo. La misma recompensa, dos eventos de aprendizaje completamente distintos, indistinguibles a partir de la señal de recompensa. Este es el fallo que toda la columna de crédito de esa infografía existe para abordar —y la primera reparación es una pregunta tan simple que suena a nada:
¿Fue este resultado mejor que lo que deberíamos haber esperado?
Resta una expectativa, y dejas de recompensar la suerte. Esa resta es la línea base. Aprende la expectativa con un segundo modelo y tienes un crítico. Calcúlala a partir del grupo y tienes GRPO. Discute cómo normalizarla y tienes Dr.GRPO. Es un solo término, de principio a fin.
Decide una respuesta antes de seguir leyendo
Antes de la siguiente sección, decide una respuesta —el sentido de una predicción es que puede estar equivocada.
Tu modelo resuelve correctamente un problema de matemáticas una vez de cada diez. Haces ajuste fino sobre ese único caso exitoso. ¿Qué ocurrió: (a) aprendió el algoritmo de razonamiento, (b) memorizó una trayectoria estrecha, o (c) elevó la probabilidad alrededor de una región que resultó funcionar?
La respuesta de nivel investigación es que no puedes saberlo a partir del resultado, y cualquier afirmación en contrario es una afirmación sobre tu evaluación, no sobre tu modelo. Separar esas tres hipótesis requiere pass@k, una medición deliberada de la exploración y un cambio de distribución fuera de la muestra de entrenamiento. Si tu evaluación reporta un único número de precisión, las tres opciones parecen idénticas.
Lo que esto te cuesta, honestamente
El mapa de siete cajas es una compresión, y las compresiones pierden cosas. Tres que importan.
Aplana diferencias matemáticas genuinas. El objetivo sustituto recortado de PPO y la ventaja relativa al grupo de GRPO no son intercambiables solo porque ambos vivan en la columna de crédito. El mapa te dice dónde mirar; no te dice la derivación.
Faltan dos cajas, y es deliberado. Los sistemas reales tienen un motor de entrenamiento y un motor de inferencia que pueden asignar probabilidades distintas al mismo token, además de un planificador asíncrono que decide cuán obsoleto puede estar un despliegue (rollout) antes de descartarlo. Esas cosas viven entre las cajas y provocan una clase de error realmente desagradable.
Y el mapa no puede decirte qué optimizar. Cada caja posterior a la recompensa es maquinaria para perseguir un número que tú elegiste. Elegirlo mal no es un error que la columna de asignación de crédito pueda arreglar — ese es el tema del Episodio 3, y el problema más antiguo de la serie.
Pruébalo tú mismo, en unos quince minutos
La afirmación "una línea base reduce la varianza" es de esas cosas fáciles de asentir con la cabeza y difíciles de creer de verdad hasta que la ves en acción. La temporada incluye un laboratorio ejecutable en CPU por episodio — sin GPU, sin descargas de modelos, PyTorch puro.
El laboratorio del Episodio 1 ejecuta gradiente de política con y sin línea base sobre la misma tarea y las mismas semillas, y grafica la varianza de las actualizaciones. Lo que hay que buscar no es que la versión con línea base puntúe más alto. Es que la versión sin línea base también llega ahí eventualmente, aunque temblando violentamente todo el camino. Quitar la línea base no hace que el estimador esté mal. Lo hace costoso. Esa distinción es la razón por la que las líneas base tardaron años en volverse estándar, y es invisible en cualquier informe que solo reporte el número final.
Hacia dónde va esto
Cinco episodios, un solo bucle, cada uno ganándose el derecho al siguiente.
El Episodio 2 abre como corresponde la caja de asignación de crédito — el truco de la derivada logarítmica, las líneas base, las ventajas, y el camino de REINFORCE a PPO y a GRPO como un solo argumento continuo. El Episodio 3 pregunta qué pasa cuando el propio marcador está equivocado, y encuentra que los economistas dejaron esa ley por escrito en 1975. El Episodio 4 es lo que ocurre cuando algoritmos elegantes se topan con secuencias largas y despliegues (rollouts) obsoletos. El Episodio 5 es cuando el modelo deja de producir texto y empieza a tomar acciones en un mundo que le responde.
Una cosa para llevarte de este episodio: cuando llegue el próximo acrónimo — y llegará, probablemente este mes — no preguntes qué es. Pregunta qué caja edita. Esa pregunta se responde en unos noventa segundos a partir de cualquier resumen, y te dice si el paper es relevante para lo que está roto ahora mismo en tu proyecto.
Episodio 1 de Intelligence Engineering Adventures, Temporada 1 — El Motor de las Consecuencias. Los laboratorios ejecutables, los diagramas y el arco completo de cinco episodios están en el repositorio fuente de la serie. Las afirmaciones de este texto están etiquetadas en la fuente por clase — definición, derivación, evidencia, decisión de ingeniería, pregunta abierta — y una metáfora puede introducir una afirmación pero nunca sirve como evidencia de ella. Este artículo no contiene material de ningún empleador o cliente. — Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app
Referencias
- Guo, D. et al. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. (Traducción: DeepSeek-R1: incentivando la capacidad de razonamiento en LLMs mediante aprendizaje por refuerzo.) Fuente de las cifras de pass@1 en AIME 2024 (15,6 % → 71,0 % para R1-Zero; ≈79,8 % para R1) y del diseño de recompensa basado en reglas de precisión y formato. arxiv.org/abs/2501.12948
- Shao, Z. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. (Traducción: DeepSeekMath: superando los límites del razonamiento matemático en modelos de lenguaje abiertos.) Presenta GRPO — la línea base grupal relativa que elimina el crítico aprendido. arxiv.org/abs/2402.03300
- Yu, Q. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. Clip-Higher y Dynamic Sampling; 50 puntos en AIME 2024 con Qwen2.5-32B frente a 47 de DeepSeek-R1-Zero-Qwen-32B, con el 50 % de los pasos de entrenamiento. arxiv.org/abs/2503.14476
- Liu, Z. et al. (2025). Understanding R1-Zero-Like Training: A Critical Perspective (Dr.GRPO). Identifica el sesgo de longitud y el sesgo de dificultad por normalización con desviación estándar en GRPO. arxiv.org/abs/2503.20783
- Williams, R. J. (1992). Simple statistical gradient-following algorithms for connectionist reinforcement learning. Machine Learning. El REINFORCE original. link.springer.com/article/10.1007/BF00992696
- Sutton, R. & Barto, A. (2018). Reinforcement Learning: An Introduction, 2.ª ed. La definición formal usada aquí. incompleteideas.net/book/the-book-2nd.html
- Ahmadian, A. et al. (2024). Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs. arxiv.org/abs/2402.14740