Serie AI-Native · Aprendizaje por Refuerzo
El horno de la escala
Resumen de 1 minuto — qué te vas a llevar
A escala, los algoritmos de RL dejan de fallar a los gritos y empiezan a fallar en silencio. La entropía de la política cae de forma monotónica, las salidas muestreadas convergen entre sí, la exploración se detiene — y la curva de pérdida se mantiene suave todo el tiempo. Entonces los grupos empiezan a devolver recompensas idénticas, std(r) llega a cero, la ventaja llega a cero, y tu gradiente desaparece. Mientras tanto, cada denominador de tu pérdida decide en silencio qué ejemplos importan: Dr.GRPO descubrió que la normalización por longitud de GRPO infla específicamente la longitud de las respuestas incorrectas, y que dividir por std(r) sobrepondera las preguntas de baja varianza [2]. DAPO elevó el límite superior de recorte (clipping) y volvió a muestrear los grupos muertos, alcanzando 50 en AIME 2024 contra 47, con la mitad de los pasos de entrenamiento [1]. Si vas a registrar un escalar extra en una corrida de RL, registra la entropía. La pérdida no te lo va a decir.
Todo en los primeros tres episodios asumía que el algoritmo era la parte difícil. A escala, no lo es. A escala, la parte difícil es que tu corrida puede dejar de aprender sin que nada se vea mal.
La idea central: el fallo silencioso tiene tres formas
Colapso de entropía. La entropía de la política —qué tan dispersas están las probabilidades del modelo— disminuye de forma monotónica durante el entrenamiento. Los resultados muestreados convergen hacia soluciones casi idénticas. La exploración termina antes de que la política haya encontrado las estrategias que era capaz de encontrar. La corrida no colapsa: simplemente deja de descubrir nada nuevo, y eso es peor, porque la curva de pérdida sigue viéndose bien.
Grupos de varianza cero. GRPO calcula la ventaja a partir de un grupo de despliegues (rollouts) hermanos. Si cada hermano obtiene la misma recompensa —todos correctos en un prompt fácil, todos incorrectos en uno difícil—, la desviación estándar es cero, la ventaja es cero, y ese grupo entero no aportó nada al gradiente. Pagaste cómputo completo y no obtuviste nada a cambio.
Denominadores. Cada término de normalización en tu pérdida es una decisión sobre qué ejemplos importan, y casi seguro alguien la eligió por pura conveniencia numérica, sin intención de tomar esa decisión.
Los números
DAPO combina dos intervenciones [1]. Clip-Higher desacopla los límites superior e inferior del recorte (clipping), elevando el límite superior para que los tokens exploratorios de baja probabilidad no queden suprimidos: bajo un recorte simétrico son los más golpeados, porque sus ratios se mueven más. Dynamic Sampling vuelve a muestrear los prompts donde todos los despliegues (rollouts) del grupo obtuvieron la misma recompensa; dicho de otro modo, se niega a gastar cómputo en grupos que no pueden producir un gradiente.
El resultado: 50 puntos en AIME 2024 con Qwen2.5-32B, frente a 47 de DeepSeek-R1-Zero-Qwen-32B, con solo el 50% de los pasos de entrenamiento. [1].
Lee esto con atención, porque el número interesante no es el 50. Tres puntos de precisión son un argumento. El hallazgo es haber reducido el cómputo a la mitad para lograrlo. La intervención no hizo al modelo más inteligente. Impidió que el optimizador descartara su propia señal de gradiente.
El mecanismo un nivel más abajo: tu denominador es un juicio de valor
Dr.GRPO [2] encontró dos sesgos distintos en el GRPO estándar, y vale la pena precisarlos porque tiran en direcciones diferentes.
Sesgo de longitud. La normalización por longitud infla la longitud de las respuestas incorrectas específicamente. El modelo aprende a escribir más cuando se equivoca, justo lo opuesto de lo que se pretendía; en un panel de control (dashboard) esto parece indicar que "el modelo está razonando más".
Sesgo de dificultad a nivel de respuesta. Dividir la ventaja entre std(r) sobrepondera las preguntas cuyos despliegues (rollouts) resultaron tener baja varianza. Dr.GRPO elimina ese escalamiento para que todas las preguntas se traten por igual.
Eliminar ambos términos alcanzó el estado del arte en Math-7B en 27 horas en 8×A100 [2]: una cifra que conviene retener, porque nos dice que este tipo de arreglo es una corrección, no un escalamiento.
La lección se generaliza mucho más allá de este artículo. Cada denominador en tu función de pérdida es una decisión de política sobre qué ejemplos importan, y nadie deja constancia de esa decisión.
Predice antes de seguir leyendo
El GRPO estándar divide cada ventaja por la desviación estándar de la recompensa del grupo, y normaliza la pérdida por la longitud de la respuesta. Ambas cosas parecen higiene numérica común y corriente. Una de ellas produce una patología específica y visible en los registros de entrenamiento. ¿Cuál es, y cómo se manifiesta?
(a) La normalización por longitud hace que las respuestas correctas sean más cortas. (b) La normalización por longitud hace que las respuestas incorrectas sean más largas. (c) La normalización por std hace que dominen las preguntas difíciles. (d) La normalización por std hace que dominen las preguntas de baja varianza.
Dos de estas son verdaderas, y no son las dos que la mayoría elige.
Sala de fallos: gira la perilla de exploración en la dirección equivocada
Toma una ejecución de GRPO que funciona y haz un solo cambio: ajusta el límite superior de recorte (clipping) en vez de subirlo.
Lo que se rompe, en orden: los tokens de baja probabilidad son los más suprimidos; la entropía cae más rápido que la línea base; las salidas dentro de un grupo empiezan a verse idénticas; std(r) llega a cero; la ventaja llega a cero; y la curva de pérdida se ve perfectamente saludable todo el tiempo.
Ese último paso es lo que importa. Sin error, sin picos, sin NaN: una curva suave y de aspecto profesional, para un modelo que dejó de aprender hace miles de pasos.
Si registras un solo escalar extra en una ejecución de RL, registra la entropía de la política. Si registras dos, registra la fracción de grupos con varianza de recompensa cero: eso es tu gradiente, desapareciendo.
Misión Realidad
Elige cualquier ciclo de entrenamiento o evaluación que corras esta semana: una ejecución de RL, un ajuste fino, incluso un benchmark nocturno. Encuentra cada denominador y anota qué dice sobre qué ejemplos importan.
¿Promedio sobre tokens? Decidiste que los ejemplos largos importan más. ¿Promedio sobre secuencias? Decidiste que importan lo mismo. ¿Dividir por una desviación estándar en algún lado? Decidiste que los casos de baja varianza importan más, y casi seguro no era tu intención. Vas a encontrar al menos uno que no puedes justificar.
Lo que esto te cuesta, con honestidad
Las constantes no se transfieren. Los límites de recorte (clipping) de DAPO se ajustaron para ese modelo, esa familia de tareas, esa longitud de secuencia. El mecanismo es reutilizable; los números no.
Estas correcciones interactúan entre sí. Clip-Higher, el muestreo dinámico (Dynamic Sampling) y un denominador modificado: los tres afectan la exploración. Combinarlos no es aditivo, y los papers los reportan mayormente por separado.
Y una sola ejecución no es una medición. Cada número de este episodio proviene de una configuración específica; que se reproduzca en la tuya es un experimento que tienes que correr tú mismo, con suficientes semillas para detectar el efecto que estás afirmando.
Hacia dónde va esto
El episodio 5 trata sobre lo que pasa cuando la completación deja de ser texto y se convierte en una trayectoria a través de un mundo que responde: cuando el arnés (harness) deja de ser un simple andamiaje alrededor de la política y pasa a formar parte de ella.
Episodio 4 de Intelligence Engineering Adventures, Season 1 — The Consequence Engine. Las afirmaciones en la fuente de la serie están etiquetadas por clase —definición, derivación, evidencia, decisión de ingeniería, pregunta abierta— y una metáfora puede introducir una afirmación, pero nunca sirve como evidencia de ella. Cada episodio incluye un laboratorio ejecutable en CPU. Este artículo no contiene material de ningún empleador ni cliente. — Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app
Referencias
- Yu, Q. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. Clip-Higher y Dynamic Sampling; 50 puntos en AIME 2024 con Qwen2.5-32B contra 47 de DeepSeek-R1-Zero-Qwen-32B, con la mitad de los pasos de entrenamiento.arxiv.org/abs/2503.14476
- Liu, Z. et al. (2025). Understanding R1-Zero-Like Training: A Critical Perspective (Dr.GRPO). El sesgo de longitud y el sesgo de dificultad por normalización con std; estado del arte en Math-7B en 27 horas con 8×A100. arxiv.org/abs/2503.20783
- Zheng, C. et al. (2025). Group Sequence Policy Optimization (GSPO). Ratios de importancia a nivel de secuencia para modelos de mezcla de expertos (MoE) y razonamiento extenso. arxiv.org/abs/2507.18071
- Chen, A. et al. (2025). MiniMax-M1 (CISPO). Recorta el peso de muestreo por importancia en lugar de la actualización. arxiv.org/abs/2506.13585
- Shao, Z. et al. (2024). DeepSeekMath (GRPO). El algoritmo que todo lo anterior viene a corregir. arxiv.org/abs/2402.03300
- Schulman, J. et al. (2017). Proximal Policy Optimization Algorithms. El recorte que este episodio desacopla. arxiv.org/abs/1707.06347