Paul Jialiang Wu agentic-portfolio English 中文 한국어 日本語✉️ Lista gratuita
← Volver al portafolio

Serie AI-Native · Aprendizaje por Refuerzo

El horno de la escala

Por Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · 2026-08-24 · Episodio 4 de 5

Cover: white ground with a black left rail. Eyebrow AI-NATIVE SERIES · REINFORCEMENT LEARNING above the serif headline 'The Scale Furnace' and the lines 'The loss curve looks perfect. The run stopped learning four thousand steps ago.' Two rows of three grey cards. Top row: ENTROPY COLLAPSE H(pi) falling, exploration quietly ends; ZERO VARIANCE std(r) = 0, the gradient disappears; THE DENOMINATOR 1 over length, silently weights your tasks. Bottom row: DAPO 50 vs 47 AIME, at half the training steps; Dr.GRPO two named biases, 27 hours on 8 A100s; WHAT TO LOG entropy, loss will not tell you.
Tres formas en que una ejecución muere en silencio, y los tres papers que las nombraron.

Resumen de 1 minuto — qué te vas a llevar

A escala, los algoritmos de RL dejan de fallar a los gritos y empiezan a fallar en silencio. La entropía de la política cae de forma monotónica, las salidas muestreadas convergen entre sí, la exploración se detiene — y la curva de pérdida se mantiene suave todo el tiempo. Entonces los grupos empiezan a devolver recompensas idénticas, std(r) llega a cero, la ventaja llega a cero, y tu gradiente desaparece. Mientras tanto, cada denominador de tu pérdida decide en silencio qué ejemplos importan: Dr.GRPO descubrió que la normalización por longitud de GRPO infla específicamente la longitud de las respuestas incorrectas, y que dividir por std(r) sobrepondera las preguntas de baja varianza [2]. DAPO elevó el límite superior de recorte (clipping) y volvió a muestrear los grupos muertos, alcanzando 50 en AIME 2024 contra 47, con la mitad de los pasos de entrenamiento [1]. Si vas a registrar un escalar extra en una corrida de RL, registra la entropía. La pérdida no te lo va a decir.

Todo en los primeros tres episodios asumía que el algoritmo era la parte difícil. A escala, no lo es. A escala, la parte difícil es que tu corrida puede dejar de aprender sin que nada se vea mal.

La idea central: el fallo silencioso tiene tres formas

Colapso de entropía. La entropía de la política —qué tan dispersas están las probabilidades del modelo— disminuye de forma monotónica durante el entrenamiento. Los resultados muestreados convergen hacia soluciones casi idénticas. La exploración termina antes de que la política haya encontrado las estrategias que era capaz de encontrar. La corrida no colapsa: simplemente deja de descubrir nada nuevo, y eso es peor, porque la curva de pérdida sigue viéndose bien.

Grupos de varianza cero. GRPO calcula la ventaja a partir de un grupo de despliegues (rollouts) hermanos. Si cada hermano obtiene la misma recompensa —todos correctos en un prompt fácil, todos incorrectos en uno difícil—, la desviación estándar es cero, la ventaja es cero, y ese grupo entero no aportó nada al gradiente. Pagaste cómputo completo y no obtuviste nada a cambio.

Denominadores. Cada término de normalización en tu pérdida es una decisión sobre qué ejemplos importan, y casi seguro alguien la eligió por pura conveniencia numérica, sin intención de tomar esa decisión.

Los números

DAPO combina dos intervenciones [1]. Clip-Higher desacopla los límites superior e inferior del recorte (clipping), elevando el límite superior para que los tokens exploratorios de baja probabilidad no queden suprimidos: bajo un recorte simétrico son los más golpeados, porque sus ratios se mueven más. Dynamic Sampling vuelve a muestrear los prompts donde todos los despliegues (rollouts) del grupo obtuvieron la misma recompensa; dicho de otro modo, se niega a gastar cómputo en grupos que no pueden producir un gradiente.

El resultado: 50 puntos en AIME 2024 con Qwen2.5-32B, frente a 47 de DeepSeek-R1-Zero-Qwen-32B, con solo el 50% de los pasos de entrenamiento. [1].

Lee esto con atención, porque el número interesante no es el 50. Tres puntos de precisión son un argumento. El hallazgo es haber reducido el cómputo a la mitad para lograrlo. La intervención no hizo al modelo más inteligente. Impidió que el optimizador descartara su propia señal de gradiente.

Diagram titled 'Three ways a run dies without raising an error' with three columns — silent in loss, wastes compute, kills exploration — and five rows: entropy collapse, zero-variance groups, length normalisation, std(r) normalisation, and train/infer mismatch. Every single row has a filled dot under 'silent in loss'. Footer reads: every row is invisible in the loss curve, that is what they have in common. Log policy entropy, and the fraction of groups with zero reward variance.
Cada fila tiene un punto en la primera columna. Esa columna es todo el problema.

El mecanismo un nivel más abajo: tu denominador es un juicio de valor

Dr.GRPO [2] encontró dos sesgos distintos en el GRPO estándar, y vale la pena precisarlos porque tiran en direcciones diferentes.

Sesgo de longitud. La normalización por longitud infla la longitud de las respuestas incorrectas específicamente. El modelo aprende a escribir más cuando se equivoca, justo lo opuesto de lo que se pretendía; en un panel de control (dashboard) esto parece indicar que "el modelo está razonando más".

Sesgo de dificultad a nivel de respuesta. Dividir la ventaja entre std(r) sobrepondera las preguntas cuyos despliegues (rollouts) resultaron tener baja varianza. Dr.GRPO elimina ese escalamiento para que todas las preguntas se traten por igual.

Eliminar ambos términos alcanzó el estado del arte en Math-7B en 27 horas en 8×A100 [2]: una cifra que conviene retener, porque nos dice que este tipo de arreglo es una corrección, no un escalamiento.

La lección se generaliza mucho más allá de este artículo. Cada denominador en tu función de pérdida es una decisión de política sobre qué ejemplos importan, y nadie deja constancia de esa decisión.

Predice antes de seguir leyendo

El GRPO estándar divide cada ventaja por la desviación estándar de la recompensa del grupo, y normaliza la pérdida por la longitud de la respuesta. Ambas cosas parecen higiene numérica común y corriente. Una de ellas produce una patología específica y visible en los registros de entrenamiento. ¿Cuál es, y cómo se manifiesta?

(a) La normalización por longitud hace que las respuestas correctas sean más cortas. (b) La normalización por longitud hace que las respuestas incorrectas sean más largas. (c) La normalización por std hace que dominen las preguntas difíciles. (d) La normalización por std hace que dominen las preguntas de baja varianza.

Dos de estas son verdaderas, y no son las dos que la mayoría elige.

Sala de fallos: gira la perilla de exploración en la dirección equivocada

Toma una ejecución de GRPO que funciona y haz un solo cambio: ajusta el límite superior de recorte (clipping) en vez de subirlo.

Lo que se rompe, en orden: los tokens de baja probabilidad son los más suprimidos; la entropía cae más rápido que la línea base; las salidas dentro de un grupo empiezan a verse idénticas; std(r) llega a cero; la ventaja llega a cero; y la curva de pérdida se ve perfectamente saludable todo el tiempo.

Ese último paso es lo que importa. Sin error, sin picos, sin NaN: una curva suave y de aspecto profesional, para un modelo que dejó de aprender hace miles de pasos.

Si registras un solo escalar extra en una ejecución de RL, registra la entropía de la política. Si registras dos, registra la fracción de grupos con varianza de recompensa cero: eso es tu gradiente, desapareciendo.

Misión Realidad

Elige cualquier ciclo de entrenamiento o evaluación que corras esta semana: una ejecución de RL, un ajuste fino, incluso un benchmark nocturno. Encuentra cada denominador y anota qué dice sobre qué ejemplos importan.

¿Promedio sobre tokens? Decidiste que los ejemplos largos importan más. ¿Promedio sobre secuencias? Decidiste que importan lo mismo. ¿Dividir por una desviación estándar en algún lado? Decidiste que los casos de baja varianza importan más, y casi seguro no era tu intención. Vas a encontrar al menos uno que no puedes justificar.

Lo que esto te cuesta, con honestidad

Las constantes no se transfieren. Los límites de recorte (clipping) de DAPO se ajustaron para ese modelo, esa familia de tareas, esa longitud de secuencia. El mecanismo es reutilizable; los números no.

Estas correcciones interactúan entre sí. Clip-Higher, el muestreo dinámico (Dynamic Sampling) y un denominador modificado: los tres afectan la exploración. Combinarlos no es aditivo, y los papers los reportan mayormente por separado.

Y una sola ejecución no es una medición. Cada número de este episodio proviene de una configuración específica; que se reproduzca en la tuya es un experimento que tienes que correr tú mismo, con suficientes semillas para detectar el efecto que estás afirmando.

Hacia dónde va esto

El episodio 5 trata sobre lo que pasa cuando la completación deja de ser texto y se convierte en una trayectoria a través de un mundo que responde: cuando el arnés (harness) deja de ser un simple andamiaje alrededor de la política y pasa a formar parte de ella.

Episodio 4 de Intelligence Engineering Adventures, Season 1 — The Consequence Engine. Las afirmaciones en la fuente de la serie están etiquetadas por clase —definición, derivación, evidencia, decisión de ingeniería, pregunta abierta— y una metáfora puede introducir una afirmación, pero nunca sirve como evidencia de ella. Cada episodio incluye un laboratorio ejecutable en CPU. Este artículo no contiene material de ningún empleador ni cliente. — Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app

Referencias

  1. Yu, Q. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. Clip-Higher y Dynamic Sampling; 50 puntos en AIME 2024 con Qwen2.5-32B contra 47 de DeepSeek-R1-Zero-Qwen-32B, con la mitad de los pasos de entrenamiento.arxiv.org/abs/2503.14476
  2. Liu, Z. et al. (2025). Understanding R1-Zero-Like Training: A Critical Perspective (Dr.GRPO). El sesgo de longitud y el sesgo de dificultad por normalización con std; estado del arte en Math-7B en 27 horas con 8×A100. arxiv.org/abs/2503.20783
  3. Zheng, C. et al. (2025). Group Sequence Policy Optimization (GSPO). Ratios de importancia a nivel de secuencia para modelos de mezcla de expertos (MoE) y razonamiento extenso. arxiv.org/abs/2507.18071
  4. Chen, A. et al. (2025). MiniMax-M1 (CISPO). Recorta el peso de muestreo por importancia en lugar de la actualización. arxiv.org/abs/2506.13585
  5. Shao, Z. et al. (2024). DeepSeekMath (GRPO). El algoritmo que todo lo anterior viene a corregir. arxiv.org/abs/2402.03300
  6. Schulman, J. et al. (2017). Proximal Policy Optimization Algorithms. El recorte que este episodio desacopla. arxiv.org/abs/1707.06347