Paul Jialiang Wu agentic-portfolio English 中文 한국어 日本語✉️ Lista gratuita
← Volver al portafolio

Serie AI-Native · Ingeniería del aprendizaje

El artículo de IA más importante de 2004 nunca menciona la IA

Por Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · 2026-08-01

La idea en 1 minuto — con qué te vas a quedar

En 2004 la GPU ya le ganaba en músculo a la CPU, pero programarla significaba hablar en triángulos. Brook for GPUs abrió la cerradura con tres abstracciones — streams (flujos), kernels (núcleos), reductions (reducciones) — y el almacén liberado se convirtió en CUDA (2006), luego en AlexNet sobre dos tarjetas de videojuegos (2012), y después en la era de la IA. El modelo mental: el cómputo dormido está detrás de puertas cerradas, y la abstracción es la llave. La "lotería del hardware" de Sara Hooker le pone nombre a esta regla; tus propias herramientas también tienen almacenes cerrados.

The most important AI paper of 2004 never mentions AI — streams flowing through a kernel

En 2004, siete investigadores de Stanford publicaron un artículo sobre tarjetas gráficas. Hice la búsqueda para que no tengas que hacerla tú: las palabras "neural," "inteligencia artificial," "machine learning" y "deep learning" aparecen exactamente cero veces. Aun así, es el artículo №2 en mi lista de lectura de IA de frontera — por delante de casi todo lo que menciona la IA — y al llegar al final de esta página creo que estarás de acuerdo en que se ganó el lugar.

Un almacén lleno de caballos de fuerza, y sin puerta

Así de absurda era la situación en 2004: la tarjeta gráfica de la PC de un gamer ya entregaba más aritmética pura que la CPU con la que convivía. Toda esa fuerza estaba encerrada detrás del ensamblador de shaders y las APIs gráficas — para usarla, tenías que disfrazar tu matemática de trabajo de renderizado. Los autores de Brook lo plantearon sin rodeos[1]:

"…the user is forced to express their algorithm in terms of graphics primitives, such as textures and triangles. As a result, general-purpose GPU computing is limited to only the most advanced graphics developers." (Traducción: el usuario se ve obligado a expresar su algoritmo en términos de primitivas gráficas, como texturas y triángulos. Como resultado, la computación de propósito general en GPU queda limitada solo a los desarrolladores gráficos más avanzados.)

Imagina un almacén de motores que nadie puede encender porque el interruptor de encendido solo acepta llaves con forma de triángulo. Esa no es una metáfora que inventé para darle color — es la razón de ser completa del artículo:

CPU — dócil, obediente
GPU — más potente, encerrada
la jaula es el modelo de programación,
no el silicio

① el almacén cerrado — la barra más alta siempre estuvo ahí; mira qué pasa cuando se levanta la jaula

Tres palabras que abrieron la cerradura

La jugada de Brook no fue hardware más rápido. Fue un vocabulario. Textual, del resumen[1]:

"Brook extends C to include simple data-parallel constructs, enabling the use of the GPU as a streaming coprocessor." (Traducción: Brook extiende C para incluir construcciones simples de paralelismo de datos, permitiendo el uso de la GPU como coprocesador de streaming.)

Y de las contribuciones[1]: "Through the use of streams, kernels and reduction operators, Brook abstracts the GPU as a streaming processor." (Traducción: Mediante el uso de streams, kernels y operadores de reducción, Brook abstrae la GPU como un procesador de streaming.) A stream es tu flujo de datos (stream) corriendo en carriles paralelos; un kernel es una función (kernel) aplicada a todo lo que va pasando; una reducción condensa el torrente en una respuesta. Cualquier problema que puedas expresar con esas tres palabras — streams, kernels, reducciones — y la multiplicación de matrices las habla con fluidez — corre en los motores del almacén sin mencionar jamás la palabra triángulo. Las pruebas, en el mismo artículo: los programas de Brook corrieron "up to seven times faster than their CPU counterparts." (Traducción: hasta siete veces más rápido que sus equivalentes en CPU.)[1] Esta figura es tinta real — dibujé a mano toda la idea del artículo en un lienzo digital, y su propio renderizador la exportó:

Hand-drawn on penecho: three parallel streams enter a kernel box and exit as one transformed stream
streams entrando, cómputo del kernel, stream saliendo — la llave de tres palabras, dibujada a mano en penecho (sus propios 200 tests en verde antes de que confiara en él)
kernel

② la misma figura en movimiento — tres corrientes azules se convierten en una naranja; el kernel nunca se mueve, los datos sí

La mecha que encendió este paper

Sigue a las personas reales. El autor principal de Brook es Ian Buck. Después del paper, se fue a NVIDIA — donde creó CUDA y hoy dirige el negocio de cómputo a gran escala (hyperscale) y HPC de la empresa[2]. CUDA (2006) es el vocabulario de Brook llevado a escala industrial. Seis años después, dos estudiantes de posgrado entrenaron una red neuronal en hardware de videojuegos, ganaron ImageNet por un margen que avergonzó al campo, y cerraron su paper con el encogimiento de hombros más consecuente de la historia de la IA — textual[3]:

"…trained on two GTX 580 3GB GPUs. All of our experiments suggest that our results can be improved simply by waiting for faster GPUs and bigger datasets to become available." (Traducción: "…entrenado en dos GPUs GTX 580 de 3GB. Todos nuestros experimentos sugieren que nuestros resultados pueden mejorarse simplemente esperando GPUs más rápidas y conjuntos de datos más grandes que estén disponibles.")

Léelo de nuevo: el paper que dio inicio a la era del deep learning termina con una solicitud de mejora de hardware. No una nueva teoría. No un prior más ingenioso. Esperando GPUs más rápidas — motores del almacén que Brook desbloqueó ocho años antes, en un paper que nunca mencionó la IA.

2004
Brook: la llave
2006
CUDA: la puerta de la industria
2012
AlexNet: 2 tarjetas de videojuegos
hoy
la factura de renta de la era de la IA

③ la mecha — veintidós años desde "por favor deja de hacerme dibujar triángulos" hasta entrenamientos de billones de parámetros

La regla de fondo, nombrada por alguien de adentro

Sara Hooker (Google Brain, luego jefa de Cohere For AI) le dio a este patrón su nombre definitivo en 2020. Textual de su resumen[4]:

"This essay introduces the term hardware lottery to describe when a research idea wins because it is suited to the available software and hardware and not because the idea is superior to alternative research directions." (Traducción: "Este ensayo introduce el término la lotería del hardware para describir cuando una idea de investigación gana porque es apta para el software y hardware disponibles y no porque la idea sea superior a otras líneas de investigación alternativas.")

Su razonamiento corta por los dos lados, y eso es lo que lo hace una perspectiva de alguien de adentro y no un eslogan: las redes neuronales mismas son una idea antigua que pasó décadas perdiendo la lotería — tachadas de fracaso mientras el hardware que necesitaban no existía. Brook y CUDA no solo aceleraron el cómputo; cambiaron qué ideas podían llegar a ser verdaderas. Si leíste mi artículo sobre la Lección Amarga, aquí está el punto de unión: Sutton dice que los métodos generales que cabalgan sobre el cómputo ganan a largo plazo — Hooker añade la letra chica: solo el cómputo que alguien se ha tomado la molestia de desbloquear. La Lección Amarga (The Bitter Lesson) nombra la marea; Brook construyó el puerto.

ensamblador de shaders — habla en triángulos, o vete (2003)
Brook — streams · kernels · reducciones (2004)
CUDA — la misma idea, a escala industrial (2006)
PyTorch y compañía — nadie recuerda que existió el candado (hoy)

④ la escalera de abstracción — cada peldaño vuelve invisible al de abajo; esa invisibilidad es el logro

Patrón: codiseño de hardware/software — cuando la capacidad supera a la usabilidad, el trabajo de mayor apalancamiento es la abstracción, no el siguiente benchmark. Los autores de Brook no hicieron más rápida la GPU; la hicieron hablable.

Antipatrón: expresar tu problema en la lengua nativa del hardware — triángulos en 2004, y hoy, retorcer ideas de investigación para que encajen en lo que premian los aceleradores actuales. Ese es el lado oscuro de la lotería del hardware: el almacén decide qué se te permite pensar.

Mecanismo: virtualización. Streams/kernels/reducciones forman un lenguaje mínimo y completo para el paralelismo de datos, así que CUALQUIER problema que encaje —segmentación de imágenes en 2004, multiplicación de matrices para siempre— se mapea sobre el silicio gráfico sin que ese silicio cambie en absoluto.

1er Principio — Los algoritmos que se alinean con las tendencias del hardware ganan; las capas de abstracción liberan cómputo dormido. Corolario: la computadora más rápida que posees es la que todavía no sabes programar.

Encuentra tu almacén cerrado esta semana (la parte SMART)

Específico: haz un inventario del cómputo y las herramientas que tienes pero que en realidad no sabes manejar —la GPU ociosa en tu escritorio, la API que pagas y usas dos veces al mes, el stack de agentes que solo su autor se atreve a tocar. Accionable: para el más grande de todos, escribe la frase Brook: "extiende [algo que ya sé hablar] para que [capacidad encerrada] se convierta en un [sustantivo con el que pueda razonar]." Esa frase es una especificación. Medible: ganaste cuando alguien que la semana pasada no podía usar la herramienta, esta semana ya la usa — la propia vara de Brook fue que desarrolladores ajenos a los gráficos ejecutaran código siete veces más rápido[1]. Con plazo: el inventario es una noche; la frase toma diez minutos; la abstracción es el trimestre. Relevante: la lotería del hardware de Hooker sigue repartiendo boletos — el próximo AlexNet está atrapado ahora mismo detrás del interruptor de encendido con forma de triángulo de alguien.

Cómo se hizo esta página (los recibos, en breve)

Una sola frase a mi allin-anything router: "learn the Brook for GPUs paper deeply, with an animation for each key idea, and sketch its stream-through-kernel pipeline by hand." (Traducción: "aprende a fondo el artículo de Brook for GPUs, con una animación para cada idea clave, y dibuja a mano su pipeline de streams a kernels.") Tres órganos respondieron, cada uno con su propia suite de pruebas en verde antes de confiar en él — el ciclo de enseñanza inversa, el linter de calidad de animaciones, y el lienzo penecho (200 pruebas en su commit fijado) cuyo propio exportador produjo la tinta de arriba. Cada cita aquí se obtuvo de la fuente primaria y se verificó carácter por carácter. La cadena se detuvo en el único paso que las máquinas no controlan: publicar fue mi clic. Los recibos —códigos de salida, commits fijados, el diario de ejecución— viven en el repo[5].

Referencias (cada enlace verificado al momento de publicar)

  1. Buck, I., Foley, T., Horn, D., Sugerman, J., Fatahalian, K., Houston, M. & Hanrahan, P. (2004). Brook for GPUs: Stream Computing on Graphics Hardware. SIGGRAPH 2004 — todas las citas son textuales, tomadas del PDF (obtenidas y verificadas al momento de publicar); página del proyecto: graphics.stanford.edu/projects/brookgpu.
  2. NVIDIA Newsroom. Ian Buck — biografía — autor principal de Brook; creador de CUDA; VP, Hyperscale and HPC Computing.
  3. Krizhevsky, A., Sutskever, I. & Hinton, G. (2012). ImageNet Classification with Deep Convolutional Neural Networks. NeurIPS — las líneas "two GTX 580 3GB GPUs" y "waiting for faster GPUs" son textuales, tomadas del PDF.
  4. Hooker, S. (2020). The Hardware Lottery. arXiv:2009.06489 — definición citada textualmente del resumen.
  5. Los recibos del proceso — veredicto del router, conteos de pruebas de cada órgano, códigos de salida, el diario de AutoRunner — en github.com/wjlgatech/allin-anything (recorrido: article-to-animated-understanding); demo en vivo: allin-anything-demo.vercel.app. Recibos del conteo de palabras para la afirmación de cero menciones del arranque: grep -ci sobre el texto del PDF de Brook para "neural", "artificial intelligence", "machine learning", "deep learning" → 0, 0, 0, 0.

Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · artículo №2 de la lista de lectura FM-os sobre IA de frontera, aprendido con todo · el siguiente en la lista: AlexNet — la mecha llega a la pólvora