Paul Jialiang Wu agentic-portfolio English 中文 한국어 日本語✉️ Lista gratis
← Volver al portafolio

Serie AI-Native · IA Física

Las máquinas por fin pueden ver video. Lo difícil es enseñarles a entender el movimiento.

El resumen de 1 minuto — qué te vas a llevar

Las máquinas por fin pueden ver video. Lo difícil es enseñarles a entender el movimiento — y la ventaja no está en un modelo más grande, sino en un ciclo cerrado: modelo → evaluación honesta → datos curados → mejor modelo. Un modelo mental que hasta un chico de 15 años puede seguir, mapeado a la maquinaria real. Parte de la serie AI-Native.

Un Vision-Language Model que describe un cuadro no es lo mismo que uno que entiende un giro. Tres cosas separan el "ver" del "entender" — y ninguna de ellas es un modelo más grande.

Machines can finally watch. The hard part is motion — the same tracked object drifting across three film frames over time.

Muéstrale a un Vision-Language Model moderno una foto y te va a decir que hay un sedán plateado en el carril izquierdo. Impresionante. Ahora muéstrale treinta cuadros de ese sedán derivando hacia la línea del carril mientras un ciclista entra por la derecha, y pregúntale: qué acaba de pasar, y si fue peligroso.

Esa brecha — entre nombrar lo que hay en una imagen y razonar sobre lo que está pasando a lo largo del tiempo — es donde realmente vive la mayor parte del valor de la IA de video, y donde la mayoría de los sistemas se caen en silencio. Un modelo que describe cuadros es un turista con una cámara. Un modelo que entiende el movimiento es un testigo que puede declarar.

Acá va el modelo mental que hasta un chico de 15 años puede seguir: una VLM que mira video es un conductor principiante. Se leyó el manual completo ("conoce" los autos, los carriles, los ciclistas). Pero conocer el manual no es lo mismo que leer una carretera. Tres cosas convierten al estudiante en conductor — y se corresponden, una a una, con la ingeniería real.

Student to driver: three things turn 'sees' into 'understands' — time-glue (spatiotemporal reasoning), a strict examiner (no evidence, no claim), and a curation factory that can't cheat (maker ≠ checker).

1. Pegamento temporal: 30 instantáneas no son una escena

Ingenuamente, un modelo ve el video como una pila de postales sin relación entre sí. Entender el movimiento significa pegar las postales entre sí — rastrear que este auto en el fotograma 3 es el mismo auto en el fotograma 28, y que su posición está cambiando de una manera que tiene nombre (un cambio de carril, una incorporación, una anomalía).

En la maquinaria esto es razonamiento espaciotemporal: el modelo tiene que localizar objetos y vincularlos a través del tiempo. Por eso se hace fine-tuning de una VLM abierta con clips que incluyen contexto de sensores, no con imágenes fijas — y por eso los benchmarks interesantes miden el anclaje temporal, no la calidad de los subtítulos. Sáltate el pegamento temporal y obtienes un modelo elocuente sobre cada fotograma y despistado sobre el evento.

El estudiante "ve"El conductor "entiende"
"Un auto. Una línea de carril. Un ciclista.""Un auto cruzando una línea de carril hacia un ciclista — un casi choque a los 0:04."
Subtítulo por fotogramaEvento localizado, vinculado a través del tiempo, con un inicio y un final
Seguro en cada fotogramaCalibrado: dice "no estoy seguro" cuando la vista está ocluida
Animated: the same tracked car drifting across frames 3, 15, and 28 — 30 snapshots bound into one lane-change, not 'a car' three times.

2. Un examinador estricto: el modelo te mentirá con total confianza

El secreto sucio de cualquier modelo generativo en video: describirá un cambio de carril que nunca ocurrió, en prosa impecable, con un 90% de confianza. Si tu única prueba es "¿suena bien la frase?", vas a terminar publicando un fabulador de lo más convincente.

Así que lo segundo que separa el "ver" del "entender" es un examinador que evalúa la respuesta contra la realidad, no contra la fluidez. ¿Localizó el modelo el evento en el lugar correcto y en los segundos correctos (precisión espacial + temporal)? ¿Se mantiene consistente su relato a lo largo del clip, o el sedán se teletransporta? Una evaluación agéntica puntúa esos ejes con un arnés de evaluación y —esta es la parte que la gente se salta— se niega a aprobar una afirmación que no pueda respaldar con evidencia. ¿No hay rastro del evento en los fotogramas? Entonces no es un hallazgo. Es una alucinación con buena gramática.

La regla que te salva: sin evidencia, no hay afirmación. Un benchmark que no se puede reproducir no es un puntaje: es una sensación. Exige evidencia, haz que el proceso falle con un código de error cuando no la haya, y una respuesta segura de sí misma pero equivocada deja de ser viable para producción.

Nada de esto es nuevo. La Royal Society adoptó su lema en 1662: Nullius in verba — "take nobody's word for it" (Traducción: "no confíes en la palabra de nadie"), verifica con evidencia. Un modelo que narra un video en prosa impecable es exactamente esa autoridad pulida y persuasiva de la que la ciencia moderna se propuso desconfiar. El examinador no es más que esa regla de 364 años, apuntada ahora a una máquina que habla.

Animated: a grounded claim fills its localization/temporal/narrative bars and gets a PASS stamp; a fluent but unfounded claim stays near-empty and is REJECTED.

3. Una fábrica de exámenes de práctica a prueba de trampas

El estudiante conductor necesita miles de horas de práctica, y ningún humano quiere etiquetar a mano un millón de clips de "el auto cambia de carril". Así que la jugada de vanguardia es dejar que el modelo ayude a crear sus propios datos de entrenamiento: usar el modelo actual para proponer etiquetas sobre metraje crudo, quedarse solo con los clips donde coinciden pasadas independientes, y devolver el conjunto limpio a la siguiente ronda. "IA entrenando IA".

Es un volante de inercia, y también es la idea más peligrosa de la sala —porque un modelo que corrige su propia tarea inventará una A con gusto. La solución es una disciplina, no un modelo más grande: creador ≠ verificador. Lo que genera las etiquetas nunca es lo mismo que las certifica; las muestras con bajo acuerdo se descartan en lugar de promoverse, y un humano revisa la muestra antes de que cualquier dato autogenerado entre al entrenamiento. La curaduría con una compuerta se acumula. La curaduría sin ella blanquea los propios errores del modelo como "verdad de referencia" y pudre en silencio todo el sistema.

Animated: clips flow from raw footage through model labeling (the maker), a two-passes-agree filter that drops disagreements, a human gate (the checker), into fine-tuning, then loop back.

La conclusión: la ventaja está en el bucle, no en el modelo

Durante treinta años, lo difícil del video fue la representación: pasamos del flujo óptico hecho a mano, a las características aprendidas, a las redes de dos flujos, a los transformers, a los VLM de hoy. Esa parte ya es un alquiler —todos corren más o menos el mismo cerebro multimodal. Lo que se mantuvo tercamente manual —la evaluación y la curaduría de datos— es la nueva frontera. Y no se gana con un modelo más grande. Se gana con un el bucle cerrado:

fine-tune the VLM on real motion
      → grade it with a strict, evidence-gated examiner
      → curate new data where independent passes agree (human-gated)
      → fine-tune again
   ( each turn adds a capability; the bar ratchets up )
Animated: a pulse rides the closed loop — fine-tune the VLM on motion, grade it with an evidence-gated examiner, curate data a human gates, fine-tune again — each turn ratchets the bar up.

Tres partes, un solo bucle: el pegamento temporal para que el modelo perciba el movimiento, un examinador para que no pueda fingir que sabe, y un volante de curaduría para que mejore sin que un humano etiquete cada fotograma. Ensámblalos y el sistema mejora cada semana con metraje que antes era inservible. Omite cualquiera de los tres y lo que tienes es una cámara muy elocuente.

Es la misma lección que sigue apareciendo en todo el trabajo AI-native, ya sea en el video de manejo, el plegado de proteínas o la biología del envejecimiento: deja de generar herramientas una sola vez y congelarlas. Diseña bucles que se autoevalúen con honestidad y que se multipliquen con el tiempo. El modelo es la parte más barata. El bucle es el foso.


Dónde esto deja de ser una metáfora

No solo creo en el bucle: lo despliego. Cada parte del diagrama es una skill abierta y ejecutable que puedes leer antes de correrla. La misma regla de la casa que aplica al examinador: read the code, don't take my word for it (Traducción: lee el código, no te quedes con mi palabra).

Parte del bucleSkill abiertaQué hace
Ajuste fino sobre movimientovlm-quickstartLleva un VLM abierto desde cero hasta funcionando con video: prepara video + metadatos de sensores, hace fine-tuning con LoRA/QLoRA para entender el movimiento, evalúa el razonamiento espaciotemporal + localización, y lo sirve.
El examinador estrictoagentic-evalCalifica el razonamiento espaciotemporal, la localización y la consistencia narrativa con un harness LLM-as-judge + compuertas de regresión. La evaluación como un pipeline repetible y con compuertas — no un script de un solo uso.
La fábrica que no puede hacer trampacuration-loop"IA entrenando IA": usa tu propio modelo para etiquetar/refinar un dataset de video, filtra con compuertas de calidad + seguridad, y lo reinyecta al fine-tuning. El volante de inercia, con maker ≠ checker incorporado.
Fundamentar la respuestavector-ragRecuperación sobre video: embebe clips con un encoder CLIP/SigLIP, indexa en una base de datos vectorial (FAISS/Milvus/Qdrant), recupera los momentos relevantes, y fundamenta la respuesta del VLM en lo que realmente recuperó.

Todo esto vive en un solo repositorio público — FM-os — junto a la base de conocimiento que construí para ganármelo: ~70 papers, el panorama de modelos y laboratorios, y una lista curada de lecturas, todo guardado como datos con un índice actualizado en wjlgatech.github.io/FM-os. Y el loop no es un experimento mental — lo corrí de punta a punta en otro dominio, longevity-loop, donde una tarea no puede marcarse como "hecha" sin un resultado de antes→después. La misma disciplina, con otro material.

Cómo puse esto a prueba (tres telescopios)

Una buena historia sale barata. Verifiqué la afirmación con tres horizontes de tiempo distintos, para que no dependa de uno solo:

Animated: three cards slide in — Last 30 days (is it hot? STSBench, STRIDE-QA, the cyclist paper), Last 30 years (did it survive? representation got solved, evaluation didn't), Last 300 years (is it ancient? Nullius in verba, 1662).

Sigue leyendo

Parte de la serie AI-Native. Las skills, la base de conocimiento y el bucle completo están abiertos en github.com/wjlgatech/FM-os — lee el código, no te quedes con mi palabra.