Serie AI-Native · IA Física
Las máquinas por fin pueden ver video. Lo difícil es enseñarles a entender el movimiento.
El resumen de 1 minuto — qué te vas a llevar
Las máquinas por fin pueden ver video. Lo difícil es enseñarles a entender el movimiento — y la ventaja no está en un modelo más grande, sino en un ciclo cerrado: modelo → evaluación honesta → datos curados → mejor modelo. Un modelo mental que hasta un chico de 15 años puede seguir, mapeado a la maquinaria real. Parte de la serie AI-Native.
Un Vision-Language Model que describe un cuadro no es lo mismo que uno que entiende un giro. Tres cosas separan el "ver" del "entender" — y ninguna de ellas es un modelo más grande.
Muéstrale a un Vision-Language Model moderno una foto y te va a decir que hay un sedán plateado en el carril izquierdo. Impresionante. Ahora muéstrale treinta cuadros de ese sedán derivando hacia la línea del carril mientras un ciclista entra por la derecha, y pregúntale: qué acaba de pasar, y si fue peligroso.
Esa brecha — entre nombrar lo que hay en una imagen y razonar sobre lo que está pasando a lo largo del tiempo — es donde realmente vive la mayor parte del valor de la IA de video, y donde la mayoría de los sistemas se caen en silencio. Un modelo que describe cuadros es un turista con una cámara. Un modelo que entiende el movimiento es un testigo que puede declarar.
Acá va el modelo mental que hasta un chico de 15 años puede seguir: una VLM que mira video es un conductor principiante. Se leyó el manual completo ("conoce" los autos, los carriles, los ciclistas). Pero conocer el manual no es lo mismo que leer una carretera. Tres cosas convierten al estudiante en conductor — y se corresponden, una a una, con la ingeniería real.
1. Pegamento temporal: 30 instantáneas no son una escena
Ingenuamente, un modelo ve el video como una pila de postales sin relación entre sí. Entender el movimiento significa pegar las postales entre sí — rastrear que este auto en el fotograma 3 es el mismo auto en el fotograma 28, y que su posición está cambiando de una manera que tiene nombre (un cambio de carril, una incorporación, una anomalía).
En la maquinaria esto es razonamiento espaciotemporal: el modelo tiene que localizar objetos y vincularlos a través del tiempo. Por eso se hace fine-tuning de una VLM abierta con clips que incluyen contexto de sensores, no con imágenes fijas — y por eso los benchmarks interesantes miden el anclaje temporal, no la calidad de los subtítulos. Sáltate el pegamento temporal y obtienes un modelo elocuente sobre cada fotograma y despistado sobre el evento.
| El estudiante "ve" | El conductor "entiende" |
|---|---|
| "Un auto. Una línea de carril. Un ciclista." | "Un auto cruzando una línea de carril hacia un ciclista — un casi choque a los 0:04." |
| Subtítulo por fotograma | Evento localizado, vinculado a través del tiempo, con un inicio y un final |
| Seguro en cada fotograma | Calibrado: dice "no estoy seguro" cuando la vista está ocluida |
2. Un examinador estricto: el modelo te mentirá con total confianza
El secreto sucio de cualquier modelo generativo en video: describirá un cambio de carril que nunca ocurrió, en prosa impecable, con un 90% de confianza. Si tu única prueba es "¿suena bien la frase?", vas a terminar publicando un fabulador de lo más convincente.
Así que lo segundo que separa el "ver" del "entender" es un examinador que evalúa la respuesta contra la realidad, no contra la fluidez. ¿Localizó el modelo el evento en el lugar correcto y en los segundos correctos (precisión espacial + temporal)? ¿Se mantiene consistente su relato a lo largo del clip, o el sedán se teletransporta? Una evaluación agéntica puntúa esos ejes con un arnés de evaluación y —esta es la parte que la gente se salta— se niega a aprobar una afirmación que no pueda respaldar con evidencia. ¿No hay rastro del evento en los fotogramas? Entonces no es un hallazgo. Es una alucinación con buena gramática.
La regla que te salva: sin evidencia, no hay afirmación. Un benchmark que no se puede reproducir no es un puntaje: es una sensación. Exige evidencia, haz que el proceso falle con un código de error cuando no la haya, y una respuesta segura de sí misma pero equivocada deja de ser viable para producción.
Nada de esto es nuevo. La Royal Society adoptó su lema en 1662: Nullius in verba — "take nobody's word for it" (Traducción: "no confíes en la palabra de nadie"), verifica con evidencia. Un modelo que narra un video en prosa impecable es exactamente esa autoridad pulida y persuasiva de la que la ciencia moderna se propuso desconfiar. El examinador no es más que esa regla de 364 años, apuntada ahora a una máquina que habla.
3. Una fábrica de exámenes de práctica a prueba de trampas
El estudiante conductor necesita miles de horas de práctica, y ningún humano quiere etiquetar a mano un millón de clips de "el auto cambia de carril". Así que la jugada de vanguardia es dejar que el modelo ayude a crear sus propios datos de entrenamiento: usar el modelo actual para proponer etiquetas sobre metraje crudo, quedarse solo con los clips donde coinciden pasadas independientes, y devolver el conjunto limpio a la siguiente ronda. "IA entrenando IA".
Es un volante de inercia, y también es la idea más peligrosa de la sala —porque un modelo que corrige su propia tarea inventará una A con gusto. La solución es una disciplina, no un modelo más grande: creador ≠ verificador. Lo que genera las etiquetas nunca es lo mismo que las certifica; las muestras con bajo acuerdo se descartan en lugar de promoverse, y un humano revisa la muestra antes de que cualquier dato autogenerado entre al entrenamiento. La curaduría con una compuerta se acumula. La curaduría sin ella blanquea los propios errores del modelo como "verdad de referencia" y pudre en silencio todo el sistema.
La conclusión: la ventaja está en el bucle, no en el modelo
Durante treinta años, lo difícil del video fue la representación: pasamos del flujo óptico hecho a mano, a las características aprendidas, a las redes de dos flujos, a los transformers, a los VLM de hoy. Esa parte ya es un alquiler —todos corren más o menos el mismo cerebro multimodal. Lo que se mantuvo tercamente manual —la evaluación y la curaduría de datos— es la nueva frontera. Y no se gana con un modelo más grande. Se gana con un el bucle cerrado:
fine-tune the VLM on real motion
→ grade it with a strict, evidence-gated examiner
→ curate new data where independent passes agree (human-gated)
→ fine-tune again
( each turn adds a capability; the bar ratchets up )
Tres partes, un solo bucle: el pegamento temporal para que el modelo perciba el movimiento, un examinador para que no pueda fingir que sabe, y un volante de curaduría para que mejore sin que un humano etiquete cada fotograma. Ensámblalos y el sistema mejora cada semana con metraje que antes era inservible. Omite cualquiera de los tres y lo que tienes es una cámara muy elocuente.
Es la misma lección que sigue apareciendo en todo el trabajo AI-native, ya sea en el video de manejo, el plegado de proteínas o la biología del envejecimiento: deja de generar herramientas una sola vez y congelarlas. Diseña bucles que se autoevalúen con honestidad y que se multipliquen con el tiempo. El modelo es la parte más barata. El bucle es el foso.
Dónde esto deja de ser una metáfora
No solo creo en el bucle: lo despliego. Cada parte del diagrama es una skill abierta y ejecutable que puedes leer antes de correrla. La misma regla de la casa que aplica al examinador: read the code, don't take my word for it (Traducción: lee el código, no te quedes con mi palabra).
| Parte del bucle | Skill abierta | Qué hace |
|---|---|---|
| Ajuste fino sobre movimiento | vlm-quickstart | Lleva un VLM abierto desde cero hasta funcionando con video: prepara video + metadatos de sensores, hace fine-tuning con LoRA/QLoRA para entender el movimiento, evalúa el razonamiento espaciotemporal + localización, y lo sirve. |
| El examinador estricto | agentic-eval | Califica el razonamiento espaciotemporal, la localización y la consistencia narrativa con un harness LLM-as-judge + compuertas de regresión. La evaluación como un pipeline repetible y con compuertas — no un script de un solo uso. |
| La fábrica que no puede hacer trampa | curation-loop | "IA entrenando IA": usa tu propio modelo para etiquetar/refinar un dataset de video, filtra con compuertas de calidad + seguridad, y lo reinyecta al fine-tuning. El volante de inercia, con maker ≠ checker incorporado. |
| Fundamentar la respuesta | vector-rag | Recuperación sobre video: embebe clips con un encoder CLIP/SigLIP, indexa en una base de datos vectorial (FAISS/Milvus/Qdrant), recupera los momentos relevantes, y fundamenta la respuesta del VLM en lo que realmente recuperó. |
Todo esto vive en un solo repositorio público — FM-os — junto a la base de conocimiento que construí para ganármelo: ~70 papers, el panorama de modelos y laboratorios, y una lista curada de lecturas, todo guardado como datos con un índice actualizado en wjlgatech.github.io/FM-os. Y el loop no es un experimento mental — lo corrí de punta a punta en otro dominio, longevity-loop, donde una tarea no puede marcarse como "hecha" sin un resultado de antes→después. La misma disciplina, con otro material.
Cómo puse esto a prueba (tres telescopios)
Una buena historia sale barata. Verifiqué la afirmación con tres horizontes de tiempo distintos, para que no dependa de uno solo:
- Últimos 30 días. El campo está corriendo para construir exactamente este árbitro: STSBench puntúa el razonamiento espaciotemporal contra percepción 3D; STRIDE-QA son 16M de pares de preguntas y respuestas de manejo sobre 270K frames; y un paper de 2026 pregunta literalmente si los VLM de manejo generalizan a ciclistas — exactamente el caso límite con el que abrí este texto. El cuello de botella que todos reportan es el mismo: no es el modelo, es la evaluación.
- Últimos 30 años. La representación se resolvió en público — flujo óptico → CNNs → transformers → VLMs. La evaluación y la curación, no; siguieron siendo artesanales. Esa brecha es toda la oportunidad.
- Últimos 300 años. Nullius in verba, 1662. La regla más antigua de la ciencia moderna es "sin evidencia, no hay afirmación". No estamos inventando el rigor para la IA de video — apenas se lo estamos aplicando a una máquina que sabe hablar para salirse con la suya.
Sigue leyendo
Parte de la serie AI-Native. Las skills, la base de conocimiento y el bucle completo están abiertos en github.com/wjlgatech/FM-os — lee el código, no te quedes con mi palabra.