Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語✉️ 免费订阅
← 返回作品集

AI-Native 系列 · Physical AI

机器终于能视频了。难的是教它们理解运动.

1分钟速览——你能带走什么

机器终于能「看」视频了。难的是教它们理解运动——而真正的优势不在于更大的模型,而在于一个闭环:模型→诚实评测→精选数据→更好的模型。一个15岁孩子也能跑通的思维模型,对应到真实的工程机制。属于 AI-Native 系列。

一个能描述画面的 Vision-Language Model,和一个能理解转弯的模型,根本是两码事。「看见」和「理解」之间隔着三件事——而这三件事,都跟模型大小无关。

Machines can finally watch. The hard part is motion — the same tracked object drifting across three film frames over time.

给一个现代 Vision-Language Model 看一张照片,它会告诉你左侧车道上有一辆银色轿车。这很厉害。现在给它看三十帧——那辆轿车正逐渐压线,同时一个骑车人从右侧驶入——然后问它:刚刚发生了什么,这危险吗?

从「说出画面里有什么」到「推理随时间发生了什么」,中间的这段距离,正是视频 AI 大部分真正价值所在,也是大多数系统悄悄栽跟头的地方。一个只会给画面配字幕的模型,是个举着相机的游客;一个真正理解运动的模型,才是能出庭作证的目击者。

这里有一个15岁孩子也能跑通的思维模型:看视频的 VLM 好比一个新手司机。 它已经把整本驾驶手册读完了(它「认识」汽车、车道、骑车人)。但读懂手册和读懂一条真实的路,是两回事。有三件事能把学生变成司机——它们和真实的工程实现,正好一一对应。

Student to driver: three things turn 'sees' into 'understands' — time-glue (spatiotemporal reasoning), a strict examiner (no evidence, no claim), and a curation factory that can't cheat (maker ≠ checker).

1. 时间胶水:30 张快照拼不成一个场景

如果照单纯的方式来看,模型眼中的视频只是一堆互不相关的明信片。而理解运动,意味着要把这些明信片粘在一起——追踪清楚第 3 帧里的这辆车,就是第 28 帧里的那辆车,而且它的位置正在以某种有名字的方式变化(变道、并线、异常状况)。

在实际机制里,这叫时空推理:模型不仅要给物体定位,要把它们在时间上串起来。这也是为什么你要用带传感器上下文的视频片段去微调一个开源 VLM,而不是用静态图片——也是为什么真正有意思的基准测试衡量的是时间定位,而不是字幕质量。跳过这道「时间胶水」,你得到的模型会对每一帧都说得头头是道,却对整个事件一头雾水。

学生「看到」的司机「理解」的
「一辆车。一条车道线。一个骑车人。」「一辆车正朝骑车人方向压过车道线——0:04 处的一次险些相撞。」
逐帧字幕有始有终、跨时间绑定的定位事件
对每一帧都自信满满经过校准:视野被遮挡时会说「不确定」
Animated: the same tracked car drifting across frames 3, 15, and 28 — 30 snapshots bound into one lane-change, not 'a car' three times.

2. 严格的考官:模型会自信满满地对你说谎

任何视频生成模型都有一个不能说的秘密:它会用流畅的措辞、90% 的置信度,描述一次根本没发生过的变道。如果你唯一的检验标准是「这句话听起来对不对」,那你迟早会把一个满口胡话却自信十足的模型送上线。

所以,把「看见」和「理解」区分开来的第二件事,是一个拿现实来评判答案的考官,而不是靠“听起来是否流畅”来评判。模型有没有把事件定位在正确的地点和正确的秒数(空间+时间准确性)?它的叙述在整段片段里是否前后一致,还是那辆轿车凭空瞬移了?一套智能体化评估框架会给这些维度打分——而这正是大家最容易跳过的部分——拒绝放行任何拿不出证据支撑的结论。画面里根本找不到这个事件的踪迹?那它就不是一个「发现」,而是一句语法完美的幻觉。

能救你的那条规则是:没有证据,就没有结论。一个无法复现的基准测试算不上分数——它只是一种感觉。把证据当作闸门,失败就非零退出,这样一来,一句自信满满的错误答案,就再也没人能蒙混过关地把它送上线。

这一切都不是什么新鲜事。The Royal Society 早在1662年就立下了自己的座右铭:Nullius in verba(中译:不听信任何人的一面之词)——用证据去验证。一个能把视频讲得文采飞扬的模型,恰恰就是那种老练权威的样子;而现代科学的建立,本就是为了不轻信这类权威。所谓「严格的考官」,不过是把那条已有364年历史的老规矩,对准了一台会说话的机器。

Animated: a grounded claim fills its localization/temporal/narrative bars and gets a PASS stamp; a fluent but unfounded claim stays near-empty and is REJECTED.

3. 一座作弊不了的模拟考工厂

新手司机需要几千个小时的练习,而没有哪个人愿意去手动标注一百万段「汽车变道」的片段。所以最前沿的做法,是让模型帮自己造训练数据:用当前的模型给原始素材打上候选标签,只保留多个独立推理结果彼此一致的片段,再把这批干净的数据喂回下一轮训练——也就是「用 AI 训练 AI」。

这是一个飞轮,但同时也是全场最危险的一个想法——因为一个给自己作业打分的模型,会非常乐意给自己判个满分。解决办法是一种纪律,而不是一个更大的模型:造物者不等于审核者。生成标签的那一方,绝不能同时是给标签盖章认证的那一方;一致性低的样本会被直接淘汰,绝不放行;任何自动生成的数据在进入训练之前,都要先经过人工抽检。加了闸门的筛选,会不断复利累积;没有闸门的筛选,只会把模型自己的错误洗白成「标准答案」,再逐渐把整个系统拖垮。

Animated: clips flow from raw footage through model labeling (the maker), a two-passes-agree filter that drops disagreements, a human gate (the checker), into fine-tuning, then loop back.

关键一句:真正的优势在闭环,不在模型本身

过去三十年里,视频领域最难的部分一直是表征:我们从手工设计的光流算法,一路走到学习得到的特征、双流网络、Transformer,再到今天的 VLM。这部分如今已经变成了「租来的能力」——大家跑的基本都是同一颗多模态大脑。而真正顽固地依赖手工打磨、始终没被攻克的,是评估数据筛选——这才是真正的新战场。而攻克它靠的不是更大的模型,靠的是一个更紧密的闭环:

fine-tune the VLM on real motion
      → grade it with a strict, evidence-gated examiner
      → curate new data where independent passes agree (human-gated)
      → fine-tune again
   ( each turn adds a capability; the bar ratchets up )
Animated: a pulse rides the closed loop — fine-tune the VLM on motion, grade it with an evidence-gated examiner, curate data a human gates, fine-tune again — each turn ratchets the bar up.

三个部分,一个闭环:时间胶水让模型能感知运动,考官让它无法蒙混过关,一个筛选飞轮让它无需人类逐帧标注就能不断进步。把三者拼在一起,系统每周都会从以前用不上的素材里变得更好。少了任何一个,你得到的都只是一台很会说话的摄像机。

这正是在 AI-native 的工作中反复出现的同一条道理,无论领域是驾驶视频、蛋白质折叠,还是衰老生物学:别再一次性造好工具就把它冻结起来。要工程化那些能诚实地给自己打分、并不断复利增长的闭环。模型是最便宜的部分。闭环才是护城河。


当这一切不再只是比喻

我不只是相信闭环——我把它做出来了。图里的每一个部分,都是一项开放、可运行的技能,你可以在跑它之前先读懂它。和「考官」那节一个道理:自己读代码,别只信我说的。

闭环中的部分开放技能它做什么
在运动上微调vlm-quickstart把一个开源 VLM 从零跑到能处理视频:准备视频与传感器元数据、用 LoRA/QLoRA 针对运动理解做微调、评估时空推理与定位能力,然后部署上线。
严格的考官agentic-eval用一套「LLM 当裁判」的评测框架加回归检测门,为时空推理、定位与叙事一致性打分。评测是一条可重复、带门禁的流水线——而不是一次性脚本。
无法作弊的工厂curation-loop「AI 训练 AI」:用自己的模型给视频数据集打标签、做精修,用质量与安全门禁过滤,再把结果喂回微调流程。这是一个内置了「造物者≠审核者」原则的飞轮。
为答案找依据vector-rag在视频上做检索:用 CLIP/SigLIP 编码器给片段做向量化,存入向量数据库(FAISS/Milvus/Qdrant),检索出相关的关键时刻,让 VLM 的回答扎根于它实际检索到的证据。

它们都收在一个公开的枢纽——FM-os——旁边放着我为打造这些技能而积累的知识库:约 70 篇论文、模型与实验室生态图景,还有一份精选阅读清单,全部以数据形式维护,并有实时索引,地址在 wjlgatech.github.io/FM-os。而这个闭环也不是纸上谈兵——我在另一个领域完整跑通过一遍,longevity-loop,那里一项任务如果没有「前后对比」的结果,就不能标记为「完成」。规矩一样,换了素材。

我是怎么给这个说法做压力测试的(三重验证)

讲一个好故事很便宜。我用三种时间尺度来检验这个说法,这样它就不只是一面之词:

Animated: three cards slide in — Last 30 days (is it hot? STSBench, STRIDE-QA, the cyclist paper), Last 30 years (did it survive? representation got solved, evaluation didn't), Last 300 years (is it ancient? Nullius in verba, 1662).

接着读

本文属于 AI-Native 系列。技能、知识库和跑通的闭环全部开源在 github.com/wjlgatech/FM-os ——去读代码,别只信我说的。