一段平均只有 7.1 秒、约 333 帧的视频,每一帧看起来都只是随机噪点。暂停时画面里什么都没有,一旦播放,字母或物体轮廓才会随着运动浮现出来。这个听起来像视觉错觉的测试,却在一项公开研究中变成了多模态大模型的集体失分现场:人类标注者平均准确率达到 98%,而 25 个以上主流视频模型几乎全部得 0%。
这项名为 SpookyBench 的研究来自 KAUST 与 MBZUAI 团队,共收录 451 段“雪花视频”。测试对象覆盖 GPT-4o、Gemini 2.5 Pro、Qwen 系列、InternVL 系列等开源与闭源模型,参数规模从 20 亿到 780 亿不等。即便加入思维链推理,结果依然没有改变。问题并不在于题目太偏,而在于这些模型可能从未真正“看见”时间。
模型看视频,更像在看一组被打散的幻灯片
当前主流视频大模型的处理方式大致相同:先从视频中抽取少量关键帧,常见数量为 8 到 32 帧;再让每帧分别经过图像编码器,变成一串视觉 token;最后交给语言模型生成描述。这样的流程决定了模型擅长识别物体、场景、构图和纹理,却很难理解运动、顺序和因果。
SpookyBench 中的人类之所以能轻松识别内容,是因为大脑会按照像素的运动方向进行分组,这正是心理学中的“共同命运”原则:一起移动的像素会被自动绑定为一个整体。对现行视频模型来说,这条通路并不存在。帧采样先把连续时间切成孤立画面,视觉编码器又偏向空间特征,时间信息在进入语言模型前就已经大量丢失。
相关研究还给这种现象起了名字。CVPR 2026 的另一篇工作 WeaveTime 将其称为“Time-Agnosticism”,即时间不可知症:模型把视频当作无序证据袋,帧的先后顺序并不关键。TVBench 团队也曾把测试视频帧序随机打乱,再交给 GPT-4o 和 Gemini 1.5 Pro,发现其在 MVBench 等基准上的分数几乎没有下降。这意味着,过去不少视频理解高分可能更多来自静态识别和文本常识,而不是时序理解。
加帧数和推理步骤,并没有补上时序短板
直觉上,如果模型看不清时间,那就增加采样帧数。但现有实验没有给出理想答案。CP-Bench 设计了一个很基础的测试:镜头平移扫过一排外观一致的方块,单帧只能看到局部,模型必须跨帧累积证据才能数出总数。结果 Qwen3-VL、InternVL3、GPT-5、Gemini-3-Pro 等模型均未通过;提高采样帧率后,成绩也没有明显改善。
TempCloze 的观察进一步说明,帧密度提升后,信息反而可能被稀释,模型会更依赖视频开头和结尾作为锚点,中间加入更多帧只会增加干扰。思维链或测试时扩展虽能带来一定收益,但不同能力之间的差距并未消失。ICLR 2026 的 MMR-V 基准显示,在长视频多帧证据推理任务中,即使表现最强的 Gemini 2.5 Pro 也只有 64.3%;更早在 TemporalVQA 中,GPT-4o 的时序先后判断一致性准确率为 43.8%,人类为 90.3%。
SpookyBench 团队还做了更深入的验证。用 400 段雪花视频微调 InternVL2.5-8B 和 Qwen2-VL-7B,即使训练 30 个 epoch,模型仍无法学会识别;换用 VJEPA-2 和 DINOv3 后,连“画面中是否有内容”这种简单判断也无法学到有效信号。直到研究者使用传统光流算法 Farneback 把运动边界提前画进画面,将时间信息转成空间线索,Qwen2-VL-7B 才从 0 分提升到 51.5 分,GPT-4o 提升到 59.1 分。这说明运动信息并非不存在,而是没有进入现有模型的核心处理路径。
从评测盲区到应用风险:时序能力决定视频模型上限
更值得注意的是,时序短板并不只存在于极端噪声视频中。TempCloze 由港大、新加坡国立大学和北大团队联合提出,它给模型展示视频开头和结尾,再从四个候选片段中选出真正的中间段。所有候选片段都来自同一段视频,场景与物体相同,单靠静态画面难以区分,必须判断事件何时发生、如何展开。31 个模型测试结果显示,语义理解普遍较好,但“时序对齐”能力明显偏弱:GPT-5.4 语义得分 68,时序对齐仅 37;Claude 4.6 Sonnet 对齐得分 28.8;Qwen3VL-32B 甚至只有 10.9,低于四选一随机选择的 25 分基线。
这揭示了现有视频评测的一个盲区:许多基准测的是“发生了什么”,而不是“什么时候发生”。如果模型只是通过静态识别、语言先验或首尾线索答题,高分可能会掩盖真实的时序缺陷。
对自动驾驶和机器人来说,这一缺陷更难回避。变道车辆是先打灯还是已经开始切入,行人只是回头还是即将起步,机械臂抓取、倒水、插钥匙等动作也都依赖连续的时序和因果判断。一个无法稳定理解先后顺序的系统,很难承担实时决策任务。近期开源端到端自动驾驶模型 METEOR 等进展虽然强调纯视觉和统一网络,但前提仍是模型能理解连续动作世界。
行业已开始尝试不同路线。Google DeepMind 推出 Agentic Video Understanding,让模型通过“思考、行动、观察”的循环主动检索字幕、选取帧和音频,用工程方式弥补一次性理解长视频的不足;开源视频世界模型 SolarWM、World Labs 的 Atlas、Meta 的 VJEPA-2 等则试图从预测下一秒、理解空间和物理关系的角度重建模型能力。但最新研究也提醒,JEPA 类世界模型仍可能出现“物理表征懒惰”等新问题。
围绕视频大模型的下一步,目前大致有两种判断:一种认为随着数据、算力和模型规模继续扩大,时间感可能逐渐涌现;另一种认为必须在表征、训练目标甚至架构层面为时间信息建立独立通路。SpookyBench 的结果至少表明,仅靠现有架构扩展参数,并不能自然解决时序感知问题。当前的视频模型已经能记住画面里有什么,但离真正理解事情如何随时间展开,还有明显距离。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/dang-xue-hua-shi-pin-rang-da-mo-xing-ji-ti-jiao-bai-juan