
最近和做 AI 视频生成的朋友聊到一个特别有意思的现象各种科幻感十足、画面精致的 AI 视频已经越来越常见但当你让它生成一个“艾姆斯错觉房间”时它反而会翻车。艾姆斯错觉是视觉心理学里最经典的视错觉实验之一——在一个看起来正常的房间里与观察者距离不同的两个人会被大脑判断成完全不同的身高。你可能会说这不过是一个冷门的心理实验和实际工程有什么关系这里需要先给出一个明确判断视频模型难以复现艾姆斯错觉并不是某个模型做得不够好而是当前视频生成技术路线在“物理一致性”上存在结构性短板。它可以生成漂亮的画面却不擅长维护矛盾的空间线索它知道“房间应该长什么样”却并不真正理解透视、深度和物体尺寸之间的关系。这篇文章会从原理、原因、验证方法和工程实践四个角度讲清楚为什么视频生成模型难以复现艾姆斯错觉以及当我们在做视频生成、模型评测和空间智能应用时应该如何看待这个问题。读完你会明白一个更深的道理视频生成模型的真正瓶颈不是画面清晰度而是它离物理世界还有多远。为了把这个结论讲扎实我会先用一个常见的事件切入过去一年开源视频模型和商业视频模型的竞争越来越激烈但大家衡量模型好坏时往往只盯着“镜头稳定性”“画面美观度”“文本一致性”。很少有人认真思考一个问题模型生成的一段视频是否保持了物体大小、深度、遮挡关系在物理上的连续一致艾姆斯错觉恰好把这个问题推到了极端。如果你想判断一个视频生成模型适不适合做和空间、物理、仿真相关的任务跑一个艾姆斯错觉小实验往往比看一堆样片更有效。1. 艾姆斯错觉为什么是视频模型的“照妖镜”艾姆斯错觉的核心原理并不复杂。20 世纪 30 年代美国画家、心理学家 Adelbert Ames Jr. 设计了一个特殊房间从观察者的窥孔方向看房间是标准的长方形但实际上两侧墙壁长度并不相同地面和天花板也是倾斜的。当一个人站在房间的左侧另一个人站在右侧时观察者会看到左边的人异常高大右边的人异常矮小。大脑被“这是一个正常矩形房间”的先验欺骗了。人类视觉系统在估计物体大小和距离时会依赖大量深度线索包括双目视差、物体遮挡、纹理梯度、已知物体大小、重力方向等。正常情况下这些线索相互印证因此我们的空间判断是可靠的。但艾姆斯房间通过改造墙体形状让这些线索在“物理事实”和“视觉经验”之间产生了冲突。大脑最终选择了“正常房间”的经验假设于是把两个真实身高相同的人解读成了完全不同的身高。它本质上是视觉先验和几何事实之间的冲突。当这个测试从静态图片变成动态视频时难度会大幅上升。因为视频生成模型不仅要把房间画得像生成两个人物还要在一段连续镜头中维持“看起来合理但物理上矛盾”的空间结构。模型需要同时做两件事一是理解正常房间的视觉先验二是理解这个特殊房间的几何变形如何制造错觉。对当前主流的视频生成模型来说这两件事是彼此冲突的。小结论艾姆斯错觉对视频模型来说是一个浓缩程度很高的“物理一致性测试”。如果一个几何上如此简单的场景都无法稳定复现那么更复杂的遮挡、碰撞、刚体运动、因果推理就更难保证正确了。这也是为什么越来越多做模型评测的人开始把这类视错觉场景加入测试集。2. 视频生成模型的基本原理统计先验不等于物理理解要弄清楚视频模型为什么难以复现艾姆斯错觉需要先理解当今视频生成模型是怎么工作的。主流的视频生成模型一般包括三个核心部分文本编码器负责把 Prompt 转成语义向量图像或视频 VAE 负责压缩和重建像素扩散模型或 Diffusion Transformer 在压缩后的隐空间中迭代去噪逐步生成视频帧。为了让画面在时间维度上连贯模型还会加入时序注意力模块让每一帧和前后帧建立关联。这个架构的强项在于它可以从海量视频数据中学到整体分布。模型见过“人在房间里走动”“镜头缓缓推近”“风吹树叶摆动”这些高频场景后就可以生成在统计意义上非常自然的运动画面。这也解释了为什么 AI 视频在“画面好看”“镜头流畅”两个维度上进步神速因为训练数据里的高质量画面数量巨大模型很容易学到这一类模式。但问题在于模型并没有显式建立一个三维空间。它的内部没有相机内参数没有深度缓冲没有刚体运动学方程。视频生成模型的推理过程本质上是在做一个“看起来合理”的采样从随机噪声出发逐步修正让最终生成的每一帧更接近训练数据中出现过的高概率模式。换句话说它是在做统计猜测而不是在做物理仿真。这种设计带来的结果是遇到“普通人经常看到的模式”模型表现