佛罗里达大学牵头的团队报告称,重复的视觉图案可能导致立体相机和 AI 深度模型把物体判断在错误的距离上。在受控实验中,装在移动地面车辆和汽车上的相机产生了错误的障碍物估计;这种错误持续时间足以达到研究人员为自动驾驶软件引用的响应阈值。

这项9 月 14 日发布于 arXiv 的研究将这些误差与相机把光线转换成像素以及两路图像的对齐方式联系起来。研究还测试了一种软件防御方法。对于开发或评估自主系统的人来说,关键发现是:在受测的学习式深度模型中,存在一种具体且持续的失效机制,同时研究也提供了有关如何降低误差的证据。

重大变化

  • 变化内容:研究人员把重复图案造成的歧义与可测量的相机伪影联系起来,并展示了传统立体匹配算法和学习式模型中的深度误差。在受测系统中,仅仅把匹配算法换成 AI 并不能消除这一弱点。
  • 为何重要:距离估计是障碍物检测的输入。在这些实验中,行驶路线旁的一辆厢式车可能被感知为路线内的障碍物。因此,深度估计是否可靠会影响车辆的下一步决策。
  • 关注事项:拟议的防御方法会检查匹配过程是否存在重复模式。其初步结果仅覆盖有限的图像集;要决定是否采用,还需确认它在其他相机、模型和运行条件下是否可靠。

重复模式如何改变距离估计

立体相机利用同一场景的两个视角。软件在每张图像中寻找同一特征,并测量其水平位移,也称视差。相机几何参数再将该位移换算为距离。

重复图案会产生多个看似合理的匹配结果。论文的分析指出,错误匹配胜出的原因有两种。首先,每台相机都会把场景采样到像素网格上。深色形状与明亮背景的边界在两张图像对应的网格上可能落在不同位置,从而产生略有差异的像素强度。其次,残余的校准误差会扭曲两张图像之间的对应关系。

这些因素叠加后,可能使另一处重复图案比正确图案更像参考特征。由此得到的位移会把表面定位在错误距离上。团队还在学习式立体模型中发现了这种敏感性;这类模型会比较从图像中提取的特征。

这些图案是经过刻意挑选的。研究的威胁模型假定攻击者了解相机及相关处理设置,或能接触到可供评估的相似系统。在佛罗里达大学 9 月 22 日的研究介绍中,研究负责人 Sara Rampazzi 还指出,自然环境中出现的重复图案也可能引发安全问题。该研究没有测量普通路边纹理在已部署车辆中造成危险误差的频率。

测试覆盖了感知系统的不同环节

研究人员结合了录制图像实验、实体相机测量和模拟。

评估

系统与条件

测量内容

经修改的驾驶图像

在 7,518 对 KITTI 立体图像上叠加图案;使用 BM 和 SGBM 匹配算法,以及 PSMNet、MoCha-Stereo 和 UniMatch

比较传统方法与学习式方法估算的深度变化

立体视觉与 LiDAR 融合

SGM-DDC,使用合成的 LiDAR 点云表示平墙

评估这种融合方法能否抵御图案诱发的误差

实体相机测试

ZED2 和 RealSense 相机,测试环境包括室内和室外

显示或投影图案造成的深度误差

实体运动测试

安装在 AgileX Hunter 2.0 地面车辆上的相机以 10 公里/小时行驶,汽车约以 15 公里/小时行驶

车辆运动过程中错误深度估计持续了多久

较高速度的模拟

在 CARLA 中以 10、20、30 和 40 公里/小时模拟驾驶,并用 BM 处理立体图像

模拟驾驶中的深度误差持续时间

论文和其工件附录将 RealSense 传感器标为 D435。作者的演示页面则标为 D435i;这些来源对具体型号的描述并不一致,无法据此确定确切型号。

在一项室内测试中,距相机三米的表面在选定图案条件下,被 ZED2 估计为距相机 0.8 米,被 RealSense 估计为 0.6 米。

SGM-DDC 使用 LiDAR 距离约束立体匹配;与未融合的方法相比,它对图案变化的抵抗力更强,但在受测配置下仍会产生误差。合成的 LiDAR 输入意味着,这一发现仅适用于构造条件下的一种融合方法。

驾驶测试证实了错误的障碍物感知

在实体汽车实验中,研究团队把图案投射到一辆停在汽车行驶轨迹旁的厢式车上。错误的深度估计使该表面的一部分被感知为位于汽车行驶路径内。论文结果表显示,在两种相机和不同光照条件下,错误估计持续时间约为 0.7 至 1.2 秒。

在下游评估中,研究人员使用 Autoware 的欧几里得聚类算法,将深度图中彼此接近的点归为潜在障碍物。当错误点被检测为障碍物时,研究人员将该次试验计为成功。他们引用了 0.5 秒的持续时间阈值,认为这足以触发自动响应,例如紧急制动。工件附录也说明,评估使用了录制的点云,并测量错误深度聚类持续的时间。

报告中的评估没有记载实体紧急制动操作、测得的减速度或碰撞。佛罗里达大学将可能发生的碰撞和急刹车造成的危险描述为研究提出的风险。这些结果并未在所报告的实验中得到实际验证。

实体测试在受控环境中进行,最高速度为 15 公里/小时。40 公里/小时的结果来自 CARLA:模拟中的深度操纵持续了 2.1 秒。单独的模拟扩展了研究条件,但不能证明曾以该速度开展实体测试。

一种防御方法会检查重复的候选匹配

拟议的防御方法会检查用于比较两张图像的评分。重复结构会产生一连串反复出现的合理匹配。该方法会检测这种规律,并将受影响区域作为更大的整体进行匹配,从而降低选错重复元素的可能性。

作者报告称,在物理测试条件下采集的 200 对立体图像中,96.5% 的评估案例的深度误差降至半米以下。他们还将该方法改造用于 PSMNet 内部的中间匹配信息。在添加了图案的 200 对 KITTI 图像上,该版本在所有评估案例中都将误差降至 0.1 米以下。

针对学习式模型的防御结果仅适用于 PSMNet;它不能证明对 MoCha-Stereo 或 UniMatch 也有相同效果。研究还将实体实验限定在平坦或近似平坦的投影表面,并在动态测试中使用固定图案。论文讨论部分显示,训练数据会改变哪些图案会影响模型,以及影响程度。

这些实验提示系统开发人员应检查重复图案对相机处理和学习式深度估计的影响。该防御方法在已部署系统全部运行条件下的表现仍未得到证实。

作者将论文列为即将在 ACM CCS 2026 发表。该会议官网列出的日期为 11 月 15 日至 19 日,地点在海牙,并称最终日程仍在编制中。该研究尚未在会上发表。

来源与延伸阅读

  • 《深度幻象:揭示深度估计中的隐蔽立体视觉漏洞》,2026 年 9 月 14 日。全文提供了失效机制、评估的算法和相机、实体与模拟测试条件、防御结果及其局限。论文报告的车辆后果是错误的障碍物感知,并引用了响应时间阈值;研究方法并未记载实际制动操作或碰撞。
  • 佛罗里达大学研究介绍,2026 年 9 月 22 日。介绍了研究团队的解释和其提出的安全影响。碰撞和急刹车情形描述的是可能后果,并非已观察到的事件。
  • 作者的演示页面与研究工件,于 2026 年 9 月 24 日查阅。工件附录说明了图像、点云和模拟评估。演示页面的说明文字称相机为 D435i,而论文和附录称 D435。BIG CHANGE 未重新运行这些实验。
  • ACM CCS 2026,于 2026 年 9 月 24 日查阅。确认了会议日期和地点。论文即将发表的状态由作者说明;本文查阅的会议页面未提供具体报告时段。