Patrones visuales repetidos pueden hacer que las cámaras estéreo y los modelos de IA para estimar profundidad sitúen objetos a una distancia equivocada, según un equipo dirigido por la Universidad de Florida. En experimentos controlados, las cámaras instaladas en un robot terrestre móvil y un coche produjeron falsas estimaciones de obstáculos que persistieron el tiempo suficiente para alcanzar un umbral de respuesta que, según los investigadores, utiliza el software de conducción autónoma.
El estudio, publicado en arXiv el 14 de septiembre, relaciona esos errores con la forma en que las cámaras convierten la luz en píxeles y alinean sus dos imágenes. También prueba una defensa de software. Para quienes desarrollan o evalúan sistemas autónomos, el hallazgo útil es un mecanismo de fallo concreto que también aparece en modelos de profundidad aprendidos, junto con pruebas de cómo puede reducirse.
El gran cambio
- Qué ha cambiado: Los investigadores relacionan la ambigüedad de los patrones visuales repetidos con artefactos medibles de las cámaras y, después, muestran errores de profundidad tanto en la correspondencia estéreo convencional como en modelos aprendidos. En los sistemas probados, sustituir el algoritmo de correspondencia por IA no eliminó la debilidad.
- Por qué importa: Las estimaciones de distancia alimentan la detección de obstáculos. En estos experimentos, una furgoneta junto a la trayectoria de conducción podía percibirse como un obstáculo situado en ella. Por eso, la fiabilidad de la estimación de profundidad es pertinente para la siguiente decisión del vehículo.
- Qué conviene observar: La defensa propuesta comprueba si se repiten las coincidencias. Sus resultados prometedores se limitan a conjuntos de imágenes acotados; para adoptarla, aún hay que determinar su fiabilidad con otras cámaras, modelos y condiciones de funcionamiento.
Cómo la repetición altera la estimación de distancia
Una cámara estéreo utiliza dos vistas de la misma escena. El software encuentra un rasgo en cada imagen y mide su desplazamiento horizontal, llamado disparidad. La geometría de la cámara convierte ese desplazamiento en una distancia.
Un patrón repetido genera varias coincidencias posibles. El análisis del artículo identifica dos formas en que puede imponerse la coincidencia incorrecta. Primero, cada cámara muestrea la escena en una cuadrícula de píxeles. El límite entre una forma oscura y un fondo claro puede caer en posiciones distintas en las dos cuadrículas y producir intensidades de píxel ligeramente diferentes. Segundo, los errores residuales de calibración distorsionan la correspondencia entre las imágenes.
En conjunto, esos efectos pueden hacer que otra repetición se parezca más al patrón de referencia que la correcta. El desplazamiento resultante sitúa la superficie a una distancia equivocada. El equipo también encontró esta sensibilidad en modelos estéreo aprendidos, que comparan características extraídas de las imágenes.
Los patrones se seleccionaron deliberadamente. El modelo de amenaza del estudio presupone que se conocen la cámara y los ajustes de procesamiento pertinentes, o que se puede acceder a un sistema comparable para evaluarlo. En la descripción de la investigación de la Universidad de Florida, fechada el 22 de septiembre, la responsable del estudio, Sara Rampazzi, también señala que la repetición que aparece de forma natural es un problema de seguridad. El estudio no mide con qué frecuencia las texturas habituales de la carretera provocan errores peligrosos en vehículos desplegados.
Las pruebas abarcaron distintas partes del sistema de percepción
Los investigadores combinaron experimentos con imágenes grabadas, mediciones con cámaras físicas y simulaciones.
Evaluación | Sistemas y condiciones | Qué se midió |
|---|---|---|
Imágenes de conducción modificadas | Patrones superpuestos en 7.518 pares de imágenes estéreo KITTI; algoritmos de correspondencia BM y SGBM, además de PSMNet, MoCha-Stereo y UniMatch | Cambios en la profundidad estimada con métodos convencionales y aprendidos |
Fusión de estéreo y LiDAR | SGM-DDC, con una nube de puntos LiDAR sintética que representa una pared plana | Si este método de fusión resistía el error provocado por los patrones |
Pruebas con cámaras físicas | Cámaras ZED2 y RealSense, en interiores y exteriores | Errores de profundidad provocados por patrones mostrados o proyectados |
Movimiento físico | Cámaras montadas en un vehículo terrestre AgileX Hunter 2.0 a 10 km/h y en un coche a unos 15 km/h | Cuánto tiempo persistieron las estimaciones falsas de profundidad durante el movimiento |
Simulación a mayor velocidad | CARLA a 10, 20, 30 y 40 km/h; imágenes estéreo procesadas con BM | Persistencia del error de profundidad en la conducción simulada |
El artículo y el apéndice de artefactos identifican el sensor RealSense como D435. La página demostrativa de los autores lo identifica como D435i; las descripciones de las fuentes no permiten determinar de forma coherente cuál es la variante exacta.
En una prueba en interiores, una superficie situada a tres metros de las cámaras se estimó a 0,8 metros con la ZED2 y a 0,6 metros con la RealSense bajo las condiciones de patrón seleccionadas.
SGM-DDC utiliza distancias LiDAR para restringir la correspondencia estéreo y resistió mejor los cambios de patrón que los métodos sin fusión, pero también produjo errores en la configuración probada. La entrada LiDAR sintética limita este hallazgo a un método de fusión en condiciones construidas.
Las pruebas de conducción demostraron una percepción falsa de obstáculos
En el experimento con un coche real, el equipo proyectó un patrón sobre una furgoneta situada junto a la trayectoria del coche. La estimación falsa de profundidad situó parte de esa superficie dentro de la trayectoria percibida por el coche. La tabla de resultados del artículo informa de que las estimaciones falsas persistieron entre unos 0,7 y 1,2 segundos según la cámara y las condiciones de iluminación.
Para evaluar el procesamiento posterior, los investigadores utilizaron la agrupación euclidiana de Autoware, que agrupa puntos cercanos de un mapa de profundidad como posibles obstáculos. Consideraron satisfactorio un ensayo cuando los puntos falsos se detectaban como obstáculo, y citaron 0,5 segundos de persistencia como umbral suficiente para una respuesta automática, como el frenado de emergencia. El apéndice de artefactos también describe la evaluación de nubes de puntos grabadas y la duración del grupo de puntos con profundidad falsa.
La evaluación publicada no documenta una maniobra física de frenado de emergencia, una desaceleración medida ni una colisión. La Universidad de Florida describe las posibles colisiones y los peligros de un frenado brusco como riesgos que plantea la investigación. Esos resultados no se demostraron en los experimentos descritos.
Las pruebas físicas se realizaron en entornos controlados y a velocidades de hasta 15 km/h. A 40 km/h, el resultado provino de CARLA: la manipulación simulada de la profundidad persistió durante 2,1 segundos. Esta simulación amplía las condiciones estudiadas, pero no demuestra que se hiciera una prueba física a esa velocidad.
Una defensa detecta las coincidencias repetidas
La defensa propuesta examina las puntuaciones utilizadas para comparar las dos imágenes. Las estructuras repetidas producen una secuencia recurrente de coincidencias posibles. El método detecta esa regularidad y compara la región afectada como una unidad mayor, lo que reduce la posibilidad de seleccionar el elemento repetido incorrecto.
En 200 pares de imágenes estéreo recogidas bajo las condiciones de las pruebas físicas, los autores informan de que el error de profundidad se redujo a menos de medio metro en el 96,5 % de los casos evaluados. También adaptaron el método a la información intermedia de correspondencias de PSMNet. En 200 pares de KITTI con patrones añadidos, esa versión redujo el error a menos de 0,1 metros en todos los casos evaluados.
El resultado de la defensa en modelos aprendidos corresponde a PSMNet; no demuestra el mismo resultado para MoCha-Stereo ni UniMatch. El estudio también limita las pruebas físicas a superficies de proyección planas o semiplanas y utiliza un patrón fijo durante los ensayos dinámicos. Su análisis muestra que los datos de entrenamiento pueden cambiar qué patrones afectan a un modelo y en qué medida.
Los experimentos dan a quienes desarrollan sistemas un motivo para examinar el efecto de los patrones repetidos tanto en el procesamiento de las cámaras como en la estimación de profundidad aprendida. Aún no se ha determinado el rendimiento de la defensa en todas las condiciones de funcionamiento de un sistema desplegado.
Los autores indican que el artículo se publicará próximamente en ACM CCS 2026. El sitio oficial de la conferencia indica que se celebrará del 15 al 19 de noviembre en La Haya y que se está preparando el programa definitivo. El trabajo aún no se ha presentado allí.
Fuentes y lecturas adicionales
- Ilusión de profundidad: vulnerabilidades ocultas de la visión estéreo en la estimación de profundidad, 14 de septiembre de 2026. El artículo completo explica el mecanismo, los algoritmos y las cámaras evaluados, las condiciones físicas y simuladas, los resultados de la defensa y sus limitaciones. La consecuencia vehicular que comunica es una percepción falsa de obstáculos con un umbral de respuesta citado; los métodos no documentan una maniobra de frenado real ni una colisión.
- Relato de investigación de la Universidad de Florida, 22 de septiembre de 2026. Aporta la explicación del equipo investigador y las implicaciones de seguridad que este atribuye a los hallazgos. Los escenarios de colisión describen consecuencias posibles, no incidentes observados.
- Página demostrativa de los autores y artefactos de investigación, consultados el 24 de septiembre de 2026. El apéndice de artefactos describe las evaluaciones con imágenes, nubes de puntos y simulaciones. Los pies de las demostraciones identifican el sensor D435i, mientras que el artículo y el apéndice dicen D435. BIG CHANGE no repitió los experimentos.
- ACM CCS 2026, consultado el 24 de septiembre de 2026. Confirma las fechas y la sede de la conferencia. Los autores indican que el artículo se publicará próximamente; la página consultada no ofrecía un horario específico para su presentación.



