Padrões visuais repetidos podem levar câmaras estéreo e modelos de IA para estimativa de profundidade a colocar objetos à distância errada, segundo uma equipa liderada pela Universidade da Florida. Em experiências controladas, as câmaras instaladas num robô terrestre em movimento e num automóvel produziram falsas estimativas de obstáculos que persistiram tempo suficiente para atingir um limiar de resposta referido pelos investigadores para software de condução autónoma.

O estudo, publicado no arXiv a 14 de setembro, associa esses erros à forma como as câmaras convertem a luz em píxeis e alinham as duas imagens. Também testa uma defesa de software. Para quem desenvolve ou avalia sistemas autónomos, o resultado útil é a identificação de um mecanismo de falha específico, que também ocorre em modelos de profundidade treinados, acompanhada de provas sobre como o reduzir.

A grande mudança

  • O que mudou: Os investigadores associam a ambiguidade dos padrões visuais repetidos a artefactos mensuráveis das câmaras e mostram depois erros de profundidade tanto nos métodos estéreo convencionais como nos modelos treinados. Nos sistemas testados, substituir um algoritmo de correspondência por IA não eliminou a fragilidade.
  • Porque é importante: As estimativas de distância alimentam a deteção de obstáculos. Nestas experiências, uma carrinha junto ao percurso de condução podia ser percecionada como um obstáculo dentro do próprio percurso. Por isso, a fiabilidade da estimativa de profundidade é relevante para a decisão seguinte do veículo.
  • O que importa acompanhar: A defesa proposta verifica se as correspondências se repetem. Os resultados promissores abrangem conjuntos limitados de imagens; para a adoção, importa saber se é fiável com outras câmaras, modelos e condições de funcionamento.

Como a repetição altera a estimativa de distância

Uma câmara estéreo utiliza duas vistas da mesma cena. O software encontra um elemento em cada imagem e mede o seu deslocamento horizontal, designado disparidade. A geometria da câmara converte esse deslocamento numa distância.

Um padrão repetido cria várias correspondências plausíveis. A análise do artigo identifica duas formas de a correspondência errada prevalecer. Primeiro, cada câmara amostra a cena numa grelha de píxeis. A fronteira entre uma forma escura e um fundo claro pode cair em posições diferentes nas duas grelhas, produzindo intensidades de píxel ligeiramente diferentes. Segundo, os erros residuais de calibração distorcem a correspondência entre as imagens.

Em conjunto, estes efeitos podem fazer com que outra repetição se assemelhe mais à referência do que a correspondência correta. O deslocamento resultante coloca a superfície à distância errada. A equipa também encontrou esta sensibilidade em modelos estéreo treinados, que comparam características extraídas das imagens.

Estes padrões foram escolhidos deliberadamente. O modelo de ameaça do estudo pressupõe conhecimento da câmara e das definições de processamento relevantes, ou acesso a um sistema comparável para avaliação. No relato da investigação da Universidade da Florida, datado de 22 de setembro, a responsável pelo estudo, Sara Rampazzi, identifica também a repetição que ocorre naturalmente como um risco para a segurança. O estudo não mede a frequência com que texturas normais à beira da estrada provocam erros perigosos em veículos em circulação.

Os testes abrangeram diferentes partes do sistema de perceção

Os investigadores combinaram experiências com imagens gravadas, medições em câmaras físicas e simulações.

Avaliação

Sistemas e condições

O que foi medido

Imagens de condução modificadas

Padrões sobrepostos a 7 518 pares de imagens estéreo KITTI; algoritmos de correspondência BM e SGBM e ainda PSMNet, MoCha-Stereo e UniMatch

Alterações na profundidade estimada com métodos convencionais e treinados

Fusão de estéreo e LiDAR

SGM-DDC, com uma nuvem de pontos LiDAR sintetizada a representar uma parede plana

Se este método de fusão resistia ao erro induzido pelos padrões

Testes com câmaras físicas

Câmaras ZED2 e RealSense, em interiores e exteriores

Erros de profundidade provocados por padrões apresentados num ecrã ou projetados

Movimento físico

Câmaras num veículo terrestre AgileX Hunter 2.0 a 10 km/h e num automóvel a cerca de 15 km/h

Duração das estimativas falsas de profundidade durante o movimento

Simulação a maior velocidade

CARLA a 10, 20, 30 e 40 km/h, com imagens estéreo processadas através de BM

Persistência do erro de profundidade na condução simulada

O artigo e o apêndice dos artefactos identificam o sensor RealSense como D435. A página de demonstração dos autores identifica-o como D435i; as descrições nas fontes não permitem determinar de forma consistente qual é a variante exata.

Num teste em interiores, uma superfície a três metros das câmaras foi estimada a 0,8 metros pela ZED2 e a 0,6 metros pela RealSense, nas condições de padrão selecionadas.

O SGM-DDC utiliza distâncias LiDAR para limitar a correspondência estéreo e resistiu melhor às alterações dos padrões do que os métodos sem fusão, mas também produziu erros na configuração testada. A utilização de dados LiDAR sintetizados limita este resultado a um método de fusão e a condições criadas para o ensaio.

Os testes de condução demonstraram falsa perceção de obstáculos

Na experiência com o automóvel físico, a equipa projetou um padrão sobre uma carrinha colocada junto à trajetória do veículo. A estimativa errada de profundidade situou parte dessa superfície dentro do percurso percecionado pelo automóvel. A tabela de resultados do artigo indica que as falsas estimativas persistiram durante cerca de 0,7 a 1,2 segundos, consoante as duas câmaras e as condições de iluminação.

Para a avaliação do processamento subsequente, os investigadores utilizaram o agrupamento euclidiano do Autoware, que agrupa pontos próximos num mapa de profundidade para identificar possíveis obstáculos. Consideraram um ensaio bem-sucedido quando os pontos falsos eram detetados como obstáculo e indicaram que um limiar de persistência de 0,5 segundos seria suficiente para desencadear uma resposta automática, como uma travagem de emergência. O apêndice de artefactos descreve igualmente a avaliação de nuvens de pontos gravadas e da duração do agrupamento de pontos com profundidade falsa.

A avaliação apresentada não documenta uma manobra física de travagem de emergência, uma desaceleração medida ou um acidente. A Universidade da Florida descreve possíveis colisões e perigos decorrentes de uma travagem brusca como riscos suscitados pela investigação. Esses resultados não foram demonstrados nas experiências relatadas.

Os testes físicos decorreram em ambientes controlados e a velocidades até 15 km/h. A 40 km/h, o resultado veio do CARLA: a manipulação simulada da profundidade persistiu durante 2,1 segundos. Esta simulação alarga as condições estudadas, mas não demonstra a realização de um teste físico a essa velocidade.

Uma defesa deteta correspondências candidatas repetidas

A defesa proposta analisa as pontuações utilizadas para comparar as duas imagens. Estruturas repetidas produzem sequências recorrentes de correspondências plausíveis. O método deteta essa regularidade e compara a região afetada como uma unidade maior, reduzindo a probabilidade de selecionar o elemento repetido errado.

Em 200 pares de imagens estéreo recolhidas nas condições dos testes físicos, os autores indicam que o erro de profundidade ficou abaixo de meio metro em 96,5% dos casos avaliados. Adaptaram também a abordagem à informação intermédia sobre correspondências do PSMNet. Em 200 pares KITTI com padrões acrescentados, essa versão reduziu o erro para menos de 0,1 metros em todos os casos avaliados.

O resultado da defesa nos modelos treinados diz respeito ao PSMNet; não demonstra que se obtenha o mesmo resultado com o MoCha-Stereo ou o UniMatch. O estudo também limita as experiências físicas a superfícies de projeção planas ou semiplanas e utiliza um padrão fixo durante os ensaios dinâmicos. A discussão mostra que os dados de treino podem alterar os padrões que afetam um modelo e a intensidade do efeito.

As experiências dão aos criadores de sistemas um motivo para analisar o efeito dos padrões repetidos tanto no processamento das câmaras como na estimativa de profundidade aprendida. O desempenho da defesa em todas as condições de funcionamento de um sistema em utilização continua por determinar.

Os autores indicam que o artigo será publicado na ACM CCS 2026. O site oficial da conferência indica as datas de 15 a 19 de novembro, em Haia, e refere que o programa final está em preparação. O trabalho ainda não foi apresentado nessa conferência.

Fontes e leituras adicionais

  • Ilusão de profundidade: revelar vulnerabilidades ocultas da visão estéreo na estimativa de profundidade, 14 de setembro de 2026. O artigo completo apresenta o mecanismo, os algoritmos e as câmaras avaliados, as condições físicas e simuladas, os resultados da defesa e as respetivas limitações. A consequência relativa aos veículos que os autores referem é a falsa perceção de obstáculos perante um limiar de resposta indicado; os métodos não documentam uma travagem real nem uma colisão.
  • Relato da investigação da Universidade da Florida, 22 de setembro de 2026. Apresenta a explicação da equipa de investigação e os riscos de segurança que esta atribui aos resultados. Os cenários de colisão descrevem consequências possíveis, não incidentes observados.
  • Página de demonstração dos autores e artefactos de investigação, consultados a 24 de setembro de 2026. O apêndice descreve as avaliações com imagens, nuvens de pontos e simulações. As legendas das demonstrações identificam o sensor como D435i, enquanto o artigo e o apêndice indicam D435. A BIG CHANGE não repetiu as experiências.
  • ACM CCS 2026, consultada a 24 de setembro de 2026. Confirma as datas e o local da conferência. A indicação de que o artigo será publicado em breve é dos autores; a página consultada para este artigo não apresentava um horário específico para a apresentação.