Wiederholte visuelle Muster können Stereokameras und KI-Tiefenmodelle dazu bringen, Objekte in falscher Entfernung zu verorten, berichtet ein Team unter Leitung der University of Florida. In kontrollierten Experimenten lieferten Kameras auf einem fahrenden Bodenroboter und in einem Auto falsche Hindernisschätzungen. Diese hielten lange genug an, um einen von den Forschenden für autonom fahrende Software angeführten Reaktionsschwellenwert zu erreichen.
Die am 14. September auf arXiv veröffentlichte Studie verknüpft die Fehler damit, wie Kameras Licht in Pixel umwandeln und ihre beiden Ansichten aufeinander abstimmen. Außerdem wird eine Software-Gegenmaßnahme getestet. Für Entwickler und Prüfer autonomer Systeme liegt der relevante Befund in einem konkreten Fehlermuster, das auch in trainierten Tiefenmodellen auftritt, sowie in Belegen dafür, wie es sich verringern lässt.
Die große Veränderung
- Was sich geändert hat: Die Forschenden verknüpfen Mehrdeutigkeiten in wiederholten visuellen Mustern mit messbaren Kameraartefakten und zeigen anschließend Tiefenfehler sowohl bei herkömmlichen Stereoverfahren als auch bei trainierten Modellen. Der Ersatz eines Abgleichalgorithmus durch KI beseitigte die Schwäche in den getesteten Systemen nicht.
- Warum das wichtig ist: Entfernungswerte fließen in die Hinderniserkennung ein. In den Experimenten konnte ein Lieferwagen neben der Fahrspur als Hindernis innerhalb der Spur erscheinen. Damit wird die Zuverlässigkeit der Tiefenschätzung für die nächste Entscheidung des Fahrzeugs relevant.
- Worauf zu achten ist: Die vorgeschlagene Gegenmaßnahme prüft den Abgleichprozess auf Wiederholungen. Die vielversprechenden Ergebnisse beziehen sich auf begrenzte Bilddatensätze. Für einen praktischen Einsatz bleibt offen, wie zuverlässig das Verfahren mit anderen Kameras, Modellen und Betriebsbedingungen funktioniert.
Wie Wiederholungen die Entfernungsschätzung verändern
Eine Stereokamera verwendet zwei Ansichten derselben Szene. Die Software sucht in jedem Bild ein Merkmal und misst dessen horizontale Verschiebung, die sogenannte Disparität. Aus dieser Verschiebung berechnet sie anhand der Kamerageometrie die Entfernung.
Ein wiederholtes Muster bietet mehrere plausible Zuordnungen. Die Analyse der Studie nennt zwei Gründe, warum die falsche Zuordnung gewinnen kann. Erstens tastet jede Kamera die Szene in einem Pixelraster ab. Die Grenze zwischen einer dunklen Form und einem hellen Hintergrund kann in den beiden Rastern an unterschiedlichen Stellen liegen. Dadurch entstehen leicht abweichende Pixelwerte. Zweitens verzerren verbleibende Kalibrierungsfehler die Zuordnung zwischen den Bildern.
Zusammen können diese Effekte dazu führen, dass eine andere Wiederholung der Referenz stärker ähnelt als das richtige Merkmal. Die daraus berechnete Verschiebung ordnet die Oberfläche der falschen Entfernung zu. Das Team fand diese Empfindlichkeit auch bei trainierten Stereomodellen, die Merkmale aus den Bildern miteinander vergleichen.
Es handelte sich um gezielt ausgewählte Muster. Das Bedrohungsmodell der Studie setzt voraus, dass Kamera und relevante Verarbeitungseinstellungen bekannt sind oder ein vergleichbares System geprüft werden kann. Im Bericht der University of Florida zur Forschung vom 22. September verweist Forschungsleiterin Sara Rampazzi auch auf natürlich auftretende Wiederholungen als Sicherheitsrisiko. Die Studie misst nicht, wie häufig gewöhnliche Muster am Straßenrand in eingesetzten Fahrzeugen gefährliche Fehler verursachen.
Die Tests umfassten verschiedene Teile des Wahrnehmungssystems
Die Forschenden kombinierten Versuche mit aufgezeichneten Bildern, Messungen mit realen Kameras und Simulationen.
Auswertung | Systeme und Bedingungen | Untersuchte Größe |
|---|---|---|
Veränderte Fahrbilder | Muster überlagert auf 7.518 KITTI-Stereobildpaare; BM- und SGBM-Abgleichalgorithmen sowie PSMNet, MoCha-Stereo und UniMatch | Änderungen der geschätzten Tiefe bei herkömmlichen und trainierten Verfahren |
Kombination von Stereo und LiDAR | SGM-DDC mit einer synthetischen LiDAR-Punktwolke, die eine ebene Wand darstellt | Ob diese Fusionsmethode dem durch Muster ausgelösten Fehler widerstand |
Physische Kameratests | ZED2- und RealSense-Kameras in Innenräumen und im Freien | Tiefenfehler durch angezeigte oder projizierte Muster |
Bewegungstests | Kameras auf einem Bodenfahrzeug vom Typ AgileX Hunter 2.0 mit 10 km/h und in einem Auto mit etwa 15 km/h | Dauer falscher Tiefenschätzungen während der Bewegung |
Simulation mit höherer Geschwindigkeit | CARLA mit 10, 20, 30 und 40 km/h; Stereobilder mit BM verarbeitet | Anhaltende Tiefenfehler in simulierten Fahrszenarien |
Die Studie und ihr Anhang zu den Forschungsartefakten nennen den RealSense-Sensor als D435. Die Demonstrationsseite der Autoren bezeichnet ihn als D435i; die Angaben in diesen Quellen stimmen hinsichtlich des genauen Modells nicht überein.
In einem Innentest wurde eine drei Meter von den Kameras entfernte Oberfläche unter den ausgewählten Musterbedingungen von der ZED2 in 0,8 Meter und von der RealSense in 0,6 Meter Entfernung geschätzt.
SGM-DDC nutzt LiDAR-Entfernungen, um den Stereoabgleich einzuschränken, und war gegenüber Musteränderungen widerstandsfähiger als die Verfahren ohne Fusion. Auch damit traten in der getesteten Konfiguration noch Fehler auf. Wegen der synthetischen LiDAR-Eingabe gilt dieser Befund nur für eine Fusionsmethode unter konstruierten Bedingungen.
Die Fahrtests zeigten eine fälschliche Hinderniserkennung
Beim physischen Autoversuch projizierte das Team ein Muster auf einen Lieferwagen neben der Fahrbahn. Die falsche Tiefenschätzung ordnete einen Teil seiner Oberfläche dem wahrgenommenen Fahrweg des Autos zu. In der Ergebnistabelle der Studie hielten diese falschen Schätzungen je nach Kamera und Lichtbedingungen etwa 0,7 bis 1,2 Sekunden an.
Für die nachgelagerte Auswertung verwendeten die Forschenden das euklidische Clustering von Autoware. Dabei werden nahe beieinanderliegende Punkte in einer Tiefenkarte zu möglichen Hindernissen gruppiert. Ein Versuch galt als erfolgreich, wenn die falschen Punkte als Hindernis erkannt wurden. Die Forschenden führten eine anhaltende Fehlerdauer von 0,5 Sekunden als ausreichend für eine automatische Reaktion wie eine Notbremsung an. Der Anhang zu den Forschungsartefakten beschreibt ebenfalls die Auswertung aufgezeichneter Punktwolken und die Dauer der falschen Tiefencluster.
In der berichteten Auswertung werden weder eine tatsächliche Notbremsung noch gemessene Verzögerung oder ein Unfall dokumentiert. Die University of Florida nennt mögliche Zusammenstöße und Gefahren durch abruptes Bremsen als von der Forschung aufgeworfene Risiken. Diese Folgen wurden in den beschriebenen Experimenten nicht demonstriert.
Die physischen Tests fanden unter kontrollierten Bedingungen bei höchstens 15 km/h statt. Bei 40 km/h stammte das Ergebnis aus CARLA: In der Simulation hielt die manipulierte Tiefenschätzung 2,1 Sekunden an. Die separate Simulation erweitert die untersuchten Bedingungen, belegt aber keinen physischen Test bei dieser Geschwindigkeit.
Eine Gegenmaßnahme prüft wiederholte mögliche Zuordnungen
Die vorgeschlagene Gegenmaßnahme untersucht die Werte, mit denen die beiden Bilder verglichen werden. Wiederholte Strukturen erzeugen eine regelmäßige Folge plausibler Zuordnungen. Das Verfahren erkennt diese Regelmäßigkeit und gleicht den betroffenen Bereich als größere Einheit ab. Dadurch sinkt die Wahrscheinlichkeit, dass ein falsches wiederholtes Element ausgewählt wird.
Für 200 Stereobildpaare aus den physischen Tests berichten die Autoren, dass der Tiefenfehler in 96,5 Prozent der ausgewerteten Fälle auf unter einen halben Meter sank. Außerdem passten sie das Verfahren an Zwischenwerte des Abgleichs in PSMNet an. Bei 200 KITTI-Paaren mit hinzugefügten Mustern sank der Fehler in jedem ausgewerteten Fall auf unter 0,1 Meter.
Das Ergebnis zur Gegenmaßnahme bei trainierten Modellen gilt für PSMNet; es belegt nicht dasselbe Ergebnis für MoCha-Stereo oder UniMatch. Zudem beschränkten sich die physischen Experimente auf ebene oder nahezu ebene Projektionsflächen und verwendeten bei dynamischen Tests ein festes Muster. Laut Diskussion der Studie können Trainingsdaten beeinflussen, welche Muster ein Modell stören und in welchem Ausmaß.
Die Experimente geben Systementwicklern Anlass, wiederholte Muster sowohl in der Kameraverarbeitung als auch bei trainierter Tiefenschätzung zu untersuchen. Wie leistungsfähig die Gegenmaßnahme über sämtliche Einsatzbedingungen eines vollständig implementierten Systems hinweg ist, bleibt ungeklärt.
Die Autoren führen den Artikel als zur Veröffentlichung bei ACM CCS 2026 vorgesehen. Die offizielle Konferenzseite nennt den 15. bis 19. November in Den Haag und teilt mit, dass das endgültige Programm noch vorbereitet wird. Die Arbeit wurde dort noch nicht vorgestellt.
Quellen und weiterführende Informationen
- Illusion of Depth: Revealing Hidden Stereo Vision Vulnerabilities in Depth Estimation, 14. September 2026. Der vollständige Artikel beschreibt den Mechanismus, die geprüften Algorithmen und Kameras, physische Tests und Simulationen sowie Ergebnisse und Grenzen der Gegenmaßnahme. Als Folge für Fahrzeuge wird eine fälschliche Hinderniserkennung mit einem angegebenen Reaktionsschwellenwert berichtet; die Methoden dokumentieren weder eine tatsächliche Bremsung noch einen Zusammenstoß.
- Forschungsbericht der University of Florida, 22. September 2026. Enthält die Erklärung des Forschungsteams und ihm zugeschriebene Sicherheitsfolgen. Kollisions- und Szenarien mit plötzlichem Bremsen beschreiben mögliche Folgen, keine beobachteten Ereignisse.
- Demonstrationsseite der Autoren und Forschungsartefakte, geprüft am 24. September 2026. Der Anhang beschreibt Bild-, Punktwolken- und Simulationsauswertungen. In den Bildunterschriften der Demonstration steht D435i, in Studie und Anhang hingegen D435. BIG CHANGE hat die Experimente nicht wiederholt.
- ACM CCS 2026, geprüft am 24. September 2026. Bestätigt Datum und Ort der Konferenz. Dass der Artikel bevorstehend veröffentlicht werden soll, sagen die Autoren; auf der für diesen Beitrag geprüften Konferenzseite war kein konkreter Präsentationstermin angegeben.



