Till innehåll på sidan
Till KTH:s startsida

Temporal Modeling of Dynamic 3D Scenes for Self-supervised Scene Flow

Tid: Fr 2026-10-23 kl 09.00

Plats: Kollegiesalen, Brinellvägen 8, Stockholm

Videolänk: https://kth-se.zoom.us/j/68797563146

Språk: Engelska

Ämnesområde: Datalogi

Respondent: Qingwen Zhang , Robotik, perception och lärande

Opponent: Professor Teresa Vidal Calleja, University of Technology Sydney, Sydney, Australia

Handledare: Professor Patric Jensfelt, Robotik, perception och lärande; Assistant Professor Olov Andersson, Robotik, perception och lärande

Exportera till kalender

QC 20260928

Abstract

Den fysiska världen står aldrig stilla. Denna avhandling studerar hur tredimensionell rörelse i en dynamisk scen kan skattas från punktmoln utan mänsklig annotering. Scenflöde tilldelar varje observerad punkt en förskjutningsvektor. Att annotera rörelsen för varje punkt i stora mängder punktmolnsdata är orimligt kostsamt. Detta har hindrat scenflöde från att komma till praktisk användning.

Vi angriper problemet utifrån rörelsens fysikaliska natur. Till skillnad från de mänskligt definierade kategorierna som används för detektion och segmentering är scenflöde en fysikalisk storhet i scenen. Vi utnyttjar tre av dess egenskaper. Rörelse är mätbar utifrån geometri, så handledning kan härledas ur observationerna i stället för från annoteringar. Rörelse är kontinuerlig i tiden, så tidigare rörelse begränsar den aktuella. Rörelse beror dessutom på kinematik snarare än utseende, så data kan genereras i stor skala genom simulering och överföras till verkliga sensorer.

Vi visar först att framåtmatande modeller som tränas med punktvis matchning systematiskt underskattar dynamisk rörelse, eftersom närmaste-granne-korrespondenser på stora rörliga objekt pekar mot fel yta. Genom att separera statisk struktur från dynamiska objekt och införa kinematiska bivillkor på objektnivå erhålls tillförlitlig annoteringsfri handledning för två på varandra följande bildrutor. För att utnyttja att rörelse är kontinuerlig i tid utvidgar vi sedan handledningen till flera bildrutor, vilket skapar två utmaningar: beräkningskostnaden växer med tidsfönstrets storlek, vilket vi håller konstant genom en kompakt residualrepresentation, och korrespondenserna växlar abrupt mellan bildrutor, vilket vi löser genom att ur en kandidatmängd aggregera de ledtrådar som är mest konsistenta över tid, så att självhandledning över flera bildrutor förblir stabil. Även med sådana noggrant utformade målfunktioner bygger självhandledning fortfarande på indirekta träningssignaler som härleds ur geometriska antaganden. Dessa signaler förblir brusiga vid glesa sensormätningar och ocklusion, och att skala upp mängden oannoterade verkliga data ger därför allt mindre förbättring. Eftersom rörelse beror på kinematik snarare än utseende vänder vi oss i stället till simulering. Vi prioriterar rörelsekomplexitet framför sensorrealism och genererar storskaliga syntetiska data med brusfria etiketter som härleds direkt ur simulatorns tillstånd. Den resulterande förhandsmodellen för rörelse generaliserar mellan olika sensorer utan ytterligare träning (zero-shot) och minskar kraftigt behovet av annoterade verkliga data. Slutligen visar vi att tillförlitliga flödesskattningar fungerar som hastighetsfält på punktnivå och kan korrigera rörelsedistorsion i råa LiDAR-svep.

Sammantaget visar resultaten att rörelsens objektiva, fysikaliska natur inte bara är en konceptuellt tilltalande idé utan också kan utnyttjas för att göra dynamisk scenförståelse skalbar och generaliserbar utan mänsklig handledning.

Link to DiVA