Synthesizing Speech and Gesture for Embodied Conversational Agents
Tid: Må 2026-10-12 kl 10.00
Plats: Kollegiesalen, Brinellvägen 8, Stockholm
Språk: Engelska
Ämnesområde: Tal- och musikkommunikation
Respondent: Siyang Wang , Tal, musik och hörsel
Opponent: Simon King, University of Edinburgh
Handledare: Professor Joakim Gustafsson, Tal, musik och hörsel; Éva Székely, Tal, musik och hörsel; Simon Alexanderson,
QC 20260922
Abstract
Förkroppsligade konversationsagenter (ECA) kräver syntessystem som producerar naturligt, spontant tal tillsammans med passande medföljande gester under verkliga samtalsförhållanden. Denna avhandling behandlar tre sammanflätade forskningsfrågor: spontan text-till-tal, integrerad tal- och gestgenerering samt utvärderingsmetodik. För det första frågar jag hur spontant tal kan syntetiseras; mitt arbete visar att disfluenser kan modelleras explicit genom samplingsbaserad insättning, att representationer från självövervakad inlärning överträffar mel-spektrogram som förutsägelsemål för den akustiska modellen — där mellanliggande lager från ASR-finjusterade modeller presterar bäst — samt att tokenbaserade talspråksmodeller vinner spontanitet på bekostnad av robusthet och talarkonsistens. För det andra frågar jag om tal och medföljande gester kan genereras gemensamt inom en och samma arkitektur snarare än via en pipeline; jag formulerar detta som integrerad tal- och gestsyntes (ISG). Jag visar att en Tacotron2-baserad ISG-modell uppnår samma prestanda som en stark pipeline med en bråkdel av såväl antalet parametrar som inferenstiden. För det tredje frågar jag hur sådan samtalssyntes bör utvärderas; jag utvecklar ett skiktat protokoll som kombinerar uppgiftsspecifika objektiva mått, modalitetsuppdelade lyssnartester, kontextuell utvärdering med medelopinionsbetyg samt interaktiv utvärdering i realtid med riktiga användare i ett autonomt dialogsystem för “20 frågor”, och argumenterar för att inget enskilt lager är tillräckligt på egen hand. Jag avslutar med lärdomar destillerade ur misslyckade experiment om dataförberedelse, om efterträning med förstärkningsinlärning för talspråksmodeller, samt om skalans betydelse vid förträning av samtalsbaserade tal- och textmodeller. Den övergripande tesen i denna avhandling är att spontant tal, medföljande gester och den utvärdering som bedömer dem utgör sidor av ett och samma problem, och att framsteg för förkroppsligade konversationsagenter förutsätter att de både modelleras och utvärderas tillsammans i de sammanhang där samtal faktiskt utspelar sig.