Les modèles de diffusion atteignent aujourd’hui des performances de pointe en génération multimodale. Néanmoins, leur adoption en pratique demeure limitée par (i) le coût élevé de l’échantillonnage itératif et (ii) la difficulté à adapter un modèle de diffusion préentraîné à de nouveaux domaines à partir de seulement quelques références. Ce mémoire étudie l’utilisation des modèles de diffusion pour l’adaptation, la génération multimodale personnalisée et l’édition dans le contexte de la génération d’images et d’effets sonores en régime de faibles données. Elle met l’accent sur l’adaptation efficace, la préservation de l’identité et la génération contrôlable de variations pour des flux de production.
Dans un premier temps, ce mémoire présente des contributions issues d’un travail collaboratif autour de l’article Uni-DAD. Cet article introduit un cadre d’entraînement unifié pour la distillation et l’adaptation simultanées, permettant la génération d’images en few-shot et en few-step. Ce travail confronte les pipelines classiques en deux étapes de type adapt-then-distill ou distill-then-adapt, qui impliquent des structures complexes, un risque de surapprentissage et une diversité limitée. La principale contribution porte sur la personnalisation guidée par sujet (Subject-Driven Personalization, SDP), renforcée par l’intégration d’un conditionnement textuel. Évalué sur le benchmark DreamBooth, Uni-DAD SDP atteint une qualité d’image compétitive par rapport aux méthodes d’adaptation de référence tout en ne nécessitant qu’une seule étape d’échantillonnage. Le résultat final est un générateur en une seule étape, capable de produire des images diversifiées et de haute qualité dans de nouveaux domaines de données, sous conditions restreintes. En définitive, cette méthode agnostique facilite le déploiement des modèles de diffusion dans des applications personnalisées en temps réel.
Dans un second temps, la continuité de ce travail contribue à la recherche appliquée sur la génération audio pour la production d’effets sonores (SFX). Plus précisément, il étudie la capacité des modèles génératifs modernes à produire des variations diversifiées à partir d’un clip de référence tout en préservant l’identité de l’événement sonore. Une analyse expérimentale évalue l’aptitude des modèles à reproduire ou éditer des caractéristiques clés du signal, telles que la structure temporelle et l’enveloppe d’énergie, sous des contraintes orientées vers la production (durée, transfert de style et indices d’alignement). Par ailleurs, cette analyse permet de structurer un état de l’art et d’établir des comparaisons équitables entre méthodes pour la variation et l’édition de SFX, afin de rapprocher les récentes avancées de la génération audio aux exigences de l’industrie. Ce travail établit également une base pour de futures recherches appliquées sur la génération efficace et contrôlable de variations dans des contextes de production.
| Date | 11 mai 2026 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Mohammadhadi Shateri (Directeur(-trice)) & Éric Granger (Codirecteur(-trice)) |
|---|
- IA générative
- modèles de diffusion
- adaptation
- distillation des connaissances
- multimodalité
- images et effets sonores
Desbos, M. (Auteur(e)),
Shateri (Directeur(-trice)) &
Granger (Codirecteur(-trice)),
11 mai 2026Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie de la production automatisée