La ré-identification faciale est une application de vidéosurveillance qui fait appel à des engins de reconnaissance faciale qui sont conçus à partir de visages capturés en séquences vidéo, et qui cherche à les reconnaître dans des vidéos archivées ou en direct dans un réseau de caméras vidéo. Les applications vidéo de reconnaissance faciale posent des défis importants en raison des variations de conditions de capture comme la pose ou l’éclairage. Les autres défis sont de deux ordres: 1) la distribution déséquilibrée entre les visages capturés pour les personnes à réidentifier et les autres; 2) le degré variable de déséquilibre pendant les opérations par rapport aux données de conception. En général, il est difficile d’estimer la proportion de données déséquilibrées, en partie à cause de l’incapacité de la plupart des systèmes de classification à identifier correctement la classe majoritaire, négative ou non ciblée (visages ou images de personnes à ne pas ré-identifier) de la classe minoritaire, positive ou ciblée (visages ou images de personnes à ré-identifier), car la plupart de ces systèmes sont conçus pour des conditions de données équilibrées.
Plusieurs techniques sont proposées dans la littérature pour appendre des données déséquilibrées, soit des techniques permettant de rééquilibrer les données (en sous-échantillonnant la classe majoritaire et en sur-échantillonnant la classe minoritaire, ou les deux) pour les classificateurs de formation, soit des algorithmes permettant de guider le processus d’apprentissage (avec ou sans approche sensible aux coûts), neutralisant ainsi l’écart de performance dans la classification de la classe majoritaire. Il a été démontré que les techniques ensemblistes comme le bagging et le boosting exploitent efficacement ces méthodes pour remédier au déséquilibre. Cependant, la littérature fait aussi état de problèmes liés à ces techniques: (1) certains échantillons informatifs sont délaissés par suite d’un sous-échantillonnage aléatoire, et l’ajout d’échantillons positifs synthétiques par sur-échantillonnage augmente la complexité de la formation; (2) les facteurs de coût doivent être connus à l’avance ou trouvés; (3) les systèmes de classification sont souvent optimisés et comparés selon des mesures de performance (comme la précision) qui ne conviennent pas au problème de déséquilibre; (4) la plupart des algorithmes d’apprentissage sont conçus et testés d’après un niveau fixe de données déséquilibrées qui peut différer des scénarios opérationnels. Cette thèse a pour objectif de concevoir des ensembles de classificateurs spécialisés pour traiter la question du déséquilibre dans l’application de réidentification faciale et, comme sous-objectifs, d’éviter les problèmes précités repérés dans la littérature. De plus, obtenir un ensemble de classificateurs efficace nécessite un algorithme d’apprentissage pour concevoir et combiner les classificateurs de composants offrant le bon compromis entre diversité et précision. Pour réaliser cet objectif, quatre contributions majeures sont présentées dans trois chapitres, dont voici un résumé.
Au chapitre 3, une nouvelle méthode d’échantillonnage sous forme d’application regroupera les échantillons du sous-échantillonnage afin d’améliorer le compromis entre diversité et précision des classificateurs de l’ensemble. Dans les applications de ré-identification faciale, la méthode d’échantillonnage proposée tire parti du fait que les régions du visage d’une même personne apparaissant dans le champ de vision d’une caméra peuvent être regroupées en fonction des trajectoires enregistrées par le localisateur facial (face tracker). Une méthode ensembliste de Bagging X est proposée pour tenir compte des variations possibles du niveau de déséquilibre des données opérationnelles en combinant des classificateurs formés à différents niveaux de déséquilibre. Dans cette méthode, tous les échantillons servent aux classificateurs de formation, minimisant ainsi la perte d’information. Au chapitre 4, un nouvel algorithme d’apprentissage ensembliste, le Boosting progressif (PBoost), insère progressivement des groupes d’échantillons non corrélés dans un processus de Boosting pour éviter la perte d’information tout en générant un groupe diversifié de classificateurs. D’une itération à l’autre, l’algorithme PBoost accumule ces groupes d’échantillons non corrélés dans un ensemble qui augmente progressivement en taille et en déséquilibre. Cet algorithme est plus sophistiqué que celui que l’on propose au chapitre 3, car au lieu de former les classificateurs de base sur cet ensemble, on les forme sur des sous-ensembles équilibrés tirés de cet ensemble et validés sur tout l’ensemble. Par conséquent, les classificateurs de base sont plus précis sans compromettre la robustesse face au déséquilibre. De plus, la sélection des échantillons est fondée sur les poids attribués aux échantillons correspondant à leur importance. Aussi, la complexité de calcul de PBoost est inférieure à celle des techniques ensemblistes de Boost dans la littérature, quant à l’apprentissage de données déséquilibrées, parce que les classificateurs de base ne sont pas tous validés sur tous les échantillons négatifs. L’on propose également un nouveau facteur de perte dans PBoost pour éviter de biaiser les performances vers la classe négative. Ce facteur de perte permet de mettre à jour le poids des échantillons et de fixer la contribution des classificateurs dans les prédictions finales en fonction de la capacité des classificateurs à reconnaître les deux classes.
Pour comparer les performances des systèmes de classification vus aux chapitres 3 et 4, il faut disposer d’un espace d’évaluation qui compare les classificateurs en fonction d’une mesure de performance appropriée sur tous leurs seuils de décision, les différents niveaux de déséquilibre des données d’essai et les différentes préférences entre les classes. La mesure F sert souvent à évaluer des classificateurs binaires par rapport aux données déséquilibrées, et aucun espace global d’évaluation de cette mesure n’a été repéré dans la littérature. Par conséquent, au chapitre 5, un nouvel espace global d’évaluation est proposé pour la mesure F, analogue aux courbes de coût par rapport au coût prévu. Dans cet espace, un classificateur est représenté par une courbe montrant sa performance sur tous ses seuils de décision et les niveaux possibles de déséquilibre quant au taux positif réel souhaité par rapport à la précision. Ces propriétés ne paraissent pas dans les espaces ROC (Receiver Operating Characteristic) et de précision rappel. Cet espace nous permet également d’améliorer empiriquement la performance des méthodes spécialisées d’apprentissage d’ensembles déséquilibrés dans une condition opérationnelle particulière. Par la validation, les classificateurs de base sont combinés d’après une version modifiée de l’algorithme itératif de combinaison booléenne, de sorte que le critère de sélection dans cet algorithme est remplacé par la mesure F au lieu de l’aire sous la courbe AUC (area under curve), et la combinaison est effectuée pour chaque condition de fonctionnement. Les approches proposées dans cette thèse ont été validées et comparées à partir des bases de données synthétiques et des bases vidéo Faces In Action et COX qui émulent les applications de ré-identification faciale. Les résultats montrent que les techniques proposées sont plus performantes que les techniques actuelles quant aux différents niveaux de déséquilibre et de chevauchement entre les classes.
| Date | 9 janv. 2020 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Éric Granger (Directeur(-trice)) & Giorgio Fumera (Codirecteur(-trice)) |
|---|
- déséquilibre des classes
- apprentissage d’ensemble
- bagging
- boosting
- mesure de la performance
- mesure-F
- outils de visualisation
- ré-identification du visage
- vidéo surveillance
Soleimani Samarin, R. (Auteur(e)),
Granger (Directeur(-trice)) & Fumera (Codirecteur(-trice)),
9 janv. 2020Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie