Les systèmes de vidéo surveillance occupent une place importante dans les organisations publiques et privées. En effet, leur utilisation se répend grâce à la démocratisation des appareils peu coûteux de vidéo surveillance. Une des applications importantes est la reconnaissance d’un individu appartenant à une liste noire (watchlist screening). Ce qui distingue cette application des autres systèmes de reconnaissance de visage (RV) en vidéo surveillance est le fait que les suspects sont abonnés au système de RV à partir d’une seule image statique.
La reconnaissance d’un individu appartenant à une liste noire utilise un nombre limité d’images de références (une seule image par personne dans notre situation) pour construire la galerie des modèles de visages. Ces derniers sont une série de représentation (formes, paramètres ou vecteurs caractéristiques) permettant de décrire un visage. Ce nombre limité d’informations rend le système de RV vulnérable et incapable de donner une décision correcte. Ce problème est appelé « seule échantillon par personne » (single sample per personne). Par ailleurs, on trouve aussi la présence des variations incontrôlables au niveau des captures de visages tels que les variations d’éclairage, un effet de flou et les changements de position de tête. En outre, parmi les difficultés qu’on trouve pour un système de RV, plus particulièrement pour les applications de RV dans une liste noire, est la différence au niveau de caméras utilisées : les images capturées pour les références sont souvent de haute qualité, tandis que celles capturées de la scène de surveillance sont souvent des images faibles en résolution et bruitées.
Il est certain qu’un éclairage uniforme est indispensable pour avoir de bonnes captures de visages. Néanmoins, dans un cas réel de vidéo surveillance, les visages capturés sont pauvres en illumination ce qui peut dégrader sévèrement la performance du système de RV. Pour cette raison, la première partie de ce mémoire consiste à explorer les différentes techniques de normalisation d’illumination qui seront appliquées au niveau du prétraitement du notre système de RV. Ensuite, une comparaison entre ces techniques de normalisation est effectuée pour pouvoir désigner la technique qui offre une meilleure invariance à l’illumination. La division en blocs des régions d’intérêt de visages pour l’appariement des modèles est adoptée dans ce travail car elle permet l’extraction des caractéristiques de manière discriminative. D’ailleurs, ces informations spatiales donnent plus de détails sur les différentes parties du visage. La division en bloc permet donc d’éviter les problèmes d’occlusions. Une étude approfondie est menée sur la manière d’appliquer ces techniques de normalisation sur l’image. Deux approches différentes sont comparées : l’approche globale dans laquelle on applique les techniques sur toute l’image et l’approche locale qui consiste à isoler les blocs, puis à appliquer sur chacun de ces blocs une technique de normalisation. Les résultats expérimentaux ont montré que l’approche Tan and Triggs (TT) et Multi-ScaleWeberfaces (MSW) offrent une meilleure invariance d’illumination pour les systèmes de RV. En plus, ces deux techniques de normalisation appliquées localement ont aussi contribué à l’amélioration de la performance du système par rapport à l’approche globale.
Pour avoir un bon fonctionnement du système de RV, il faut que les données utilisées pour l’apprentissage et celles utilisées pour le test aient la même distribution. Dans notre application (RV dans une liste noire), les données pour l’apprentissage sont des images frontales, de haute qualité et haute résolution, alors que les données pour le test proviennent des vidéos de faible qualité, faible résolution et présentent des variations de position de tête. Pour surmonter ce décalage des domaines, on propose dans la deuxième partie de ce mémoire une nouvelle technique de pondération des régions locales tout en exploitant les concepts d’adaptation des domaines non supervisés (unsupervised domain adaptation) et les informations contextuelles avec les métriques de qualités d’images. La principale contribution est le calcul dynamique des pondérations qui sont spécifiques à une caméra (adaptation selon une vue de caméra). Cette étude contextuelle et adaptive selon les domaines offre une meilleure performance par rapport à la pondération statique et prédéfinie et par rapport aux systèmes sans pondération.
Ces expériences sont validées sur la base de données ChokePoint. Les performances du systèmes sont évaluées avec les mesures de performances, les courbes de Receiver operating characteristic (ROC) et les courbes de Precision-Recall.
| Date | 11 janv. 2016 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Éric Granger (Directeur(-trice)) & Abdenour Hadid (Codirecteur(-trice)) |
|---|
- Reconnaissance des visages (Informatique) Vidéosurveillance. Vidéo Éclairage. Imagerie (Technique) Qualité de l'image. Appariement de gabarits (Traitement d'images) éclairage
- illumination
- normalisation
- classification locale
- adaptation des domaines
- information contextuelle
- appariement local des modèles
- pondération dynamique
- base de données chokePoint
Amara, I. (Auteur(e)),
Granger (Directeur(-trice)) & Hadid (Codirecteur(-trice)),
11 janv. 2016Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie électrique