De l'apprentissage de représentations visuelles robustes aux invariances pour la classification et la recherche d'images
Spécialité : Mathématiques et Informatique
6/02/2017 - 14:00 Mr Mattis Paulin Grand Amphi de l'INRIA Rhône-Alpes, Montbonnot
Mots clé :
- recherche d'images
- apprentissage
- réseaux de neurones profonds
Cette thèse porte sur l'élaboration de systèmes de reconnaissance d'image qui sont robustes à la variabilité géométrique. La compréhension d'une image est un problème difficile, de par le fait qu'elles sont des projections en deux dimensions d'objets 3D. Par ailleurs, des représentations qui doivent appartenir à la même catégorie, par exemple des objets de la même classe en classification, peuvent être visuellement très différentes. Notre but est de rendre ces systèmes robustes à la juste quantité de déformations, celle-ci étant automatiquement déterminée à partir des données. Nos deux contributions sont les suivantes. Nous montrons tout d'abord comment utiliser des exemples virtuels pour rendre les systèmes de classification d'images robustes et nous proposons ensuite une méthodologie pour apprendre des descripteurs de bas niveau robustes, pour la recherche d'image. Nous étudions tout d'abord les exemples virtuels, en tant que transformations de vrais exemples. En représentant une image en tant que sac de descripteurs transformés, nous montrons que l'augmentation de données, c'est-à-dire le fait de les considérer comme de nouveaux exemples iid, est la meilleure manière de les utiliser, pourvu qu'une étape de vote avec les descripteurs transformés soit opérée lors du test. Du fait que les transformations apportent différents niveaux d'information, peuvent être redondants, voire nuire à la performance, nous proposons un nouvel algorithme capable de sélectionner un petit nombre d'entre elles, en maximisant la justesse de classification. Nous montrons par ailleurs comment remplacer de vrais exemples par des virtuels, pour alléger les couts d'annotation. Nous rapportons de bons résultats sur des bancs d'essai de classification. Notre seconde contribution vise à améliorer les descripteurs de régions locales utilisés en recherche d'image, et en particulier nous proposons une alternative au populaire descripteur SIFT. Nous proposons un nouveau descripteur, appelé patch-CKN, appris sans supervision. Nous introduisons un nouvel ensemble de données liant les images et les imagettes, construit à partir de reconstruction 3D automatique d'images récupérées sur Internet. Nous définissons une méthode pour tester précisément la performance des descripteurs locaux au niveau de l'imagette et de l'image. Notre approche dépasse SIFT et les autres approches à base d'architectures convolutionnelles sur notre banc d'essai, et d'autres couramment utilisés dans la littérature
Directeurs:
- Mme Cordélia Schmid (INRIA Grenoble )
- Mr Zaid Harchaoui (University of Washington, Seattle )
Raporteurs:
- Mr Joseph Sivic (Ecole Normale Supérieure, Paris )
- Mr Matthieu Cord (Université Pierre et Marie Curie, Paris )
Examinateurs:
- Mr Julien Mairal (INRIA Grenoble )
- Mr Christian Wolf (Institut National des Sciences Appliquées, Lyon )
- Mr Vincent Lepetit (Technische Univesität Graz, Austria )
- Mr Florent Perronnin (Xerox Resarch Center Europe, Montbonnot )