Thèse soutenue

Sélection des caractéristiques et combinaison de classifieurs : application à l'extraction de l'information textuelle dans les images de scène

FR  |  
EN
Auteur / Autrice : Shehzad Muhammad Hanif
Direction : Lionel Prevost
Type : Thèse de doctorat
Discipline(s) : Informatique
Date : Soutenance en 2009
Etablissement(s) : Paris 6

Résumé

FR

Dans cette thèse, nous avons traité le problème de la détection et de la localisation dans les images de scène. Notre système est composé de deux parties : le Détecteur de texte et le Localiseur de texte. Le détecteur de texte (une cascade de classifieurs boostés) emploie la méthode de dopage qui sélectionne et combine des descripteurs et des classifieurs faibles pertinents. Plus précisément, nous avons proposé une version régularisée de l’algorithme AdaBoost qui intègre la complexité (liée à la charge de calcul) des descripteurs et des classifieurs faibles dans la phase de sélection. Nous avons proposé des descripteurs hétérogènes pour coder l’information textuelle dans les images. Nos règles de classification appartiennent des différentes classes de classifieurs : discriminant, linéaire et non-linéaire, paramétrique et non-paramétrique. Le détecteur génère des régions candidates de texte qui servent d’entrées au localiseur de texte dont l’objectif est de trouver des rectangles englobants, autour des mots ou des lignes de texte dans l’image. Les résultats sur deux bases d’images difficiles montrent l’efficacité de notre approche.