-
16
pages
-
Français
-
Documents
Description
Niveau: Elementaire
Tuareg : Classification non supervisée contextualisée Laurent Candillier1,2, Isabelle Tellier1, Fabien Torre1 1 GRAppA - Université Charles de Gaulle - Lille 3 2 Pertinence Data Intelligence Résumé : Cet article s'intéresse à la tâche de clustering de données numériques dans le cas particulier où toutes les dimensions de description des données ne sont pas également pertinentes pour le problème : certaines peuvent être tout simplement inutiles, d'autres n'être intéressantes que pour le rassemblement d'une partie des données, mais pas pour la totalité. Les méthodes classiques se comportent mal sur ce type de problème et nous proposons pour l'aborder un algorithme original, Tuareg, basé sur un partitionnement élémentaire sur une dimension et sur une utilisation stochastique de cette opération élémentaire. Cet algorithme ne nécessite aucun réglage de paramètre de la part de l'utilisateur et est d'une complexité très raisonnable. Des expériences, menées sur un problème classique en apprentissage non supervisé et sur des données artificielles, montrent que notre méthode a de bonnes capacités prédictives dans le cadre que nous nous sommes fixés et que, de plus, elle est capable de fournir une description intelligible de la solution découverte. Introduction L'objectif général de la classification est de pouvoir étiqueter des données en leur associant une classe. L'apprentissage automatique se propose de construire automatiquement une telle procédure de classification en se basant sur des exemples, c'est-à-dire sur un ensemble limité de données disponibles.
Tuareg : Classification non supervisée contextualisée Laurent Candillier1,2, Isabelle Tellier1, Fabien Torre1 1 GRAppA - Université Charles de Gaulle - Lille 3 2 Pertinence Data Intelligence Résumé : Cet article s'intéresse à la tâche de clustering de données numériques dans le cas particulier où toutes les dimensions de description des données ne sont pas également pertinentes pour le problème : certaines peuvent être tout simplement inutiles, d'autres n'être intéressantes que pour le rassemblement d'une partie des données, mais pas pour la totalité. Les méthodes classiques se comportent mal sur ce type de problème et nous proposons pour l'aborder un algorithme original, Tuareg, basé sur un partitionnement élémentaire sur une dimension et sur une utilisation stochastique de cette opération élémentaire. Cet algorithme ne nécessite aucun réglage de paramètre de la part de l'utilisateur et est d'une complexité très raisonnable. Des expériences, menées sur un problème classique en apprentissage non supervisé et sur des données artificielles, montrent que notre méthode a de bonnes capacités prédictives dans le cadre que nous nous sommes fixés et que, de plus, elle est capable de fournir une description intelligible de la solution découverte. Introduction L'objectif général de la classification est de pouvoir étiqueter des données en leur associant une classe. L'apprentissage automatique se propose de construire automatiquement une telle procédure de classification en se basant sur des exemples, c'est-à-dire sur un ensemble limité de données disponibles.
- méthode
- cluster c1 de la base fictive de la figure
- dimension
- inertie du cluster
- férents attributs
- compromis classique entre l'optimisation des distances inter-clusters
- groupes aux dimensions spécifiques
-
Publié par
-
Langue
Français