schème expérimental

chaîne de traitement pour visualisation de résultats de requêtes à Manitou

par exemple : descripteur "cognition" donne 2221 entrées

  1. pour chacune des entrées extraction du titre, des descripteurs et du numéro de document dans un fichier texte :
  2. ---- 6 ----
    Titre:
    Stratégies pour apprendre : activités métacognitives conçues en fonction des différents styles d'apprentissage
    Sujets:
    Activité manuelle ; Apprentissage ; Bricolage ; Cognition ; Créatif ; Difficulté d'apprentissage ; École active ; Enfant ; Métaconnaissance ; Méthode d'apprentissage ; Processus cognitif ; Psychologie de l'apprentissage ; Style cognitif ;
  3. attribution d'un poids aux descripteurs calculé selon la fréquence d'occurrence dans une entrée (poids doublé pour l'occurrence dans un titre) :

  4. [ statégie(s) 2, activité(s) 3, ..., style(s) 3, apprentissage 6, ...]
  5. création d'une matrice (A) de vecteurs (x) de descripteurs (t), chacun de ces derniers ayant un degré d'appartenance (défini par le poids) à cet ensemble flou représentant une entrée ;

  6. constitution d'un pseudo-thésaurus flou qui est basée sur l'association floue entre deux termes (i,j) définie par leur co-occurrence dans une même entrée (k) et saisie à travers tout le corpus (M) comme une relation floue de similarité qui se calcule suivant le coefficient de Jaccard ;

  7. la requête (booléenne) de l'utilisateur (Q = [t2, t3] = [1,1]) sur la base de données est augmentée (N) à l'aide du pseudo-thésaurus flou (M) pour pallier à la différence entre son vocabulaire et celui du concepteur de la base de données ainsi que pour augmenter la pertinence des documents retenus ;

  8. la requête de l'utilisateur une fois augmentée (N) est ensuite appliquée à la matrice normalisée (A) pour finalement déterminer le vecteur résultant (S) des documents pertinents à la recherche de l'usager selon leurs poids (x1 = .8...) ;

  9. un outil de clustering flou (logicile libre développé par Höppner) permet de partitionner l'espace documentaire découpé par la requête en classes ou aggrégats de documents à l'aide de la fonction objective qui permet de déterminer si l'un des objets est plus près (distance euclidienne d) de l'un ou l'autre des prototypes d'une classe déterminés automatiquement par le logiciel ;

  10. représentation tri-dimensionnelle des clusters en terrain parsemé de montagnes où chacune représente un cluster en particulier ayant le plus près de son sommet les documents les plus protypiques à cette classe ;

difficulté rencontrée :

Réduction de la multidimensionnalité des vecteurs d’entrée en un format propice à une représentation tridimensionnelle.

solution développée :

emprunt d'une statégie au domaine des contrôleurs flous : réduction à une bi-dimensionnalité c’est-à-dire à une fonction f(x)=y, la 3e dimension de la représentation est founie parle degré d’appartenance d’un vecteur d’entrée à un cluster.

découverte automatique de la fonction sous-jacente ( f(x) = (c1,..., cn)) approximée par le système NEFCLASS, qui est un réseau (perceptron) de neurones flous à trois couches (logiciel libre développé par Nauck et Kruse), à partir des règles (R) tirées des données obtenues par le clustering flou.

représentation de la fonction en utilisant la courbe gaussienne adéquate à notre représentation des clusters en montagne.

reste à développer :

le boulier

recherche subventionnée par Hexagram sous la direction de Louis-Claude Paquin