Les algorithmes de graphe révèlent des secrets cachés dans les données. UMAP ne se limite pas à ses projections.

Imaginez un plan de métro où chaque station représente un point de données. Les lignes qui relient ces stations forment un graphe. C’est exactement ce que fait UMAP, un outil célèbre pour réduire la dimension des données complexes en deux dimensions. Mais ce que la plupart des gens ignorent, c’est que UMAP construit aussi un graphe invisible : le graphe des k plus proches voisins (kNN).

UN OUTIL SOUS-ESTIMÉ : LE GRAPHE DES VOISINS

Le graphe kNN est comme une carte détaillée de votre ville avant qu’un GPS ne la déforme pour vous donner un itinéraire simplifié. UMAP utilise ce graphe pour préserver la structure originale des données dans leur espace à haute dimension. Pourtant, la plupart des utilisateurs se concentrent uniquement sur la projection en 2D, en laissant ce graphe de côté. Les chercheurs montrent qu’il contient une mine d’informations.

Ce graphe interne encode la structure des données avant toute distorsion.

TROIS ALGORITHMES POUR DÉVOILER LES SECRETS

En appliquant des algorithmes classiques de théorie des graphes à ce graphe kNN, les données deviennent bien plus faciles à comprendre. Voici trois méthodes qui changent la donne :

D’abord, le PageRank, l’algorithme qui classe les pages web, permet ici d’identifier les points de données les plus représentatifs. Ensuite, la décomposition en k-cœur sépare les zones denses (comme le centre-ville) des zones clairsemées (comme les banlieues). Enfin, le coefficient de clustering repère les groupes de points très similaires, comme des quartiers où tout le monde se connaît.

DES RÉSULTATS QUI PARLENT D’ELLES-MÊMES

Pour prouver leur idée, les chercheurs ont testé ces méthodes sur deux jeux de données célèbres : MNIST (chiffres manuscrits) et Fashion MNIST (vêtements dessinés). Les résultats sont sans appel : ces analyses basées sur des graphes sont non seulement pratiques, mais aussi compétitives, voire complémentaires, par rapport à des méthodes spécialisées comme k-medoids pour choisir des exemples typiques ou HDBSCAN pour le regroupement par densité.

Sur MNIST et Fashion MNIST, les méthodes graphiques rivalisent avec les Outils dédiés.

LE FUTUR DE L’APPRENTISSAGE AUTOSUFFISANT SUR GRAPHES

L’apprentissage autosuffisant (ou self-supervised learning) sur les graphes est une révolution. Il permet de générer des représentations (ou embeddings) des nœuds et des graphes entiers, utiles pour des tâches comme la classification de nœuds, le regroupement de nœuds ou la prédiction de liens. Ce type d’apprentissage est particulièrement précieux quand les données labellisées manquent.

Deux grandes familles d’algorithmes dominent ce domaine : les méthodes contrastives et les méthodes génératives. Les premières excellent dans certaines tâches, tandis que les secondes brillent ailleurs. Mais aucune ne domine totalement le paysage.

QUAND LES MODÈLES DE LANGAGE S’ENRICHISSENT DE MÉMOIRE

Les modèles de langage à k plus proches voisins (ou kNN-LM) représentent une avancée majeure. Ils combinent un modèle de langage pré-entraîné avec une recherche exhaustive dans une base de données d’entraînement, appelée banque mémoire. Cette approche permet d’atteindre des performances de pointe.

Les chercheurs explorent désormais une piste pour améliorer encore ces modèles : entraîner le modèle de langage en tenant compte de cette banque mémoire dès le départ, plutôt que de l’ajouter après coup. L’idée est de rendre le modèle plus robuste et plus performant.

Les modèles kNN-LM combinent puissance et mémoire pour des résultats optimaux.

LA RECHERCHE EN IA : UNE COURSE SANS FIN

Chaque jour, des percées majeures voient le jour dans le domaine de l’apprentissage automatique. Les méthodes évoluent, les outils se perfectionnent, et les applications se multiplient. UMAP et ses graphes cachés n’en sont qu’un exemple parmi d’autres.

Ces avancées transforment la manière dont nous comprenons et utilisons les données, ouvrant la voie à des découvertes insoupçonnées.

POURQUOI ÇA COMPTE POUR TOI

Que tu sois étudiant, développeur ou simplement curieux, ces outils peuvent t’aider à explorer des données complexes sans te perdre dans des projections simplistes. Le graphe kNN de UMAP est une clé pour révéler des structures invisibles à l’œil nu.

Alors la prochaine fois que tu utiliseras UMAP, n’oublie pas de jeter un œil à son graphe interne : c’est peut-être là que se cachent les réponses que tu cherches.

Sources :
  • Apple ML Research

L'indépendance de CLODCO est votre garantie.

Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.

Soutenir CLODCO