Les IA progressent vite, mais certains tests les font encore trébucher. Ces énigmes révèlent leurs failles… et les vôtres.
Depuis les débuts de l’informatique, les casse-têtes et les jeux occupent une place centrale dans le Développement de l’intelligence artificielle. Tout comme nous aimons nous mesurer à des mots croisés ou à des énigmes logiques, les chercheurs utilisent des défis ludiques pour évaluer les progrès des modèles. Le terme même de machine learning (apprentissage automatique) a été popularisé en 1959 par Arthur Samuel, un informaticien d’IBM, dans un article où il décrivait un algorithme capable d’apprendre à jouer aux dames. Les échecs et le jeu de Go, ce jeu de stratégie chinois, sont aussi devenus des terrains de test emblématiques pour l’IA.
L'IA RÉUSSIT-ELLE VRAIMENT LES ÉNIGMES ?
Si l’on juge uniquement sur ses capacités à résoudre des énigmes, l’IA progresse à une vitesse folle. À la fin de l’année 2024, une équipe de scientifiques de l’université Columbia avait montré que même les meilleurs modèles ne parvenaient à résoudre que 18 % des célèbres énigmes Connections du New York Times. Pourtant, dès le début de l’année 2025, certains modèles arrivaient à les résoudre presque parfaitement à chaque fois.
Mais ces tests ne servent pas qu’à mesurer les progrès de l’IA. Ils révèlent aussi ses limites. Aujourd’hui, malgré ces avancées impressionnantes, les modèles actuels continuent de se tromper, parfois de manière spectaculaire. Un simple changement subtil dans une énigme classique peut les faire échouer, et les puzzles visuels restent un point noir majeur. Ces échecs montrent que, même si l’IA est devenue très forte, elle ne raisonne pas comme nous.
Voici sept énigmes qui ont déjà fait trébucher des modèles d’IA à un moment ou à un autre. Certaines vous sembleront aussi difficiles qu’elles l’ont été pour les machines ; d’autres, au contraire, vous feront douter de l’intelligence réelle de ces systèmes. Chacune d’entre elles illustre une différence fondamentale entre la façon dont les humains et les machines traitent l’information. Si vous parvenez à toutes les résoudre, vous aurez prouvé que vous pouvez faire mieux que l’IA… du moins pour l’instant.
LE PIÈGE DE LA 3D : LES MODÈLES ÉCHOUENT SUR LES PROBLÈMES D'ESPACE
Commençons par un domaine où les humains excellent : le raisonnement spatial. Si vous avez déjà passé un test de QI, vous avez peut-être rencontré un problème de rotation mentale. Ces énigmes vous demandent de déterminer si différentes images représentent le même objet, mais sous un angle différent. Même si les modèles de langage actuels sont capables d’analyser des entrées visuelles, ils échouent lamentablement sur ce type de casse-têtes. Malgré les discours sur les modèles du monde (world models) censés aider l’IA à comprendre les environnements physiques, les grands modèles de langage (LLM) ne parviennent toujours pas à manipuler des objets en 3D comme le font naturellement les architectes ou les ingénieurs mécaniques.
Instructions : Choisissez la réponse qui montre l’objet de l’énigme, mais sous un angle différent. Dans chaque cas, il n’y a qu’une seule bonne réponse .
LA MÉMOIRE QUI JOUE DES TOURS : LES MODÈLES SE FIENT À CE QU'ILS ONT MÉMORISÉ
Les grands modèles de langage ont une mémoire prodigieuse. Ils ont été exposés à un volume colossal de faits pendant leur entraînement et peuvent en réciter une grande partie fidèlement. C’est un atout pour battre les humains dans des quiz, mais cela peut aussi devenir un piège. Lorsqu’une énigme ressemble de près à une autre que le modèle a rencontrée pendant son entraînement, il peut ignorer les différences subtiles et répondre en se basant sur ce qu’il a mémorisé.
C’est ce qui s’est passé dans une étude de 2024 menée par des chercheurs de Google et de l’université de l’Illinois à Urbana-Champaign. Ils ont entraîné et testé des modèles sur des variantes légères d’un type classique d’énigme appelé Chevaliers et Valets. Dans ces problèmes, certains personnages disent toujours la vérité et d’autres mentent systématiquement. Votre mission est de déterminer qui est qui. Le même principe pourrait expliquer pourquoi certains modèles échouent sur des tests comme SimpleBench, où les questions ressemblent à des problèmes plus complexes que les modèles ont probablement rencontrés pendant leur entraînement. Les humains repèrent facilement le piège, mais même les meilleurs modèles se font avoir.
Instructions : La seule chose que vous devez savoir pour résoudre ces énigmes est que les chevaliers disent toujours la vérité et les valets mentent toujours. Déterminez qui est qui en vous basant sur ce que chaque personnage dit.
Instructions : Lisez attentivement ces problèmes de SimpleBench, et vous devriez pouvoir trouver les réponses en un clin d’œil.
LE PIÈGE DES DEUX DIMENSIONS : LES MODÈLES ÉCHOUENT SUR LES RÈGLES ABSTRAITES
L’IA ne se trompe pas seulement sur les problèmes visuels en 3D : les casse-têtes en deux dimensions peuvent aussi la faire trébucher. C’est l’un des facteurs qui expliquent pourquoi les modèles ont du mal à performer sur le célèbre benchmark ARC-AGI, un test qui évalue la capacité à inférer des règles abstraites et générales à partir d’un ensemble d’exemples. Les modèles réussissent mieux sur les énigmes ARC lorsqu’ils reçoivent chaque grille non pas sous forme d’image, mais comme une chaîne de nombres codant la couleur de chaque case.
Des recherches suggèrent qu’encore aujourd’hui, même lorsque les modèles répondent correctement aux questions ARC-AGI, ils le font souvent en utilisant des règles complexes et peu généralisables. Les humains, eux, s’appuient sur des concepts visuels simples. Malgré ces désavantages, les modèles ont fait d’énormes progrès sur ARC-AGI au cours de l’année écoulée. Pourtant, certaines énigmes — comme celle présentée ici — continuent de les faire échouer.
Instructions : Étudiez les trois paires de grilles ci-dessous pour découvrir la règle qui transforme celles de gauche en celles de droite. Ensuite, sortez vos feutres ou crayons de couleur et remplissez la quatrième grille en appliquant cette règle. (La solution reste la même, quelle que soit l’orientation des grilles.)
QUAND LES HUMAINS SE FONT PIÉGER : LES PIÈGES QUI FONCTIONNENT À L'ENVERS
Ce n’est pas seulement l’IA qui tombe dans des pièges. Les humains aussi ont leurs propres faiblesses cognitives, et l’IA, elle, ne les partage pas toujours. Des psychologues ont conçu des suites de problèmes qui inversent le phénomène de SimpleBench : pour ces questions, les humains donnent souvent des réponses impulsives, tandis que les modèles répondent de manière plus réfléchie. Certaines énigmes exploitent les erreurs que nous faisons intuitivement en mathématiques ; d’autres sont formulées de façon à suggérer des réponses évidentes qui s’effondrent si l’on prend le temps de bien lire la question.
Instructions : Répondez aux questions ci-dessous le plus rapidement possible.
LA LIMITE DE L'ÉCHELLE : L'IA RÉUSSIT SUR LES PETITS CASSE-TÊTES, PAS SUR LES GRANDS
Parfois, la capacité d’un grand modèle de langage à résoudre une énigme dépend de sa taille. Une étude menée par des chercheurs d’Apple a révélé que les modèles pouvaient réussir des versions simples du problème de la Tour de Hanoï — un casse-tête qui consiste à déplacer une pile de disques un par un, sans jamais poser un disque plus grand sur un plus petit — ainsi que des énigmes de traversée de rivière, où un groupe de personnes doit traverser une rivière en respectant certaines règles. Mais seulement jusqu’à un certain point : dès que le nombre de disques ou de personnes dépasse six, les modèles commencent à échouer.
Dans une autre étude, des chercheurs de l’université de Washington, de Stanford et de l’Allen Institute for AI ont observé que les modèles avaient également du mal avec les énigmes de grilles logiques. Ces casse-têtes demandent de déduire les attributs d’un ensemble d’individus à partir d’une liste d’indices. L’étude d’Apple est devenue virale, mais certains commentateurs se sont demandé si ces résultats révélaient une limite unique du raisonnement des LLM… ou simplement le fait qu’il est normal de faire des erreurs quand la complexité devient trop grande.
Instructions : En utilisant le scénario fourni, planifiez les déplacements nécessaires pour faire traverser la rivière à tout le monde.
Instructions : En utilisant la liste d’indices, déterminez qui vit dans chaque maison et quel style de musique chaque personne apprécie. Il n’y a qu’une seule solution possible. Vous pouvez remplir la grille ci-dessous pour suivre vos déductions.
Cliquez sur une case pour marquer un X, cliquez à nouveau pour un coche.
POURQUOI CES ÉCHECS SONT-ILS IMPORTANTS ?
Ces énigmes ne sont pas que des jeux. Elles révèlent des failles fondamentales dans la façon dont les modèles d’IA traitent l’information. Par exemple, leur difficulté à manipuler des objets en 3D montre qu’ils n’ont pas encore une compréhension réelle de l’espace physique. Leur tendance à se fier à ce qu’ils ont mémorisé plutôt qu’à analyser les différences subtiles révèle une faiblesse dans leur capacité à généraliser. Et leur échec sur des problèmes qui semblent simples pour nous illustre le fossé qui sépare encore l’intelligence artificielle de l’intelligence humaine.
Ces limites ne sont pas anodines. Elles expliquent pourquoi les modèles d’IA peuvent parfois donner des réponses dangereuses ou absurdes, comme expliquer comment saboter un système de navigation aérienne. Elles montrent aussi que, malgré leur puissance apparente, ces systèmes restent très loin d’une intelligence générale comparable à celle des humains.
Alors, prêt à tester votre propre intelligence contre celle des machines ? Ces énigmes vous donneront peut-être une idée de ce qui manque encore à l’IA pour égaler — ou dépasser — l’esprit humain.
- MIT Tech Review AI
L'indépendance de CLODCO est votre garantie.
Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.
Soutenir CLODCO


