Les modèles d'IA qui analysent des vidéos utilisent une technique qui ralentit tout. Une nouvelle méthode change la donne en supprimant cette étape inutile.
LES MODÈLES D'IA VIDÉO ONT UN PROBLÈME DE TEMPS
Les modèles multimodaux (ceux qui comprennent à la fois le texte et les images) utilisent souvent une technique appelée Visual Chain-of-Thought (Visual CoT). Imaginez un élève qui, pour résoudre un problème de maths, dessine toutes les étapes sur son cahier avant d'écrire la réponse finale. C'est exactement ce que fait Visual CoT : il génère des images intermédiaires pour « voir » mentalement la vidéo avant de donner une réponse. Sauf que cette méthode a un gros défaut : elle ralentit énormément le processus, surtout pour analyser des vidéos en temps réel.
ET SI L'IA APPRENAIT À PENSER SANS DESSINER ?
COMMENT IVT FONCTIONNE EN PRATIQUE ?
Prenons un exemple concret : une vidéo montre une voiture qui tourne à un carrefour. Avec Visual CoT, l'IA dessinerait plusieurs images pour représenter la voiture à différents moments du virage. Avec IVT, l'IA apprend à « deviner » directement où la voiture va aller, sans dessiner ces étapes intermédiaires. Elle prédit les représentations latentes (en gros, des résumés invisibles de ce qui va arriver) et donne la réponse finale en une seule fois. Résultat : l'analyse est plus rapide et plus efficace.
LES TESTS ONT ÉTÉ CONVAINCANTS
Les chercheurs ont testé IVT sur six scénarios différents : en faisant varier les types de données, les méthodes de décodage, les horizons de prédiction (le nombre d'images à l'avance que l'IA doit anticiper), et les objectifs d'entraînement. Dans tous les cas, IVT a surpassé les méthodes qui n'utilisent que le texte. Mieux encore : IVT donne des résultats aussi bons, voire meilleurs, que Visual CoT, tout en réduisant le temps de calcul de plus de cinq fois. C'est comme si on passait d'une voiture qui met 10 minutes pour faire un trajet à une voiture qui met seulement 2 minutes.
POURQUOI GÉNÉRER DES IMAGES EST-IL INUTILE ?
Les résultats montrent que prédire directement les étapes futures dans l'IA (sans passer par des images) est plus efficace. Visual CoT oblige l'IA à dessiner des images inutiles pendant l'analyse, ce qui prend du temps et de la puissance. IVT, lui, a appris à faire ce travail pendant l'entraînement. C'est comme si on avait entraîné un athlète à courir pendant des mois, pour qu'il puisse ensuite courir plus vite pendant la compétition, sans avoir besoin de s'arrêter pour réfléchir à chaque pas.
LE FUTUR DU RAISONNEMENT VIDÉO
Cette découverte ouvre la voie à des modèles d'IA plus rapides et plus performants pour analyser des vidéos. Plus besoin de sacrifier la vitesse pour la précision : IVT montre qu'on peut avoir les deux. Les applications sont nombreuses : surveillance vidéo, voitures autonomes, analyse médicale, ou même jeux vidéo. Imaginez une voiture autonome qui anticipe un obstacle en une fraction de seconde, sans avoir besoin de dessiner chaque étape du trajet.
UNE RÉVOLUTION DANS L'APPRENTISSAGE DES IA
IVT ne se contente pas d'améliorer les performances : elle change la façon dont on conçoit l'apprentissage des modèles multimodaux. Au lieu de dépendre de méthodes lentes et gourmandes en ressources, IVT prouve qu'on peut internaliser le raisonnement visuel pendant l'entraînement. C'est une avancée majeure, car elle rend les IA plus accessibles et plus efficaces, même sur des appareils peu puissants.
ET LA CHAIN-OF-THOUGHT DANS TOUT ÇA ?
La chain-of-thought (CoT) est une technique qui consiste à faire expliquer les étapes de raisonnement par l'IA avant de donner la réponse finale. C'est très utile pour comprendre comment l'IA arrive à ses conclusions, mais elle a un coût : elle ralentit le processus. Les chercheurs ont analysé en profondeur comment fonctionne cette technique, notamment dans les modèles de langage. Ils ont montré que même si CoT ressemble à un raisonnement humain, les mécanismes exacts qui la rendent efficace restent mal compris. IVT apporte une réponse partielle à ce mystère en montrant qu'on peut obtenir des résultats similaires sans passer par des étapes intermédiaires visibles.
- Apple ML Research
L'indépendance de CLODCO est votre garantie.
Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.
Soutenir CLODCO


