Agent Seer invente des scénarios d'évaluation réalistes pour les agents IA, sans avoir besoin d'experts ni d'Outils en direct. Une avancée majeure pour tester les outils externes.

UN NOUVEAU TEST POUR LES AGENTS IA

Évaluer un agent IA qui utilise des outils externes n’est pas simple. Il faut des scénarios réalistes qui montrent comment ces agents combinent les outils et interagissent sur plusieurs tours de conversation. Aujourd’hui, ces scénarios sont souvent créés à la main par des experts. Problème : ça prend un temps fou, ça ne s’adapte pas à tous les types d’outils, et ça donne des tests statiques qui ne suivent pas l’évolution des interfaces.

LE SECRET : LES SPÉCIFICATIONS DES OUTILS

Mais une équipe de chercheurs a remarqué quelque chose : les spécifications des outils — leurs noms, leurs descriptions en langage naturel et leurs paramètres — contiennent déjà assez d’informations pour fabriquer des scénarios réalistes. Pas besoin de tout écrire à la main. Pas besoin d’exécuter les outils en direct. Agent Seer part de cette idée : en analysant uniquement la spécification d’un outil, il peut générer des scénarios d’évaluation automatiquement.

COMMENT ÇA MARCHE ?

Le système commence par enrichir les données brutes des outils. Il crée ensuite des scénarios gradués avec des sorties d’outils synthétiques. Enfin, il transforme ces scénarios en dialogues à plusieurs tours, ancrés dans des données simulées. Le résultat ? Des tests qui vérifient la capacité de l’agent à appeler les bons outils et à garder une conversation cohérente.

Agent Seer fonctionne sans exemples, sans accès aux outils en direct et sans réglages spécifiques à un domaine. Tout vient des spécifications des outils.

DES RÉSULTATS ENREGISTRANTS

Pour tester leur méthode, les chercheurs ont utilisé sept spécifications d’outils couvrant des domaines variés et des tailles différentes de suites d’outils. Résultat : le système atteint une excellente qualité dans tous les cas. Mieux encore, il couvre 100 % des outils pour les petites et moyennes spécifications. Deux découvertes clés émergent de cette analyse : la complexité du schéma des paramètres est le facteur qui influence le plus la qualité, bien plus que la taille de la suite d’outils. Et le principal problème ? L’exactitude des valeurs des arguments, un détail invisible si on ne regarde que le nom des outils.

POURQUOI C’EST IMPORTANT ?

Ce système change la donne pour évaluer les agents IA. Plus besoin de passer des semaines à écrire des scénarios manuellement. Plus besoin d’attendre que les outils évoluent pour mettre à jour les tests. Agent Seer s’adapte tout seul aux changements et génère des scénarios toujours pertinents. Une avancée qui pourrait accélérer le développement des agents capables d’utiliser plusieurs outils en même temps.

DEUX AUTRES PROJETS QUI BOUGENT

En parallèle, deux autres recherches font parler d’elles. D’abord, PORTool, un algorithme d’optimisation de politique qui permet aux agents d’apprendre à utiliser plusieurs outils en même temps. Le problème ? Quand on entraîne un agent avec seulement des récompenses globales, il est difficile de savoir quelles étapes intermédiaires ont mené au succès ou à l’échec. PORTool résout ce problème en attribuant les récompenses de manière plus intelligente, grâce à un système d’arbre de récompenses.

Ensuite, Reinforced Agent, un projet qui se concentre sur l’évaluation des agents pendant qu’ils appellent des outils. Aujourd’hui, les tests sont faits après coup, une fois que l’agent a fini son travail. Reinforced Agent propose de donner un retour en temps réel à l’agent pendant qu’il utilise les outils. Une idée qui pourrait rendre les agents plus efficaces et plus précis.

UNE AVANCÉE POUR LES AGENTS QUI UTILISENT DES OUTILS

Ces trois projets montrent que l’évaluation et l’entraînement des agents IA qui utilisent des outils externes sont en train de changer. Agent Seer simplifie la création de scénarios réalistes. PORTool améliore l’apprentissage des agents multi-outils. Reinforced Agent rend les tests plus dynamiques. Ensemble, ils ouvrent la voie à des agents plus performants et plus fiables, capables de résoudre des tâches complexes en combinant raisonnement et utilisation d’outils.

ET DEMAIN ?

Avec des outils comme Agent Seer, PORTool et Reinforced Agent, les agents IA qui utilisent des outils externes pourraient bientôt devenir bien plus puissants. Plus besoin de se contenter de tests statiques ou de méthodes d’entraînement limitées. Ces innovations permettent d’évaluer et d’améliorer les agents en temps réel, en s’adaptant à l’évolution des outils et des besoins. Une révolution en marche pour les agents IA du futur.

Sources :
  • Apple ML Research

L'indépendance de CLODCO est votre garantie.

Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.

Soutenir CLODCO