Un modèle léger de 2,6 milliards de paramètres qui exécute des agents IA sur smartphone ou PC. Voici ses performances et comment l'utiliser.

UN MODÈLE QUI S'EXÉCUTE SUR TOUT, MÊME SUR TON TÉLÉPHONE

Imagine un modèle d'IA capable de faire tourner un agent conversationnel directement sur ton téléphone ou ton ordinateur, sans avoir besoin de passer par le cloud. C’est exactement ce que propose LFM2.5-2.6B, un modèle développé par Liquid AI et présenté comme le plus petit et le plus rapide de sa catégorie. Avec seulement 2,6 milliards de paramètres, il tient dans la mémoire d’un smartphone et permet d’exécuter des tâches complexes en local, tout en gardant tes données privées.

Avec LFM2.5-2.6B, plus besoin de payer pour des serveurs cloud : l’IA tourne directement sur ton appareil.

COMMENT L'INSTALLER EN QUELQUES LIGNES DE CODE

Installer ce modèle est aussi simple que copier-coller une commande. Il suffit d’utiliser la bibliothèque Transformers, un outil très populaire pour manipuler les modèles de langage. Voici comment faire :

pip install -U transformers

Une fois l’outil installé, tu peux charger le modèle et le faire fonctionner en quelques lignes de code. Le modèle s’appelle LFM2.5-2.6B et il est disponible sur Hugging Face, une plateforme où les développeurs partagent leurs modèles d’IA.

UNE ARCHITECTURE CONÇUE POUR LES APPAREILS ÉDGE

LFM2.5-2.6B n’est pas un modèle classique : il a été spécialement conçu pour fonctionner sur des appareils edge, c’est-à-dire des machines peu puissantes comme les smartphones ou les ordinateurs portables. Pour y parvenir, Liquid AI a mis au point une architecture optimisée appelée LFM2. Ce modèle a été pré-entraîné sur environ 34 000 milliards de mots, puis affiné pour gérer des tâches complexes comme l’appel d’Outils ou les workflows multi-étapes.

Pour que le modèle puisse exécuter des tâches en plusieurs étapes, Liquid AI a augmenté sa fenêtre de contexte jusqu’à 128 000 tokens. Cela signifie qu’il peut analyser de très longues conversations ou documents sans perdre le fil. Ensuite, le modèle a été transformé en un agent grâce à une phase de post-entraînement en quatre étapes.

UNE MÉTHODE DE FORMATION POUR CRÉER DES AGENTS FIABLES

Pour qu’un modèle d’IA puisse agir comme un véritable assistant capable d’utiliser des outils, il faut une méthode de formation spécifique. Liquid AI a mis en place un pipeline de renforcement (RL) en trois parties :

  • Le moteur d'entraînement (Training Engine) : il optimise le modèle pour qu’il soit plus performant.
  • Le moteur de déploiement (Rollout Engine) : il génère des actions en utilisant la dernière version du modèle.
  • Le cadre RL (RL framework) : il organise la boucle d’entraînement en lançant des déploiements, en collectant des trajectoires et des récompenses, puis en mettant à jour le modèle.

Les actions sont ensuite exécutées dans un bac à sable (Sandbox Service), où un harnais de test (Blackbox Harness) héberge l’agent et coordonne ses interactions avec l’environnement. Un proxy de harnais (Harness Proxy) permet de traiter ces harnais comme des boîtes noires, sans avoir besoin de les modifier, tout en capturant les trajectoires au niveau des tokens pour valider l’entraînement.

DES PERFORMANCES QUI DÉFONDENT LA CONCURRENCE

LFM2.5-2.6B a été comparé à des modèles jusqu’à quatre fois plus gros sur plusieurs types de tâches :

  • Suivi d’instructions : LFM2.5-2.6B est le meilleur modèle de sa catégorie.
  • Utilisation d’outils : Il arrive en tête sur tous les benchmarks, sauf un où le modèle Qwen de 9,7 milliards de paramètres le dépasse légèrement.
  • Tâches agentiques : Il bat les modèles Gemma et rivalise avec les Qwen.
  • Connaissances et mathématiques : Il est en tête sur la connaissance et presque aussi bon que les autres sur les maths.
  • Programmation : Les modèles plus gros gardent une légère avance.

Ces résultats montrent que LFM2.5-2.6B est un modèle polyvalent, capable de rivaliser avec des modèles bien plus gros, tout en restant léger et rapide.

Avec seulement 2,6 milliards de paramètres, il bat des modèles quatre fois plus gros sur plusieurs tâches.

UNE VITESSE D'EXÉCUTION RECORD SUR CPU ET GPU

La rapidité est l’un des atouts majeurs de LFM2.6B. Voici ce qu’il est capable de faire :

Sur CPU : Grâce à son architecture optimisée, LFM2.5-2.6B est le modèle le plus rapide jamais testé. Il génère 220 tokens par seconde sur un MacBook Pro M5 Max et 113 tokens par seconde sur un PC équipé d’un processeur Ryzen AI Max+ 395. Même sur un smartphone, il peut générer 30 tokens par seconde, ce qui est suffisant pour faire tourner un agent capable.

Sur GPU : Sur un serveur équipé d’une carte NVIDIA H100, LFM2.5-2.6B peut générer près de 15 000 tokens par seconde à haute concurrence, soit environ 1,3 milliard de tokens par jour. C’est une performance exceptionnelle pour un modèle de cette taille.

UNE DÉMO POUR TESTER L'AGENT RECHERCHE

Pour te donner une idée de ce que peut faire LFM2.5-2.6B, Liquid AI propose une démonstration en ligne. Dans cette démo, un agent basé sur LFM2.5-2.6B aide à faire des recherches sur des questions spécifiques et génère un résumé des résultats. C’est un bon moyen de voir comment le modèle peut être utilisé dans la vie réelle.

COMMENT UTILISER LFM2.5-2.6B DANS TON PROJET

Si tu veux intégrer LFM2.5-2.6B dans ton application, voici comment faire. D’abord, installe la dernière version de Transformers (compatible avec les versions 5.0.0 et supérieures) :

pip install -U transformers

Ensuite, charge le modèle et fais-le fonctionner avec ce code :

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    dtype="bfloat16",
    # attnimplementation="flashattention_2"  # décommente si tu as un GPU compatible
)
tokenizer = AutoTokenizer.frompretrained(modelid)

prompt = "What is C. elegans?"
inputids = tokenizer.applychat_template(
    [{"role": "user", "content": prompt}],
    addgenerationprompt=True,
    return_tensors="pt",
    tokenize=True,
).to(model.device)

output = model.generate(
    input_ids,
    do_sample=True,
    temperature=0.2,
    top_k=80,
    repetition_penalty=1.05,
    maxnewtokens=512,
)
print(tokenizer.decode(output[0], skipspecialtokens=False))

Ce code permet de poser une question à l’agent et d’obtenir une réponse générée par le modèle. Tu peux adapter le prompt pour poser d’autres questions ou lui faire exécuter des tâches plus complexes.

DEUX VERSIONS DISPONIBLES SUR HUGGING FACE

Liquid AI propose deux versions de LFM2.5-2.6B sur Hugging Face :

  • LFM2.5-2.6B : la version complète, optimisée pour les agents.
  • LFM2.5-2.6B-Base : la version de base, idéale pour des tâches plus simples ou des tests.

Ces deux modèles sont accessibles gratuitement et peuvent être utilisés pour développer des applications locales ou des agents conversationnels.

POURQUOI CE MODÈLE EST-IL UNE RÉVOLUTION

LFM2.5-2.6B représente une avancée majeure dans le domaine de l’IA locale. Grâce à son architecture optimisée et sa capacité à fonctionner sur des appareils peu puissants, il ouvre la voie à une nouvelle génération d’applications :

  • Des agents conversationnels qui respectent ta vie privée, car tes données ne quittent jamais ton appareil.
  • Des applications mobiles qui peuvent exécuter des tâches complexes sans dépendre du cloud.
  • Des outils pour les développeurs qui veulent créer des agents locaux sans avoir à gérer des serveurs coûteux.

Avec LFM2.5-2.6B, l’IA devient enfin accessible à tous, sans barrière technique ni financière.

Plus besoin de payer pour des serveurs cloud : l’IA tourne directement sur ton appareil, en local et en toute confidentialité.

UN FUTUR OÙ L'IA S'EXÉCUTE PARTOUT

Liquid AI a une vision claire : celle d’une IA qui s’exécute partout, sans dépendre du cloud. Avec LFM2.5-2.6B, cette vision devient une réalité. Les développeurs peuvent désormais créer des agents locaux capables de rivaliser avec des modèles bien plus gros, tout en restant légers et rapides. Et toi, qu’en penses-tu ? Serais-tu prêt à utiliser une IA qui tourne directement sur ton téléphone ?

EN SAVOIR PLUS

Si tu veux en savoir plus sur LFM2.5-2.6B, tu peux consulter le blog de Liquid AI ou essayer la démo en ligne. Tu peux aussi accéder aux deux versions du modèle sur Hugging Face pour les tester par toi-même.

Sources :
  • Hugging Face Blog

L'indépendance de CLODCO est votre garantie.

Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.

Soutenir CLODCO