Une percée majeure pour faire tourner des modèles d'IA puissants sur des appareils bas de gamme. La quantization-aware distillation change la donne.
DES MODÈLES D'IA 4 FOIS PLUS LÉGERS SANS PERDRE EN PERFORMANCE
Une équipe de Recherche vient de publier des versions ultra-légères de ses modèles LFM2.5. Grâce à une technique appelée quantization-aware distillation (ou distillation avec prise en compte de la quantification en français), ces modèles passent de 16 bits à seulement 4 bits. Résultat : ils occupent 4 fois moins de mémoire et tournent jusqu'à 33 % plus vite, tout en gardant presque toute leur puissance d'origine. Imaginez un modèle d'IA comme une recette de cuisine : avant, il fallait des ingrédients très précis (16 bits), maintenant on utilise des mesures simplifiées (4 bits) sans que le goût ne change vraiment.
QUATRE MODÈLES DISPONIBLES, DU SMARTPHONE AU PC
Quatre tailles de modèles sont proposées : LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct et LFM2.5-2.6B. Le premier chiffre correspond à la taille du modèle en millions de paramètres. Par exemple, le LFM2.5-230M a 230 millions de paramètres, ce qui est déjà énorme pour un modèle fonctionnant sur un téléphone. Le LFM2.5-2.6B est bien plus puissant, mais reste utilisable sur un ordinateur portable classique.
DES TESTS POUR VÉRIFIER LA QUALITÉ
Pour prouver que ces modèles légers fonctionnent aussi bien que les versions lourdes, les chercheurs ont lancé une série de tests sur six benchmarks différents. Ces tests mesurent la capacité de raisonnement, le suivi d'instructions, l'utilisation d'outils et même les capacités d'agent autonome. Parmi les épreuves : GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF et BFCLv4. Pour les deux plus petits modèles, un test de mathématiques (GSM8K) a été ajouté. Pour les deux plus grands, c'est un défi mathématique plus complexe (AIME25).
PERFORMANCE SUR MATÉRIEL BAS DE GAMME
L'équipe a mesuré la vitesse de traitement des quatre modèles sur quatre appareils différents : un MacBook Pro, un NucBox EVO-X2, un Samsung Galaxy S26 Ultra et un Raspberry Pi 5. Les deux premiers utilisent l'accélération GPU, tandis que les deux autres dépendent du processeur ARM. Les versions en 16 bits servent de référence pour comparer les performances.
Les résultats sont impressionnants. Les modèles LFM2.5-230M et LFM2.5-350M en version Q40 atteignent la même qualité que les versions Q5K_M tout en étant 4 à 33 % plus rapides. Pour les plus gros modèles, LFM2.5-1.2B-Instruct et LFM2.5-2.6B, la qualité équivaut à celle des versions Q4KM avec un gain de 3 à 14 % de vitesse. Mieux encore, ces modèles rivalisent avec les meilleures versions quantifiées externes comme UD-Q4KXL d'Unsloth.
COMMENT UTILISER CES MODÈLES ?
Pour faire fonctionner ces modèles, il suffit d'utiliser llama.cpp ou tout autre logiciel compatible avec les fichiers GGUF en format Q4_0. Voici un exemple de commande pour tester le LFM2.5-350M :
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
Cette commande charge le modèle et lui demande de définir ce qu'est un C. elegans, un petit ver utilisé en biologie comme organisme modèle.
OÙ LES TROUVER ET COMMENT LES CITER ?
Les quatre modèles sont disponibles dès maintenant sur Hugging Face. Vous pouvez les télécharger gratuitement et les utiliser immédiatement. Voici les liens directs : LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct et LFM2.5-2.6B.
Pour citer ces travaux dans un rapport ou un article, utilisez cette référence :
Ou bien la version BibTeX :
@article{liquidAI2026Q40,
author = {Liquid AI},
title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/qad},
}
UNE RÉVOLUTION POUR L'IA SUR APPAREILS MOBILES
Cette avancée ouvre la porte à une nouvelle génération d'applications d'intelligence artificielle. Plus besoin d'un serveur puissant ou d'un ordinateur de bureau pour faire tourner des modèles performants. Un simple smartphone ou un nano-ordinateur comme le Raspberry Pi suffit désormais. Les possibilités sont immenses : assistants personnels toujours actifs, agents autonomes locaux, ou même applications éducatives interactives. Cette technique de quantification intelligente pourrait bien devenir la norme pour les modèles d'IA de demain.
POURQUOI C'EST IMPORTANT POUR TOI ?
Si tu t'intéresses à l'IA, que ce soit pour coder, tester des modèles ou simplement comprendre comment ça marche, ces nouveaux modèles sont une aubaine. Ils montrent qu'on peut concilier puissance et légèreté. Plus besoin de choisir entre performance et accessibilité : les modèles Q4_0 offrent les deux. Et surtout, ils rendent l'IA plus démocratique, accessible à tous ceux qui n'ont pas accès à des machines ultra-puissantes.
ET DEMAIN ?
Avec cette publication, Liquid AI pose une nouvelle étape dans l'optimisation des modèles d'IA. D'autres équipes pourraient s'inspirer de cette méthode pour créer des versions encore plus légères et plus rapides. Le futur de l'IA sur appareils mobiles s'annonce prometteur, et cette avancée en est la preuve concrète. Reste à voir comment les développeurs vont exploiter cette nouvelle liberté pour inventer les applications de demain.
EN RÉSUMÉ
Les modèles LFM2.5 Q4_0 représentent une avancée majeure pour l'IA légère. Grâce à la quantization-aware distillation, ils offrent :
- Une taille réduite de 4 fois par rapport aux versions originales
- Une vitesse de traitement augmentée jusqu'à 33 %
- Une perte de performance minimale (moins de 4 %)
- Une compatibilité avec des appareils bas de gamme comme les smartphones ou les Raspberry Pi
Une solution idéale pour démocratiser l'IA et la rendre accessible à tous, sans compromis sur la qualité.
- Hugging Face Blog
L'indépendance de CLODCO est votre garantie.
Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.
Soutenir CLODCO


