Liquid AI révolutionne l'inférence des modèles de langage avec LFM2.5-DSpark. Jusqu'à 3,2 fois plus rapide, sans perte de qualité. Explications et tutoriels inclus.

Imaginez un modèle d'intelligence artificielle qui répond deux à trois fois plus vite à vos questions, tout en gardant exactement la même précision. C'est exactement ce que propose LFM2.5-DSpark, la nouvelle technologie développée par Liquid AI. Trois modèles de la famille LFM2.5 en bénéficient immédiatement : LFM2.5-1.2B-Instruct, LFM2.5-2.6B et LFM2.5-8B-A1B.

QU'EST-CE QUE LE DS PARK ?

Le DSpark (Draft Speculative Decoding) est une technique d'optimisation qui change la donne pour l'inférence des grands modèles de langage. Traditionnellement, la phase de décodage est limitée par la mémoire : les données doivent être chargées depuis la RAM vers le processeur, ce qui prend plus de temps que les calculs eux-mêmes. Le DSpark contourne ce problème en utilisant un modèle léger pour proposer des tokens candidats, puis en faisant vérifier ces propositions par le modèle principal en une seule passe. Résultat : on partage le coût de chargement des données entre tous les tokens vérifiés.

Le DSpark combine trois innovations : un modèle léger, une architecture optimisée et un entraînement ciblé.

LES TROIS COMPOSANTES DE DS PARK

Cette technologie repose sur trois piliers. D'abord, l'architecture : Liquid AI a conçu des modèles de draft simplifiés, composés uniquement d'attention, avec seulement 5 couches et un bloc de 9. Ensuite, l'entraînement : chaque modèle a été entraîné pendant 15 époques sur un mélange de données variées (SFT, chat, code, fonction-calling). Enfin, la sélection : au lieu de choisir l'époque avec la plus faible perte, Liquid AI a retenu celle offrant le meilleur taux d'acceptation des tokens proposés.

Les modèles draft résultants sont particulièrement compacts : environ 300 millions de paramètres chacun. Malgré leur petite taille, ils permettent des gains de performance spectaculaires.

LA QUALITÉ RESTE IDENTIQUE

Le fonctionnement du DSpark garantit une qualité inchangée. Lorsqu'un token proposé par le modèle draft est accepté, c'est parce qu'il correspond exactement à ce que le modèle principal aurait généré. En cas de rejet, le modèle principal prend le relais. La séquence finale est donc strictement identique à celle produite par un décodage classique. Les benchmarks comme le pass@1 ou l'exact match ne montrent aucune différence.

Le DSpark ne sacrifie rien : même précision, mais des réponses jusqu'à 3,2 fois plus rapides.

DES PERFORMANCES MESURÉES SUR CPU ET GPU

Liquid AI a testé le DSpark sur deux types de Matériel. D'abord, sur un MacBook Pro M4 Max avec des poids FP16 GGUF, en utilisant llama.cpp (avec des kernels Metal expérimentaux). Ensuite, sur un GPU NVIDIA H100 80 Go en BF16, avec SGLang. Dans les deux cas, les tests ont utilisé un bloc de taille 9, une taille de lot de 1, et une température de 0. Cinq jeux de données différents ont servi à évaluer les performances.

Les trois modèles draft ont montré des améliorations notables, que ce soit sur accélérateur haut de gamme ou sur périphérique edge.

LES RÉSULTATS POUR LFM2.5-2.6B

Pour le modèle LFM2.5-2.6B, les gains sont particulièrement impressionnants sur MacBook. La latence est réduite de 57 % en moyenne, permettant d'atteindre un niveau d'interactivité supérieur à celui de la plupart des modèles cloud propriétaires (environ 140 tokens par seconde selon le jeu de données).

Sur des scénarios multi-outils, le DSpark divise le temps de réponse par deux en moyenne pour ce modèle.

LES VARIATIONS SELON LES MODÈLES

Les performances varient selon les modèles. Pour LFM2.5-1.2B-Instruct, les gains oscillent entre 10 % et 52 %, en fonction de la distribution des textes. Le taux d'acceptation des tokens proposés est moins stable sur ce modèle plus petit.

Pour LFM2.5-8B-A1B, le taux d'acceptation est plus élevé que pour les deux modèles denses, mais l'amélioration n'est que de 18 % en moyenne sur périphérique. Cette différence s'explique par l'implémentation actuelle des experts dans le backend Metal de llama.cpp : vérifier k tokens active plus d'experts, ce qui génère plus de trafic mémoire qu'un décodage classique.

COMMENT UTILISER LFM2.5-DS PARK AVEC SGL ANG

Pour utiliser le DSpark avec SGLang, il faut une version de SGLang intégrant le support du DSpark pour les cibles LFM2.5 (PR #31041). Lancez le serveur avec la commande suivante :

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-2.6B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --disable-radix-cache --mem-fraction-static 0.75 --port 30000

Vous pouvez ensuite interroger l'API compatible OpenAI à l'adresse http://localhost:30000/v1. La taille du bloc est lue depuis le fichier config.json du modèle draft. Sans les flags --speculative-*, le serveur fonctionne en mode classique.

COMMENT UTILISER LFM2.5-DS PARK AVEC LLAMA.CPP

Pour utiliser le DSpark avec llama.cpp, il faut une version modifiée du projet (PR#27383). Lancez le serveur avec :

llama-server -m LFM2.5-2.6B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 10 --spec-draft-n-min 0 \
  -fa on -ngl 99

La taille du bloc est lue depuis les métadonnées du modèle draft. Le paramètre n-max est limité à cette valeur. Le décodage est exact : chaque token proposé est vérifié, donc la sortie en mode greedy est identique à celle du modèle seul. Les temps de réponse indiquent le nombre de tokens proposés et acceptés.

OÙ TROUVER LES MODÈLES DS PARK ?

Les poids des modèles draft DSpark sont disponibles sur Hugging Face, en formats Safetensors et GGUF. Trois modèles sont concernés : LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark et LFM2.5-8B-A1B-DSpark.

COMMENT CITER LFM2.5-DS PARK ?

Pour citer cette technologie, utilisez la référence suivante :

@article{liquidAI2026dspark,
  author = {Liquid AI},
  title = {LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2.5-dspark},
}

UNE RÉVOLUTION POUR L'INFÉRENCE IA

Le DSpark marque un tournant dans l'optimisation des modèles d'IA. En combinant légèreté des modèles draft et vérification systématique, Liquid AI parvient à diviser les temps de réponse par jusqu'à 3,2, sans aucun compromis sur la qualité. Une avancée majeure pour les déploiements edge et les applications en temps réel.

L'inférence IA n'a jamais été aussi rapide, ni aussi précise.

LES MODÈLES MENTIONNÉS

Trois modèles de la famille LFM2.5 bénéficient du DSpark :

  • LFM2.5-1.2B-Instruct : version optimisée pour l'instruction
  • LFM2.5-2.6B : modèle polyvalent
  • LFM2.5-8B-A1B : version avec architecture Mixture of Experts

POUR ALLER PLUS LOIN

Découvrez comment intégrer le DSpark dans vos projets :

  • Téléchargez les poids sur Hugging Face
  • Utilisez les versions modifiées de llama.cpp ou SGLang
  • Consultez la documentation technique sur le blog de Liquid AI

EN BREF

LFM2.5-DSpark est une innovation majeure pour l'inférence des modèles d'IA. Grâce à des modèles draft légers et à une vérification systématique, elle permet d'accélérer les réponses jusqu'à 3,2 fois, sans perte de qualité. Compatible avec les principaux frameworks, cette technologie ouvre la voie à des applications plus réactives et plus accessibles.

Plus rapide, plus efficace, sans compromis.

LES CHIFFRES CLÉS

Voici les gains mesurés par Liquid AI :

  • LFM2.5-2.6B : jusqu'à 57 % de latence en moins sur MacBook
  • LFM2.5-1.2B-Instruct : gains variables entre 10 % et 52 %
  • LFM2.5-8B-A1B : 18 % d'amélioration moyenne sur périphérique
  • Tous modèles confondus : jusqu'à 3,2 fois plus rapide que l'inférence classique

LES TECHNOLOGIES DERRIÈRE LE DS PARK

Le DSpark combine plusieurs techniques :

  • Draft models : modèles légers spécialisés dans la proposition de tokens
  • Speculative decoding : vérification systématique des tokens proposés
  • Attention-only architecture : simplification du modèle draft pour réduire la taille
  • FlashInfer backend : optimisation des calculs d'attention

LES LIMITES ACTUELLES

Malgré ses performances, le DSpark présente quelques limitations :

  • Sur LFM2.5-8B-A1B, les gains sont réduits sur périphérique à cause de l'implémentation des experts dans Metal
  • Les modèles draft sont optimisés pour des tâches spécifiques (chat, code, etc.)
  • Le décodage reste dépendant du matériel utilisé (CPU/GPU)

COMPATIBILITÉ MATÉRIELLE

Le DSpark fonctionne sur :

  • MacBook Pro M4 Max (avec Metal)
  • GPU NVIDIA H100 80 Go (avec CUDA)
  • Autres configurations supportant llama.cpp ou SGLang

LES BENCHMARKS UTILISÉS

Liquid AI a évalué le DSpark sur cinq jeux de données différents, couvrant divers scénarios d'utilisation :

  • Chat conversationnel
  • Génération de code
  • Exécution de fonctions
  • Traitement de texte général
  • Scénarios multi-outils

L'AVENIR DU DS PARK

Cette technologie est encore jeune, mais ses perspectives sont prometteuses. Liquid AI travaille déjà à améliorer l'implémentation des experts pour les modèles Mixture of Experts, ce qui pourrait réduire l'écart de performance observé sur LFM2.5-8B-A1B. D'autres optimisations matérielles sont également à l'étude.

Le DSpark n'est qu'un début : l'optimisation de l'inférence IA va continuer à progresser.

COMMENT DÉBUTER AVEC LFM2.5-DS PARK

Pour intégrer le DSpark dans vos projets, suivez ces étapes :

  1. Téléchargez les poids des modèles draft depuis Hugging Face
  2. Installez une version compatible de llama.cpp ou SGLang
  3. Configurez votre serveur selon la documentation
  4. Testez avec vos propres jeux de données pour mesurer les gains

CONCLUSION : UNE AVANCÉE MAJEURE POUR L'IA

LFM2.5-DSpark représente une avancée significative dans le domaine de l'inférence des modèles d'IA. En combinant légèreté des modèles draft et vérification systématique, cette technologie permet d'accélérer les réponses jusqu'à 3,2 fois, sans aucun compromis sur la qualité. Compatible avec les principaux frameworks et matériel, elle ouvre la voie à des applications plus réactives et plus accessibles, que ce soit sur cloud ou en périphérie. Une innovation à suivre de près.

Sources :
  • Hugging Face Blog

L'indépendance de CLODCO est votre garantie.

Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.

Soutenir CLODCO