Meta dévoile Muse Glimmer, un modèle IA open source de 30 milliards de paramètres capable de traiter texte, images et vidéos directement sur ton ordinateur. Voici tout ce qu’il faut savoir.

UNE RÉVOLUTION LOCALE ET MULTIMODALE

Muse Glimmer, le dernier-né de Meta, débarque avec une promesse claire : rendre l’intelligence artificielle multimodale accessible à tous, sans dépendre du cloud. Ce modèle de 30 milliards de paramètres est conçu pour fonctionner en local, sur ton PC, avec une licence Apache 2.0 qui permet de l’utiliser, le modifier et le partager librement. Idéal pour les applications sensibles à la vie privée comme les assistants personnels, l’analyse de documents ou même le Développement logiciel.

Contrairement aux modèles géants qui nécessitent des serveurs coûteux, Muse Glimmer mise sur l’efficacité et la simplicité. Il est optimisé pour des tâches agentiques, c’est-à-dire qu’il peut prendre des décisions ou exécuter des actions en fonction de ce qu’il voit et comprend. Imagine un assistant qui analyse une photo de ton bureau et te suggère où ranger tes affaires, ou un outil de codage qui corrige tes erreurs en temps réel.

Muse Glimmer est le premier modèle de Meta à offrir une prise en charge native du multimodal en local, sans compromis sur les performances.

UNE ARCHITECTURE QUI COMBINE PUISSANCE ET EFFICACITÉ

Muse Glimmer repose sur une architecture dense de 30 milliards de paramètres, avec une structure optimisée pour traiter plusieurs types de données en même temps. Voici ce qui le rend unique :

D’abord, il intègre un encodeur de perception spécialement conçu pour analyser les images et les vidéos. Cet encodeur est un modèle de type ViT (Vision Transformer), inspiré des meilleures pratiques de Meta en matière de traitement visuel. Il découpe les images en petits morceaux (appelés patches), comme si tu découpais une photo en pixels carrés, puis les analyse à travers 50 couches de réseaux de neurones. Résultat : une compréhension fine des détails visuels, que ce soit une photo, un schéma ou une vidéo.

Ensuite, le modèle utilise un décodeur de texte pour générer des réponses en langage naturel. Ce décodeur est optimisé pour comprendre et produire du texte de manière fluide, que ce soit pour répondre à une question, écrire un poème ou corriger du code. Il est capable de traiter jusqu’à 32 768 tokens en une seule fois, soit environ 24 000 mots, ce qui permet de gérer des documents entiers sans perdre le fil.

Enfin, Muse Glimmer inclut un module de décodage spéculatif appelé DFlash. Ce module optionnel accélère la génération de texte en prédisant les prochaines réponses possibles, un peu comme si tu devinais la fin d’une phrase avant de la taper. En échange d’une consommation mémoire légèrement plus élevée, il peut multiplier par deux ou trois la vitesse de réponse pour certains types de contenus, notamment le code ou les structures de données.

INSTALLATION ET CONFIGURATION : PRÊT EN 5 MINUTES

Pour utiliser Muse Glimmer, il suffit de suivre ces étapes simples. Tout d’abord, installe les bibliothèques nécessaires avec pip :

pip install --upgrade transformers accelerate

Ensuite, télécharge le modèle depuis le Hugging Face Hub en utilisant les classes AutoProcessor et AutoModelForMultimodalLM. Ces outils automatisent la gestion des poids du modèle et de son processeur associé, qui prépare les données avant qu’elles n’entrent dans le réseau de neurones.

from transformers import AutoProcessor, AutoModelForMultimodalLM

MODEL_ID = "meta-models/Muse-Glimmer-30B"

# Charger le modèle
processor = AutoProcessor.frompretrained(MODELID)
model = AutoModelForMultimodalLM.from_pretrained(
    MODEL_ID,
    dtype="auto",
    device_map="auto"
)

Le paramètre device_map="auto" permet au modèle de s’adapter automatiquement à ton matériel : NVIDIA, AMD ou même Intel. Pas besoin de configurer quoi que ce soit, le modèle choisit le meilleur accélérateur disponible.

GÉNÉRER DU TEXTE COMME UN PRO

Une fois le modèle chargé, tu peux l’utiliser pour générer du texte à partir de simples instructions. Par exemple, pour lui demander une blague sur l’économie de RAM :

from transformers import AutoProcessor, AutoModelForMultimodalLM

MODEL_ID = "meta-models/Muse-Glimmer-30B"

# Charger le modèle
processor = AutoProcessor.frompretrained(MODELID)
model = AutoModelForMultimodalLM.from_pretrained(
    MODEL_ID,
    dtype="auto",
    device_map="auto"
)

# Prompt
messages = [
    {"role": "user", "content": "Write a short joke about saving RAM."},
]

# Préparer l'entrée
inputs = processor.applychattemplate(
    messages,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
    addgenerationprompt=True,
    reasoning_strength="low"
).to(model.device)
inputlen = inputs["inputids"].shape[-1]

# Générer la réponse
outputs = model.generate(**inputs)
response = processor.decode(outputs[0][inputlen:], skipspecial_tokens=False)
print(response)

Le modèle va analyser ta demande et te répondre avec une blague, comme : "Pourquoi le programmeur n’a-t-il jamais faim ? Parce qu’il mange ses bits ."

COMPRENDRE LES IMAGES : UNE NOUVELLE FAÇON DE VOIR

Muse Glimmer ne se limite pas au texte. Il peut aussi analyser des images et répondre à des questions à leur sujet. Pour cela, il faut installer la bibliothèque torchvision, qui gère le traitement des images :

pip install torchvision

Voici comment poser une question sur une image :

from transformers import AutoProcessor, AutoModelForMultimodalLM

MODEL_ID = "meta-models/Muse-Glimmer-30B"

# Charger le modèle
processor = AutoProcessor.frompretrained(MODELID)
model = AutoModelForMultimodalLM.from_pretrained(
    MODEL_ID,
    dtype="auto",
    device_map="auto"
)

# Images + Texte
messages = [
    {
        "role": "user", "content": [
            {"type": "image", "image": "https://huggingface.co/datasets/merve/vl-test-suite/resolve/main/SF.png"},
            {"type": "text", "text": "What is shown in this image?"}
        ]
    }
]

inputs = processor.applychattemplate(
    messages,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
    addgenerationprompt=True,
    reasoning_strength="low"
).to(model.device)
inputlen = inputs["inputids"].shape[-1]

# Générer la réponse
outputs = model.generate(**inputs)
response = processor.decode(outputs[0][inputlen:], skipspecial_tokens=False)
print(response)

Le modèle va analyser l’image et te décrire ce qu’il voit. Par exemple, s’il s’agit d’une photo de San Francisco, il pourrait répondre : "Cette image montre un pont suspendu au-dessus de l’eau, avec des bâtiments en arrière-plan et des bateaux sur la baie."

ANALYSER LES VIDÉOS : SANS SON, MAIS PAS SANS PRÉCISION

Muse Glimmer peut aussi traiter des vidéos, même sans audio. Pour cela, il faut installer torchcodec, une bibliothèque spécialisée dans le décodage vidéo :

pip install torchcodec

Voici comment décrire une vidéo :

from transformers import AutoProcessor, AutoModelForMultimodalLM

MODEL_ID = "meta-models/Muse-Glimmer-30B"

# Charger le modèle
processor = AutoProcessor.frompretrained(MODELID)
model = AutoModelForMultimodalLM.from_pretrained(
    MODEL_ID,
    dtype="auto",
    device_map="auto"
)

# Vidéos + Texte
messages = [
    {
        "role": "user",
        "content": [
            {"type": "video", "video": "https://huggingface.co/datasets/merve/vl-test-suite/resolve/main/IMG_8137.mp4"},
            {"type": "text", "text": "Describe what happens in this video."},
        ],
    },
]

inputs = processor.applychattemplate(
    messages,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
    addgenerationprompt=True,
    reasoning_strength="low",
    processorkwargs={"numframes": 96},
).to(model.device)

inputlen = inputs["inputids"].shape[-1]
outputs = model.generate(**inputs)

response = processor.decode(
    outputs[0, input_len:],
    skipspecialtokens=False,
)
print(response)

Le modèle va analyser la vidéo et te donner une description détaillée de ce qui s’y passe. Par exemple, s’il s’agit d’une vidéo de cuisine, il pourrait répondre : "La vidéo montre une personne en train de préparer un gâteau. Elle mélange les ingrédients dans un bol, puis verse la pâte dans un moule avant de le mettre au four."

Muse Glimmer peut traiter jusqu’à 96 images par vidéo, avec une précision qui rivalise avec les modèles cloud les plus avancés.

UTILISER DES OUTILS : L’IA QUI AGIT COMME TOI

Ce qui rend Muse Glimmer vraiment puissant, c’est sa capacité à interagir avec des outils externes. Par exemple, il peut analyser une image, identifier une ville, puis te donner des conseils sur les vêtements à porter en fonction de la météo. Voici comment faire :

import json
import re
from transformers import AutoProcessor, AutoModelForMultimodalLM

MODEL_ID = "meta-models/Muse-Glimmer-30B"

# Charger le modèle
processor = AutoProcessor.frompretrained(MODELID)
model = AutoModelForMultimodalLM.from_pretrained(
    MODEL_ID,
    dtype="auto",
    device_map="auto"
)

# Définir les outils disponibles
tools = [
    {
        "type": "function",
        "function": {
            "name": "weather.get",
            "description": "Get the current weather for a city.",
            "parameters": {
                "type": "object",
                "properties": {
                    "city": {"type": "string"},
                },
                "required": ["city"],
            },
        },
    }
]

# Prompt
messages = [
    {
        "role": "user", "content": [
            {"type": "image", "image": "https://huggingface.co/datasets/merve/vl-test-suite/resolve/main/SF.png"},
            {"type": "text", "text": "I'm going to the city in this picture. What clothes should I wear?"},
        ],
    },
]

inputs = processor.applychattemplate(
    messages,
    tools=tools,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
    addgenerationprompt=True,
    reasoning_strength="low"
).to(model.device)

inputlen = inputs["inputids"].shape[-1]
outputs = model.generate(**inputs)
response = processor.decode(outputs[0][inputlen:], skipspecial_tokens=False)
print(response)

Le modèle va d’abord analyser l’image pour identifier la ville (ici, San Francisco), puis appeler l’outil météo pour obtenir la température actuelle. Enfin, il te donnera des conseils vestimentaires adaptés, comme : "À San Francisco, il fait environ 18°C aujourd’hui. Prends un pull léger et un jean."

DÉTECTION D’OBJETS : TROUVER CE QUE TU CHERCHES

Muse Glimmer peut aussi détecter des objets dans une image et te donner leurs coordonnées, comme un système de reconnaissance visuelle avancé. Voici comment extraire les informations d’un pont dans une photo :

from transformers import AutoProcessor, AutoModelForMultimodalLM

MODEL_ID = "meta-models/Muse-Glimmer-30B"

# Charger le modèle
processor = AutoProcessor.frompretrained(MODELID)
model = AutoModelForMultimodalLM.from_pretrained(
    MODEL_ID,
    dtype="auto",
    device_map="auto"
)

messages = [{
    "role": "user",
    "content": [
        {"type": "image", "image": "https://huggingface.co/datasets/merve/vl-test-suite/resolve/main/SF.png"},
        {
            "type": "text",
            "text": (
                "Detect the bridge. Return only the detection in the model's "
                "native object-detection format, with no explanation."
            ),
        },
    ],
}]

inputs = processor.applychattemplate(
    messages,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
    addgenerationprompt=True,
    reasoning_strength="low",
).to(model.device)

inputlen = inputs["inputids"].shape[-1]
outputs = model.generate(**inputs, maxnewtokens=128)
response = processor.decode(outputs[0][inputlen:], skipspecial_tokens=False)

detections = json.loads(response.removesuffix("<|eot|>"))
print(detections)

Le modèle va te retourner un JSON avec les coordonnées du pont détecté, comme :

{
  "boxes": [[0.1, 0.3, 0.8, 0.5]],
  "labels": ["bridge"],
  "scores": [0.98]
}

Cela signifie que le pont occupe une zone allant de 10% à 80% en largeur et de 30% à 50% en hauteur de l’image, avec une confiance de 98%.

DÉPLOYER LOCALEMENT : TOUT SUR TON ORDINATEUR

Muse Glimmer est conçu pour fonctionner en local, sans dépendre d’Internet. Voici comment le déployer sur ta machine :

D’abord, inspecte ton matériel et vérifie que tu as assez de mémoire (au moins 16 Go de RAM et une carte graphique récente pour les performances optimales). Ensuite, télécharge les poids du modèle depuis le Hugging Face Hub. Si tu veux la version la plus légère, choisis le format GGUF avec une quantification Q4KM, qui réduit la taille du modèle sans trop perdre en précision.

Pour lancer le serveur local, utilise la commande suivante avec llama.cpp :

curl -LsSf https://llama.app/install.sh | sh
llama serve -hf meta-models/Muse-Glimmer-30B-GGUF

Tu peux aussi interagir avec le modèle via une API compatible OpenAI :

curl http://localhost:8080/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{
        "messages": [
            {"role": "system", "content": "You are a helpful assistant."},
            {"role": "user", "content": "Write a limerick about python exceptions"}
        ]
    }'

Cette commande te permettra de poser des questions au modèle comme si tu utilisais une API cloud, mais tout se passe sur ton ordinateur.

Avec Muse Glimmer, tu peux déployer un modèle IA puissant sur un simple PC, sans abonnement ni connexion Internet.

OPTIMISER LES PERFORMANCES : PLUS VITE, PLUS EFFICACE

Pour tirer le meilleur parti de Muse Glimmer, Meta a intégré plusieurs optimisations. L’une d’elles est le décodage spéculatif avec le type draft-dflash. Cette technique utilise un modèle plus petit (le assistant model) pour prédire les prochaines réponses, ce qui accélère la génération sans perdre en qualité.

Voici comment l’utiliser :

import torch
from transformers import AutoProcessor, MuseGlimmerAssistantModel, MuseGlimmerForConditionalGeneration

model_id = "meta-models/Muse-Glimmer-30B"
assistantmodelid = "meta-models/Muse-Glimmer-30B-assistant"
target = MuseGlimmerForConditionalGeneration.frompretrained(modelid, dtype=torch.bfloat16, device_map="auto")
assistant = MuseGlimmerAssistantModel.frompretrained(assistantmodelid, dtype=torch.bfloat16, devicemap="auto")
processor = AutoProcessor.frompretrained(modelid)

messages = [
    {
        "role": "user", "content": [
            {"type": "image", "url": "https://huggingface.co/datasets/merve/vl-test-suite/resolve/main/SF.png"},
            {"type": "text", "text": "What is shown in this image?"}
        ]
    }
]

inputs = processor.applychattemplate(
    messages,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
    addgenerationprompt=True,
    reasoning_strength="low"
).to(target.device)
inputlen = inputs["inputids"].shape[-1]

outputs = target.generate(
    **inputs,
    assistant_model=assistant,
    speculation_type="dflash",
    do_sample=True
)
response = processor.decode(outputs[0][inputlen:], skipspecial_tokens=False)
print(response)

Avec cette méthode, tu peux gagner jusqu’à 30% de temps de réponse sur certains types de requêtes, surtout celles qui génèrent beaucoup de texte comme le code ou les explications techniques.

DÉPLOYER SUR LE CLOUD : OPTION HUGGING FACE

Si tu préfères utiliser Muse Glimmer via le cloud, Meta propose des endpoints d’inférence sur Hugging Face. Voici comment déployer le modèle :

D’abord, configure ton jeton d’authentification Hugging Face et choisis la région où tu veux héberger ton modèle. Ensuite, déploie un endpoint avec le moteur vLLM, optimisé pour les grands modèles de langage :

# Déployer sur un endpoint vLLM
vllm serve meta-models/Muse-Glimmer-30B --model-impl transformers --tensor-parallel-size 4

# Tester l'endpoint
curl -s http://127.0.0.1:8000/v1/chat/completions \
    -H 'Content-Type: application/json' \
    -d '{
      "model": "meta-models/Muse-Glimmer-30B",
      "messages": [
        {"role": "user", "content": "Explain tensor parallelism briefly."}
      ],
      "temperature": 0.0,
      "max_tokens": 256
    }'

Tu peux aussi utiliser l’interface OpenClaw pour gérer plusieurs modèles et endpoints depuis une seule interface :

~/.openclaw/openclaw.json

Ce fichier de configuration te permet de définir les modèles disponibles, leurs paramètres et les endpoints associés. Par exemple :

{
  models: {
    mode: "merge",
    providers: {
      muse: {
        baseUrl: "https://YOUR-ENDPOINT.endpoints.huggingface.cloud/v1",
        apiKey: {
          source: "env",
          provider: "default",
          id: "HF_TOKEN"
        },
        api: "openai-completions",
        authHeader: true,
        models: [{
          id: "meta-models/Muse-Glimmer-30B",
          name: "Muse Glimmer",
          reasoning: false,
          input: ["text", "image"],
          contextWindow: 32768,
          maxTokens: 8192
        }]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "muse/meta-models/Muse-Glimmer-30B" }
    }
  }
}

Une fois configuré, tu peux redémarrer le service et tester la connexion :

openclaw gateway restart
openclaw agent --message "Reply with: muse-ready"

BENCHMARKS : COMMENT SE COMPARE MUSE GLIMMER ?

Meta a testé Muse Glimmer sur plusieurs benchmarks pour évaluer ses performances. Voici les résultats clés :

Sur le benchmark VideoMME2, qui teste la compréhension des vidéos, Muse Glimmer obtient des scores parmi les meilleurs de sa catégorie. Par exemple, il atteint 78,5% de réponses correctes sur les questions posées, ce qui le place devant des modèles comme LLaVA-1.6 ou InstructBLIP.

Sur les tâches de génération de texte, Muse Glimmer rivalise avec des modèles bien plus grands, comme Mistral-7B ou Llama-3-8B, tout en restant bien plus léger. Son architecture optimisée lui permet de traiter jusqu’à 8 192 tokens en une seule fois, ce qui est idéal pour analyser des documents longs ou des conversations complexes.

Enfin, sur les tâches de détection d’objets, Muse Glimmer affiche une précision de 92% sur les benchmarks standards, ce qui le rend compétitif face à des outils spécialisés comme YOLO ou Faster R-CNN.

Muse Glimmer bat des records en termes de rapport performance/taille, prouvant qu’on peut avoir un modèle puissant sans sacrifier la simplicité.

POUR QUI EST FAIT MUSE GLIMMER ?

Muse Glimmer s’adresse à plusieurs types d’utilisateurs :

  • Les développeurs : qui veulent intégrer un modèle multimodal dans leurs applications sans dépendre du cloud. Parfait pour les outils de codage, les assistants de documentation ou les systèmes de gestion de fichiers intelligents.
  • Les entreprises : soucieuses de la vie privée de leurs données. Avec Muse Glimmer, tout reste en local, ce qui évite les risques de fuites ou de surveillance.
  • Les passionnés de tech : qui veulent expérimenter avec l’IA sans se ruiner. Le modèle est open source, donc tu peux le modifier, l’améliorer et le partager avec la communauté.
  • Les éducateurs : qui cherchent à enseigner l’IA de manière pratique. Muse Glimmer est un excellent outil pour montrer comment fonctionnent les modèles multimodaux, avec des exemples concrets et faciles à comprendre.

LES LIMITES À CONNAÎTRE

Malgré ses nombreuses qualités, Muse Glimmer a quelques limites :

D’abord, il nécessite une carte graphique récente pour fonctionner à plein régime. Sur un PC sans GPU, les performances seront bien moindres. Ensuite, bien que le modèle soit optimisé pour le local, il reste gourmand en ressources : prévois au moins 16 Go de RAM et un GPU avec 12 Go de VRAM pour une expérience fluide.

Enfin, comme tous les modèles open source, Muse Glimmer n’est pas parfait. Il peut parfois donner des réponses approximatives ou incorrectes, surtout sur des sujets très spécialisés. Il est donc important de toujours vérifier ses réponses, surtout si tu l’utilises pour des tâches critiques.

LE FUTUR DE MUSE GLIMMER

Meta a déjà annoncé que Muse Glimmer sera régulièrement mis à jour, avec de nouvelles fonctionnalités et optimisations. Parmi les améliorations à venir :

  • Une meilleure prise en charge des vidéos longues et des flux en direct.
  • Une intégration plus poussée avec les outils de développement, comme les IDE ou les systèmes de gestion de code.
  • Des optimisations supplémentaires pour réduire encore la consommation mémoire et accélérer les réponses.

Avec Muse Glimmer, Meta prouve une fois de plus qu’il est possible de concilier puissance, simplicité et open source. Un outil qui pourrait bien devenir la référence pour les développeurs et les entreprises qui veulent exploiter l’IA multimodale sans dépendre du cloud.

Muse Glimmer n’est pas juste un modèle. C’est une révolution dans la façon dont on utilise l’IA au quotidien.
Sources :
  • Hugging Face Blog

L'indépendance de CLODCO est votre garantie.

Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.

Soutenir CLODCO