Meta Muse Glimmer apporte des agents d’IA locaux aux GPU grand public

Meta publie Muse Glimmer sous une licence Apache 2.0 pour les agents d’IA locaux pouvant s’exécuter sur un GPU grand public.

Les Superintelligence Labs de la société ont publié les poids du modèle de 30 milliards de paramètres sur Hugging Face. Meta indique que les développeurs peuvent l’utiliser pour le codage local, les appels de fonctions, les agents locaux et l’évaluation LLM en tant que juge.

La version cible une contrainte opérationnelle à laquelle sont confrontées les équipes d’IA : les modèles hébergés dans le cloud ont besoin d’un accès réseau et d’une infrastructure centrale. Meta propose plutôt Muse Glimmer pour les charges de travail qui nécessitent un modèle sur l’appareil, y compris des agents personnels ayant accès aux plannings, aux messages, aux fichiers et à d’autres contextes privés.

Meta Muse Glimmer mène plusieurs benchmarks de tâches d’agent

Les tests de référence de Meta placent Muse Glimmer devant Gemma4-31B et Qwen3.6-27B sur cinq des huit benchmarks d’agent général. Le modèle a obtenu un score de 75,5 sur MCP Atlas. Gemma4-31B a atteint 54,2 et Qwen3.6-27B a enregistré 62,5.

DeepSearch QA suit un modèle similaire. Meta rapporte un score de 74,6 pour Muse Glimmer, contre 61,7 pour Gemma4-31B et 71,1 pour Qwen3.6-27B. L’annonce fournie identifie les deux points de référence comme des tests de la capacité d’un agent à travailler au sein d’échafaudages et à répondre à des demandes multi-tours.

Le modèle a obtenu un score de 23,5 sur τ²-Banking. Gemma4-31B a enregistré 15,1. Qwen3.6-27B a atteint 16,7.

Muse Glimmer a également affiché 47,6 sur WildClawBench, devant les 37,6 de Gemma4-31B et les 43,2 de Qwen3.6-27B. Son résultat GAIA2 atteint 43,3, contre respectivement 36,4 et 40,0.

Les scores des autres agents sont en faveur de Qwen3.6-27B. Le tableau de Meta donne ce modèle 1 141 sur GDPval-AA, contre 953 pour Muse Glimmer et 811 pour Gemma4-31B. Qwen3.6-27B a également mené SkillsBench avec Skills à 46,6, où Muse Glimmer a enregistré 44,3.

OSWorld-Verified a produit l’écart le plus important dans ce groupe. Meta rapporte 75,6 pour Qwen3.6-27B. Muse Glimmer a atteint 65,9 et Gemma4-31B 58,5.

Ces tests mesurent des tâches contraintes. Ils ne démontrent pas comment un agent local se comportera une fois qu’une organisation l’aura connecté à ses propres fichiers, calendriers, systèmes de messagerie ou outils internes.

Les résultats de codage sont partagés entre Muse Glimmer et Qwen

Les résultats de codage de Muse Glimmer montrent une comparaison plus étroite. Le modèle a mené SWE-Bench Pro avec un score de 51,2. Meta rapporte 36,9 pour Gemma4-31B et 50,2 pour Qwen3.6-27B.

SciCode a produit un résultat proche. Muse Glimmer a obtenu un score de 43,6, légèrement au-dessus de Gemma4-31B à 43,4. Qwen3.6-27B a enregistré 39,8.

Qwen3.6-27B a mené deux autres évaluations de codage. Il a obtenu un score de 77,2 sur SWE-Bench Verified, contre 76,0 pour Muse Glimmer. TerminalBench 2.1 a donné à Qwen3.6-27B un score de 60,7 ; Muse Glimmer a atteint 51,7 et Gemma4-31B 43,4.

Un agent de codage local fait plus que produire du code. Il a besoin d’un échafaudage qui décide à quels référentiels, terminaux, environnements de test et commandes le modèle peut accéder. Meta indique que Muse Glimmer prend en charge OpenClaw et d’autres modèles d’orchestration d’agents, avec des échafaudages personnalisés couverts dans sa documentation pour les développeurs.

Une organisation évaluant le modèle de travail logiciel doit définir les commandes et les référentiels disponibles pour l’agent avant de mesurer le succès des tâches. Le matériel fourni décrit la formation aux nouvelles tentatives pour les appels d’outils ayant échoué. Ce comportement nécessite des contrôles sur les tentatives répétées, en particulier lorsqu’un outil peut modifier le code source ou appeler un système externe.

Les scores multimodaux favorisent Qwen dans la plupart des tests

Muse Glimmer accepte le texte et les images entrelacés via un encodeur de perception dédié. Meta affirme que cette conception permet aux agents d’interpréter des captures d’écran, des graphiques et des documents dans le cadre d’une conversation.

Le graphique de référence place Muse Glimmer en tête sur Charxiv Reasoning. Son score atteint 78,8, contre 77,7 pour Gemma4-31B et 78,4 pour Qwen3.6-27B.

Qwen3.6-27B a mené ScreenSpot Pro avec 76.1. Muse Glimmer a enregistré 75,4 et Gemma4-31B 75,9. Le même modèle a mené OmniDocBench v1.5 à 77,8, contre 75,8 de Muse Glimmer et 72,5 de Gemma4-31B.

MMMU Pro a produit des différences plus petites. Meta répertorie Muse Glimmer à 74. Qwen3.6-27B a atteint 75 et Gemma4-31B en a affiché 73.

Ces résultats sont importants pour les équipes qui envisagent des agents agissant sur des interfaces visuelles. Un modèle de lecture de capture d’écran peut interpréter ce qu’il voit, mais les tests locaux doivent toujours couvrir les autorisations, les dispositions d’affichage, les formats de documents et les erreurs renvoyées par les outils connectés.

Les chiffres de sécurité montrent un succès d’attaque inférieur à celui de Qwen

Meta rapporte également deux évaluations liées à la sécurité : CI Memories et Siren AgentDojo. Le graphique utilise différentes mesures pour chaque test.

Sur CI Memories, Meta indique un taux de violation de 26,4 pour Muse Glimmer et un score de couverture de 64,8. Gemma4-31B a enregistré un taux de violation de 12,1 avec une couverture de 53,0. Qwen3.6-27B a affiché un taux de violation de 53,4 et une couverture de 66,9.

Le résultat de Siren AgentDojo utilise le taux de réussite et l’utilité des attaques. Meta donne à Muse Glimmer un taux de réussite d’attaque de 28,4 et un score d’utilité de 94,2. Gemma4-31B a obtenu un taux de réussite d’attaque de 25,6, avec une utilité de 90,8. Qwen3.6-27B a enregistré 40,3 et 92,7.

Les résultats du raisonnement général ajoutent du contexte aux affirmations des agents

Muse Glimmer a dirigé quatre des six tests de capacités générales et de raisonnement dans la comparaison de Meta. Il a obtenu un score de 77,0 sur IFBench. Gemma4-31B a enregistré 76,0 et Qwen3.6-27B a atteint 70,8.

Le score AIME 2026 était de 94,7 pour Muse Glimmer. Meta rapporte 89,2 pour Gemma4-31B et 94,1 pour Qwen3.6-27B. Sur AA-LCR, Muse Glimmer atteint 80,0, devant 68,3 et 73,3.

Le modèle a également mené le Beam 128K à 65,1. Qwen3.6-27B a obtenu un score de 63,0. Gemma4-31B a enregistré 58,2.

Gemma4-31B a mené le GPQA Diamond avec 85,7. Muse Glimmer a obtenu un score de 83,5, suivi de Qwen3.6-27B à 84,2. Gemma4-31B a également obtenu la meilleure note au dernier examen de l’humanité, Text No Tools, avec 23,6 ; Muse Glimmer a atteint 22,0.

Un modèle ne réussit pas tous les tests. Les résultats de Meta montrent plutôt que Muse Glimmer est en étroite concurrence avec deux modèles de taille similaire sur un ensemble mixte d’évaluations d’agents, de codage, visuelles, de sécurité et de raisonnement.

Les limites de mémoire façonnent la conception du déploiement local

Meta affirme qu’un modèle de précision de 30 milliards de paramètres nécessiterait plus de 55 Go de mémoire. Muse Glimmer utilise à la place une quantification de poids d’environ 4 bits, réduisant le modèle de langage à moins de 20 Go.

Cette allocation laisse de la mémoire pour un cache KV. Le modèle a également besoin de place pour son encodeur de perception et un rédacteur de décodage spéculatif. Meta cible une enveloppe mémoire de 24 Go ou 32 Go pour ces composants.

La société affirme que le rédacteur basé sur DFlash propose des blocs de jetons pour le modèle principal à vérifier en parallèle. Meta affirme que cela accélère la génération par rapport à la sortie standard jeton par jeton et conserve une qualité de sortie identique. La publication fournie n’inclut pas les chiffres de jetons par seconde, les tailles d’invite, les données de puissance ou les résultats de concurrence.

Meta a testé sa version K-Quant-17 Go avec le rédacteur quantifié DFlash sur le matériel MacBook M4-Max, le matériel MacBook M5-Max et un RTX-5090. Il décrit l’expérience qui en résulte comme étant adaptée à une conversation fluide et à une interaction avec les agents en temps réel.

Les poids publics sont disponibles via Hugging Face. Meta indique que les intégrations avec llama.cpp, MLX et ExecuTorch arriveront dans les prochains jours.

Solène Vernet
Solène Vernet
Journaliste française passionnée par la science et les politiques d’innovation, j’écris pour rendre accessibles des sujets complexes. Mon parcours mêle recherche universitaire, communication scientifique et journalisme. J’aime explorer les liens entre technologie, société et transformation du monde.