Les agents IA deviennent un nouveau canal de distribution de logiciels malveillants

Par Farukh Rakhimov, responsable de la conformité, de la protection des données et de la sécurité des informations chez AdTech Holding

Environ 7 600 faux référentiels GitHub, 6 600 profils frauduleux et plus de 14 millions de téléchargements : c’est l’ampleur de FakeGit, une campagne de malware documentée par Island en juillet 2026. Plus de 800 référentiels ont usurpé l’identité de compétences en IA et de serveurs MCP, distribuant SmartLoader et le voleur d’informations StealC.

Les faux référentiels ne sont pas nouveaux. La surprise était de savoir qui les avait recommandés.

Gemini et ChatGPT ont suggéré indépendamment le même référentiel malveillant walmart-mcp. Les agents ont trouvé le projet de l’attaquant et ont remis aux utilisateurs les instructions d’installation.

Les attaquants n’ont plus besoin de tromper directement les utilisateurs. Ils peuvent tromper les assistants auxquels les utilisateurs font confiance.

Pourquoi les agents sont vulnérables

Deux caractéristiques architecturales rendent ces attaques possibles.

Premièrement, les agents traitent les instructions et les informations externes sous forme de texte. Une instruction malveillante cachée dans un README, une page Web ou une description d’outil peut être interprétée comme quelque chose à obéir plutôt qu’à analyser. Il s’agit d’une injection rapide indirecte.

Deuxièmement, les agents peuvent agir selon ces instructions.

Le chercheur en sécurité Simon Willison appelle la combinaison de trois conditions le tiercé fatal : l’accès à des informations précieuses, l’exposition à du contenu externe non fiable et la possibilité d’envoyer des données en dehors du système.

Ensemble, ces conditions transforment un texte malveillant en une potentielle violation de données.

D’autres attaques exploitent quelque chose de plus simple : des signaux de confiance fabriqués. Les étoiles, les téléchargements, les historiques des contributeurs et les listes de registre peuvent donner l’impression que les logiciels malveillants semblent légitimes.

Voici huit façons dont ces faiblesses sont exploitées.

1. AgentBaiting : lorsqu’un agent recommande un logiciel malveillant

AgentBaiting cible l’assistant plutôt que l’utilisateur.

Dans la campagne FakeGit, les attaquants ont créé des référentiels convaincants avec une documentation réaliste et les ont distribués via des registres publics.

Gemini et ChatGPT ont recommandé indépendamment le même faux connecteur Walmart MCP car il semblait pertinent et crédible.

Les référentiels distribuaient SmartLoader, qui téléchargeait StealC pour voler les informations d’identification du navigateur, les cookies, les sessions actives et les données du portefeuille de crypto-monnaie.

Les agents n’ont pas été compromis. Ils ont simplement recommandé un logiciel dont la crédibilité apparente avait été fabriquée.

2. Empoisonnement des outils : instructions cachées dans les descriptions des outils

Les serveurs MCP fournissent aux agents des descriptions textuelles des outils disponibles. Les attaquants peuvent cacher des instructions dans ces descriptions.

En avril 2025, Invariant Labs a démontré comment les instructions intégrées dans un outil de calcul malveillant pouvaient manipuler un connecteur de messagerie distinct et fiable pour copier les messages sortants vers un attaquant.

L’utilisateur ne voit jamais les instructions malveillantes.

L’empoisonnement aux outils reste un modèle de menace démontré plutôt qu’un modèle de menace publiquement confirmé.

incident du monde réel.

3. Quand les agents cachent leurs actions

Certaines compétences malveillantes demandent explicitement aux agents de ne pas divulguer ce qu’ils ont fait.

Une étude universitaire de 2026 a examiné 98 380 compétences issues de deux registres et a confirmé que 157 d’entre elles étaient malveillantes, identifiant 632 vulnérabilités et 13 techniques d’attaque.

Une instruction récurrente a donné son titre à la recherche : « Ne pas en parler à l’utilisateur ».

Un agent pourrait ainsi signaler qu’une tâche a été accomplie tout en omettant les actions non autorisées, notamment la transmission d’informations sensibles.

4. Rug Pull : modifications logicielles fiables après l’installation

Un package peut se comporter légitimement pendant des mois avant d’introduire des fonctionnalités malveillantes.

En septembre 2025, Koi Security a découvert postmark-mcp, un connecteur usurpant l’identité du service de messagerie légitime Postmark.

Les versions jusqu’à 1.0.15 semblaient inoffensives. La version 1.0.16 a introduit un destinataire BCC caché qui copiait les e-mails sortants vers un domaine contrôlé par un attaquant.

Le package a potentiellement exposé des messages de réinitialisation de mot de passe et des liens d’authentification associés à environ 300 organisations.

Postmark a confirmé que le connecteur n’était pas son produit et que son propre service n’avait pas été compromis.

L’attaque a exploité la confiance accumulée par les versions antérieures. Les mises à jour automatiques ont permis à des fonctionnalités malveillantes d’arriver sans l’approbation renouvelée de l’utilisateur.

5. Des modifications malveillantes peuvent survenir en dehors du package

L’examen du code source ne peut pas tout détecter lorsque les dépendances externes changent indépendamment.

En août 2025, Check Point a divulgué MCPoison, une vulnérabilité dans Cursor qui permettait aux attaquants de modifier des configurations de projet précédemment approuvées et d’exécuter des commandes sans nouvelle approbation.

Le curseur 1.3 a résolu le problème.

Une autre expérience réalisée en 2026 a démontré comment une compétence distribuée à environ 26 000 agents pouvait initialement être liée à une documentation légitime avant que la page externe ne se transforme en instructions d’installation malveillantes.

Le package lui-même est resté inchangé, permettant à la menace d’échapper aux scanners qui examinent uniquement les fichiers soumis.

6. L’ouverture d’un référentiel non fiable peut exécuter du code

Les environnements de développement basés sur l’IA introduisent des risques avant même que les utilisateurs n’installent délibérément des logiciels supplémentaires.

Check Point a découvert que Claude Code pouvait exécuter des commandes de configuration contrôlées par le référentiel avant que les utilisateurs n’aient terminé son processus de confirmation de confiance.

Les vulnérabilités incluaient l’exécution de commandes arbitraires (CVE-2025-59536) et l’exposition des informations d’identification API via un point de terminaison de serveur manipulé (CVE-2026-21852).

Anthropic a ensuite corrigé les vulnérabilités signalées.

L’implication est simple : l’ouverture d’un projet inconnu dans un environnement de développement avec agent peut créer des chemins d’exécution que l’inspection de fichiers ordinaire ne créerait pas.

7. ClickFix : les utilisateurs installent eux-mêmes des logiciels malveillants

ClickFix ne nécessite aucune injection d’invite sophistiquée.

Les attaquants déguisent les commandes malveillantes en conditions préalables à l’installation dans les fichiers README ou SKILL.md. Les utilisateurs suivent les instructions et exécutent eux-mêmes les commandes.

Au cours de la campagne ClawHavoc début 2026, les chercheurs ont découvert des compétences malveillantes se faisant passer pour des outils de crypto-monnaie et de productivité dans l’écosystème OpenClaw.

Koi Security a identifié 341 compétences malveillantes parmi 2 857 disponibles lors de son audit.

Antiy CERT a ensuite suivi 1 184 compétences malveillantes associées à seulement 12 comptes.

Le malware ciblait les portefeuilles de crypto-monnaie, les informations d’identification du navigateur, les clés API, les clés SSH et les sessions Telegram.

8. Quand l’agent devient l’attaquant

Les agents peuvent également coordonner des opérations offensives.

En novembre 2025, Anthropic a signalé GTG-1002, une campagne de cyberespionnage dans laquelle des attaquants ont connecté des outils de test d’intrusion à Claude Code via MCP.

Selon Anthropic, le modèle effectuait de manière indépendante environ 80 à 90 % des opérations tactiques, tandis que les opérateurs humains établissaient des objectifs et prenaient des décisions stratégiques majeures.

Anthropic a attribué la campagne à un groupe parrainé par l’État. Cette évaluation n’a pas été confirmée de manière indépendante dans les référentiels publics de renseignements sur les menaces.

Le cas illustre comment les outils offensifs existants peuvent être assemblés en flux de travail autonomes.

L’économie de la fausse réputation

De nombreuses attaques dépendent d’une crédibilité artificiellement fabriquée.

Une enquête menée en avril 2026 a révélé que les stars de GitHub étaient annoncées entre 0,03 et 0,10 USD chacune. Les chercheurs ont également identifié environ six millions d’étoiles suspectes dans 15 835 référentiels.

Dans un autre cas, les attaquants ont cloné un connecteur Oura MCP et ont passé trois mois à créer de faux historiques de contributions avant de distribuer la version malveillante via des registres légitimes.

Une extension Solidity malveillante distincte a affiché un nombre de téléchargements artificiellement gonflé, approchant finalement les deux millions. Un développeur de blockchain aurait perdu environ 500 000 dollars.

La popularité détermine la visibilité, pas la sécurité.

Les revues de code et les scanners ont également des limites : des fonctionnalités malveillantes peuvent se cacher dans les dépendances, les descriptions d’outils, les mises à jour ultérieures ou les pages Web externes.

Ce que cela signifie pour l’AdTech

L’écosystème open source a déjà été confronté à des menaces similaires concernant la chaîne d’approvisionnement. L’authentification obligatoire à deux facteurs, la publication fiable et la provenance vérifiée des packages ont finalement renforcé les registres établis.

Les marchés de compétences en IA se développent beaucoup plus rapidement, tandis que leur infrastructure de sécurité reste relativement immature.

Les conséquences sont également plus larges : une compétence en IA peut fonctionner avec un accès aux e-mails, aux référentiels, aux bases de données et aux informations d’identification.

Pour l’AdTech, le même risque s’étend directement aux comptes publicitaires.

Les acheteurs de médias et les équipes AdOps connectent de plus en plus les agents, les assistants de reporting et les outils de campagne aux DSP, aux plateformes publicitaires et aux données des annonceurs.

Une compétence de reporting ou de génération de création empoisonnée pourrait exposer des informations sur la campagne, compromettre les informations d’identification du compte ou mettre en danger les budgets publicitaires.

La tromperie sous-jacente est familière : acheter de fausses étoiles et de faux téléchargements pour donner l’impression que des logiciels malveillants semblent dignes de confiance suit la même logique que l’utilisation de faux engagements et de trafic de robots pour donner l’impression qu’un inventaire publicitaire frauduleux est légitime.

À mesure que les agents IA gagnent en autorité, la vérification des logiciels et des signaux auxquels ils font confiance devient aussi importante que la sécurisation des systèmes qu’ils exploitent.

Solène Vernet
Solène Vernet
Journaliste française passionnée par la science et les politiques d’innovation, j’écris pour rendre accessibles des sujets complexes. Mon parcours mêle recherche universitaire, communication scientifique et journalisme. J’aime explorer les liens entre technologie, société et transformation du monde.