Alibaba a lancé Qwen3.8-Max, son plus grand modèle d’IA à ce jour, alors que le dernier modèle V4-Flash de DeepSeek attire l’attention sur un prix d’inférence inférieur à celui de plusieurs systèmes concurrents.
Qwen3.8-Max possède 2,4 billions de paramètres et utilise une architecture mixte d’experts, qui n’active qu’une partie du modèle pour chaque requête. Alibaba a déclaré qu’environ 95 milliards de paramètres sont actifs à la fois, ce qui réduit les coûts et les délais de réponse par rapport à l’activation du modèle complet.
DeepSeek utilise une architecture clairsemée similaire à une plus petite échelle. L’analyse artificielle répertorie le V4-Flash avec 284 milliards de paramètres au total, dont 13 milliards actifs pendant l’inférence, tandis que le Kimi K3 de Moonshot AI compte 2,8 billions de paramètres au total et environ 104 milliards d’actifs.
Qwen3.8-Max peut traiter du texte, des images et des vidéos et prend en charge jusqu’à un million de jetons de contexte. Alibaba a également déclaré que le modèle avait réalisé un projet d’ingénierie logicielle sur 16 jours.
Sa taille le rapproche du Kimi K3, sorti en juillet par Moonshot AI. Les deux sociétés sont également en concurrence sur les prix, Qwen3.8-Max coûtant 2 dollars par million de jetons d’entrée et 6 dollars par million de jetons de sortie, contre 3 dollars et 15 dollars, respectivement, pour Kimi K3.
La taille du modèle à elle seule ne détermine pas le coût d’inférence. L’architecture, le nombre de paramètres actifs, la consommation de jetons et le nombre d’appels requis pour terminer une tâche affectent également le coût d’exécution d’un modèle.
Qwen3.8-Max s’est hissé à la première place parmi les modèles de texte chinois sur la plateforme de comparaison participative Arena.AI après sa sortie, bien qu’il soit resté derrière plusieurs modèles Anthropic dans le classement général. Il s’est également classé deuxième dans le classement d’Arena.AI pour les modèles analysant des images et d’autres éléments visuels, derrière une variante Anthropic Claude Fable 5.
DeepSeek fait baisser les prix d’inférence
DeepSeek a adopté une approche différente avec V4-Flash. Plutôt que d’égaler l’échelle globale des derniers modèles d’Alibaba et de Moonshot AI, le prix du modèle a été inférieur à celui de plusieurs systèmes d’IA largement utilisés.
V4-Flash coûte 0,14 $ par million de jetons d’entrée et 0,28 $ par million de jetons de sortie, selon Artificial Analysis. La société de recherche répertorie le modèle avec une fenêtre contextuelle d’un million de jetons et 284 milliards de paramètres au total, dont 13 milliards sont actifs pendant l’inférence.
Artificial Analysis indique un prix d’accès au cache de 0,003 $ par million de jetons pour la version Max Effort de V4-Flash, 98 % en dessous de son taux d’entrée standard. L’entrée mise en cache couvre le contexte précédemment traité qui peut être réutilisé dans les requêtes ultérieures.
Les taux de jetons inférieurs de DeepSeek ont également été appliqués aux tests de référence d’Artificial Analysis. Reuters a rapporté que la société de recherche estimait le coût moyen du V4-Flash à trois cents par test, contre 86 cents pour Kimi K3, 1,86 $ pour le GPT-5.6 Sol d’OpenAI et 3,15 $ pour Claude Fable 5 d’Anthropic.
La comparaison prend en compte la quantité d’entrées et de sorties que chaque modèle utilise pour compléter le benchmark. Un taux par jeton inférieur n’entraîne pas nécessairement un coût de tâche inférieur si un modèle génère plus de résultats ou nécessite des interactions supplémentaires.
L’analyse artificielle a attribué à la version de raisonnement Max Effort de DeepSeek V4-Flash un score de 40 sur son indice d’intelligence. La société de recherche a également enregistré un taux de sortie d’environ 118 jetons par seconde lors des tests.
Les prix des jetons ne racontent qu’une partie de l’histoire des coûts
Kimi K3 de Moonshot AI fournit un autre exemple de la façon dont les prix annoncés des API peuvent différer du coût de réalisation de charges de travail plus longues. L’analyse artificielle répertorie le modèle à 3 $ par million de jetons d’entrée et à 15 $ par million de jetons de sortie, avec une entrée en cache au prix de 0,30 $ par million de jetons.
Sur le benchmark AA-Briefcase d’Artificial Analysis pour le travail de connaissances agentiques, Kimi K3 gagnait en moyenne 10,57 $ par tâche. Il a généré environ 120 000 jetons de sortie et utilisé en moyenne 83 tours par tâche.
Artificial Analysis a déclaré que le coût reflétait le prix des jetons de Kimi K3, le volume de production et le nombre d’interactions de modèle. Des appels de modèle répétés et des résultats plus importants peuvent donc augmenter le coût total de réalisation d’une charge de travail au-delà de ce que suggère le taux global de l’API.
Kimi K3 a enregistré le deuxième score global le plus élevé à l’évaluation AA-Briefcase au moment du test, derrière Claude Fable 5. Il a également obtenu un score de 57 sur l’indice d’intelligence plus large de l’analyse artificielle.
La comparaison avec DeepSeek montre pourquoi les mesures du coût par tâche ajoutent un contexte utile à la tarification standard des API. Les modèles avec des architectures et des modèles d’utilisation différents peuvent consommer des quantités de calcul et de jetons sensiblement différentes tout en exécutant le même type de tâche.
Les poids ouverts ajoutent une autre option de déploiement
Le coût dépend également de la manière dont les développeurs chinois distribuent leurs modèles. Alibaba, DeepSeek et Moonshot AI ont continué à prendre en charge les versions ouvertes parallèlement à l’accès aux API hébergées, offrant ainsi aux développeurs plus d’options sur la manière dont les modèles sont déployés.
Artificial Analysis répertorie DeepSeek V4-Flash comme modèle à poids ouvert sous licence MIT, avec des poids disponibles via Hugging Face. Kimi K3 est également disponible en modèle à poids ouvert sous la propre licence de Moonshot AI.
Les pondérations ouvertes permettent aux développeurs d’exécuter des modèles sur leur propre infrastructure ou via des fournisseurs tiers au lieu de s’appuyer uniquement sur un service d’inférence hébergé par le développeur. Les coûts de déploiement dépendent toujours du matériel et de l’infrastructure utilisés, mais l’accès au modèle n’est pas lié à une seule API hébergée.
L’approche diffère des principaux modèles proposés par OpenAI, Anthropic et Google, qui gardent généralement leurs pondérations de modèle fermées.
Lian Jye Su, analyste en chef chez Omdia, a déclaré que la sélection de modèles pour de nombreuses charges de travail d’entreprise ne dépend pas uniquement de l’accès au système le plus performant.
« De nombreux flux de travail d’entreprise n’ont pas besoin du meilleur modèle du secteur », a déclaré Su. «Ils ont besoin de modèles suffisamment performants, abordables, transparents et accessibles, et les modèles ouverts aident à répondre à cette demande.»
(Photo de Solén Feyissa)