Palantir Foundry et cuOpt pilotent l’allocation de la chaîne d’approvisionnement de NVIDIA

NVIDIA utilise Palantir Foundry et cuOpt pour automatiser ses décisions d’allocation de la chaîne d’approvisionnement matérielle sur les sites de fabrication mondiaux.

La société mesure la livraison opérationnelle depuis la sortie de la tranche jusqu’au premier jeton. Cette fenêtre se divise en temps de mise en rack (le transit de la sortie de fabrication à un système de centre de données assemblé) et en temps de jeton (qui couvre l’alimentation, le refroidissement, la mise en réseau et la préparation logicielle dès le premier jour).

Gestion des flux de composants NVL72 et Vera Rubin

La mise à l’échelle du matériel a amplifié les contraintes d’approvisionnement. Un rack NVIDIA Grace Blackwell NVL72 contient 18 plateaux de calcul, chaque plateau nécessitant deux processeurs Grace, quatre GPU Blackwell et 32 ​​packages de mémoire HBM3e provenant de milliers de fournisseurs, OEM et partenaires de conception sous contrat.

La prochaine chaîne d’approvisionnement construite pour l’architecture Vera Rubin de NVIDIA est deux fois plus grande que le réseau prenant en charge Grace Blackwell.

L’assemblage ne peut pas avoir lieu tant que les pièces n’arrivent pas depuis trois canaux désignés : inventaire direct, stock de consignation et fournisseurs externes. Les premières expéditions doivent attendre les composants retardés, ce qui prolonge les termes métriques NVIDIA « Durée de possession » (la durée entre le moment où une installation reçoit les matériaux et le départ des sous-assemblages finis.)

Les allocations d’usine sont retravaillées chaque semaine sur des horizons glissants de deux trimestres pour résoudre la disponibilité des pièces, les limites de débit et les calendriers de traitement des clients.

Programmation linéaire en nombres entiers mixtes via cuOpt

Pour coordonner ces dépendances, l’équipe opérationnelle de NVIDIA a construit le centre de commande « Digital Supply Chain Intelligence » à l’aide de Palantir Foundry. L’ontologie de Foundry modélise les installations, les engagements des fournisseurs, les stocks de composants et les objectifs de production sous forme d’objets et de liens interconnectés.

NVIDIA cuOpt, une bibliothèque open source pour l’optimisation des décisions accélérées par GPU, lit directement cette couche opérationnelle. En formulant la distribution sous la forme d’un programme linéaire à nombres entiers mixtes conçu pour minimiser TOO, le solveur évalue les contraintes des pièces à chaque niveau de la nomenclature.

Au-delà de la publication des calendriers de livraison hebdomadaires, cuOpt identifie les limites actives de l’usine, telles que les plafonds de capacité d’assemblage régionaux par rapport à la disponibilité de la mémoire brute.

Formation de Nemotron sur les dossiers opérationnels qualitatifs

L’optimisation mathématique à elle seule n’a pas réussi à capturer les variables opérationnelles non structurées observées par les planificateurs humains, notamment les transcriptions d’appels des fournisseurs, les prévisions météorologiques régionales, les échanges de courriers électroniques avec les partenaires et les événements géopolitiques.

NVIDIA a résolu ce problème en post-entraînement Nemotron 3.5 Lightning, un modèle mélange d’experts à poids ouvert comportant 30 milliards de paramètres au total et environ trois milliards de paramètres actifs par passage avant.

Le pipeline d’ingénierie traite les enregistrements historiques via NeMo Anonymizer pour expurger les champs opérationnels sensibles, NeMo Data Designer pour équilibrer les exemples de formation avec des scénarios de perturbation de capacité synthétique, et NeMo AutoModel pour appliquer les paramètres d’adaptation de bas rang (LoRA) tout en gardant les poids du modèle de base gelés. Palantir Autopilot gère le traçage des données, le suivi des modèles et la fourniture de recommandations.

Benchmarks de production et apprentissage par renforcement futur

Évalué sur la base des enregistrements d’allocation historiques, le modèle Nemotron 3.5 Lightning post-entraîné a atteint une précision de décision de 86,7 %, contre 55,5 % pour le plus grand modèle Nemotron 3 Ultra et 17,5 % pour le modèle de base Lightning non réglé.

Le modèle post-entraîné a atteint une précision équilibrée de 58,6 pour cent et un score macro-F1 de 57,5 ​​pour cent, surpassant la précision équilibrée de 42 pour cent et le score macro-F1 de 39,5 pour cent du Nemotron 3 Ultra.

Réglage fin effectué sur deux GPU NVIDIA B200 en quelques minutes. Le réglage fin des domaines a amélioré les décisions d’allocation, même si la prévision des risques de production à plus long terme est restée difficile.

Les choix opérationnels, les révisions du planificateur, les remplacements et les résultats d’usine observés sont continuellement réécrits dans l’ontologie Palantir.

NVIDIA a confirmé que cet ensemble de données formerait des paires de préférences pour les routines d’apprentissage par renforcement – ​​notant les recommandations sur la précision de l’allocation, la conformité aux politiques et la base des preuves – les modèles de production restant strictement isolés du recyclage en direct et non surveillé.

Bannière pour la série d'événements AI & Big Data Expo.
Solène Vernet
Solène Vernet
Journaliste française passionnée par la science et les politiques d’innovation, j’écris pour rendre accessibles des sujets complexes. Mon parcours mêle recherche universitaire, communication scientifique et journalisme. J’aime explorer les liens entre technologie, société et transformation du monde.