Les processeurs graphiques Blackwell GB300 et GB200 de NVIDIA continuent de démontrer des performances de pointe dans diverses charges de travail d'intelligence artificielle grâce à une optimisation technique continue. Alors que la nouvelle génération de plates-formes d'IA continue d'être déployée dans le monde entier, le monde extérieur a peut-être spéculé que NVIDIA se concentrerait sur l'architecture Rubin. Cependant, il s'avère que la série Blackwell, qui a été mise en œuvre dans d'innombrables centres de données, comme l'architecture Hopper de l'année, continue de libérer un potentiel incroyable grâce à des mises à niveau logicielles continues. Parmi eux, le GB300 continue d’établir de nouveaux sommets de performances dans les tâches informatiques d’intelligence artificielle.

Selon les données officielles publiées par NVIDIA, l'optimisation continue de la plate-forme Blackwell a considérablement amélioré les performances globales et le rapport d'efficacité énergétique. En seulement 3 mois, NVIDIA a multiplié par 4 le débit par mégawatt sur la même configuration GB200 NVL72 exécutant des charges de travail DeepSeek R1 0528 - 1K/1K. Pendant cette période, la société a ajouté 38 optimisations majeures à la plate-forme Blackwell en exécutant plus de 250 000 configurations de simulation et en consommant un total de 1,4 million d'heures de test GPU. Il convient de mentionner que plus de 90 % des résultats d'optimisation peuvent être appliqués à d'autres modèles d'intelligence artificielle, ce qui démontre pleinement l'engagement de NVIDIA à maintenir des investissements importants dans les plates-formes d'IA existantes à mesure que de nouvelles plates-formes deviennent progressivement plus populaires.

D'autre part, la plateforme GB300 « Blackwell Ultra » de NVIDIA continue de dominer le domaine de la formation en intelligence artificielle. Lors de l'utilisation de 256 GPU pour exécuter le modèle DeepSeek-V3 671B, son cœur Megatron Core a établi un record étonnant de 1 648 Terops par GPU, réalisant un bond de performances 3x par rapport au GB200 606 Terops. L'utilisation du GB300 NVL72 pour pré-entraîner DeepSeek-V3 671B peut atteindre une efficacité opérationnelle record mondiale de 1 648 Terops par GPU, permettant à la même tâche de formation d'atteindre une performance donnée avec seulement une fraction de l'échelle matérielle. Dans le même temps, les performances du même système GB300 NVL72 ont également augmenté jusqu'à 1,5 fois au cours des 6 derniers mois après une optimisation continue.

En outre, NVIDIA a également lancé une coopération approfondie avec PyTorch et la communauté open source JAX pour promouvoir la mise en œuvre complète de divers résultats d'optimisation dans sa matrice de produits d'intelligence artificielle. Lors de l'exécution du modèle DeepSeek-V3 671B à l'aide de la pile de formation native TorchTitan de PyTorch, le rack Blackwell Ultra a obtenu une amélioration des performances jusqu'à 6 fois sans aucune optimisation initiale. Le framework JAX a connu une croissance encore plus significative. Sa vitesse a grimpé jusqu'à 1 025 Terops par GPU, et le débit d'un seul GPU peut atteindre jusqu'à 4 082 jetons par seconde. Par rapport à la référence de janvier de cette année, ses performances ont été multipliées par 10.

2026-07-22_7-21-04-1.jpg2026-07-22_7-20-55.jpg2026-07-22_7-20-47.jpg2026-07-22_7-20-37.jpgimage-57.webp

De plus, NVIDIA a également atteint des performances de mise à l'échelle de classe mondiale, passant de 256 à 1 024 GPU dans tous les frameworks courants de pré-formation. En atteignant l'échelle de 1 024 GPU, Megatron Core peut maintenir une efficacité d'expansion allant jusqu'à 98,5 %, tandis que l'efficacité d'expansion de TorchTitan et du framework JAX maintient également un niveau de 97 %. Le composant principal qui prend en charge ces excellentes performances d'extension est la puce réseau évolutive NVIDIA 800 Gb/s intégrée à l'intérieur de chaque rack NVL72. De la formation de modèles au déploiement d'inférences, NVIDIA établit constamment de nouvelles références dans le domaine de l'intelligence artificielle. Avec la plateforme Rubin déjà sur le marché et apportant des gains de performances plus importants, les autres concurrents sont sans aucun doute confrontés à une pression considérable pour rattraper leur retard.