Musk mise sur la puissance de calcul de l'IA à très grande échelle, xAI prévoit de déployer plus de 1,2 million de GPU NVIDIA

📅 2026-09-25

Résumé :

XAI, la société d'intelligence artificielle d'Elon Musk, étend encore l'échelle de son centre de données et prévoit de déployer plus de 1,2 million de GPU Nvidia AI au cours des prochaines années. Alors que le centre de données Colossus continue de se développer, xAI espère former et exécuter le modèle Grok de nouvelle génération via une infrastructure informatique à grande échelle, et lancer une concurrence plus intense en matière d'infrastructure d'IA avec des concurrents tels qu'OpenAI.

Le plus grand projet d'infrastructure d'IA actuel de xAI est le centre de données Colossus situé à Memphis, Tennessee, aux États-Unis. La construction du projet débute en 2024 et la première phase, Colossus 1, est déjà opérationnelle. Musk a déjà qualifié Colossus de « super usine de puissance de calcul » de xAI, dont l'objectif principal est de déployer de manière centralisée un grand nombre de GPU le plus rapidement possible.

Colossus utilisait initialement des GPU NVIDIA H100. L'échelle annoncée précédemment pour la première phase est d'environ 200 000 H100. Avec l'expansion ultérieure, le centre de données a commencé à ajouter des GPU de la série Blackwell plus avancés. Les dernières informations montrent qu'en plus du H100 d'origine, Colossus 1 déploie également environ 30 000 Nvidia GB200, de sorte que le nombre actuel de GPU dans Colossus 1 a atteint environ 230 000.

La deuxième phase de xAI, Colossus 2, est encore plus grande. Le projet est également situé à Memphis et prévoit de déployer plus de 500 000 GPU NVIDIA. Selon les plans actuels, Colossus 2 deviendra l'un des plus grands projets de centres de données d'IA au monde, et sa puissance de calcul dépassera de loin celle des superordinateurs traditionnels.

Si tous les projets de construction Colossus 1, Colossus 2 et ultérieurs sont inclus, le nombre de GPU NVIDIA que xAI prévoit d'utiliser à l'avenir atteindra environ 1,2 million ou plus. Ce nombre ne signifie pas que tous ces GPU ont été installés, mais correspond plutôt à l’ampleur globale des futurs projets d’expansion du centre de données de xAI.

L'augmentation radicale du nombre de GPU par xAI est directement liée à la croissance rapide de la demande de puissance de calcul pour la formation de modèles d'IA. L'échelle des paramètres, les données de formation et le processus d'apprentissage par renforcement des modèles de langage à grande échelle nécessitent de plus en plus de ressources informatiques, et la puissance de calcul requise pour la formation et l'inférence des modèles évolue de l'échelle des centres de données traditionnels à l'échelle des clusters de supercalcul.

Dans ce cas, disposer d'un grand nombre de GPU est devenu une base importante permettant aux entreprises d'IA d'étendre leurs capacités de modèles. Musk a souligné à plusieurs reprises que xAI devait étendre ses capacités informatiques le plus rapidement possible et réduire sa dépendance à l'égard des plates-formes de cloud computing tierces en créant ses propres clusters de calcul intensif.

La rapidité de construction de Colossus est également une caractéristique majeure de la stratégie d'infrastructure xAI. Le centre de données de première étape a été rénové sur la base d'une installation industrielle abandonnée, et xAI l'a étendu en un centre de formation en IA à grande échelle avec des centaines de milliers de GPU en peu de temps grâce à un grand nombre d'équipements préfabriqués, une construction parallèle et un déploiement rapide de GPU.

xAI continue également d'étendre les capacités de création de centres de données et d'alimentation électrique de Colossus. En raison de la consommation d’énergie extrêmement élevée des GPU IA modernes, l’expansion des centres de données ne consiste pas seulement à augmenter le nombre de serveurs. Ils doivent également construire simultanément une grande quantité d’infrastructures d’alimentation, de refroidissement, de réseau et de stockage.

xAI a déjà été confronté à des problèmes d'alimentation électrique. La consommation électrique du Colossus 1 atteint des centaines de mégawatts, et à mesure que le nombre de GPU augmente encore, ses besoins énergétiques augmenteront également considérablement. Afin de soutenir son expansion ultérieure, xAI a recherché de nouvelles sources d’énergie et a construit l’infrastructure de production et de distribution d’électricité correspondante.

À mesure que les GPU NVIDIA Blackwell et les séries Rubin suivantes entreront progressivement sur le marché, le centre de données de xAI continuera à subir des mises à niveau matérielles. Par rapport au H100, la nouvelle génération de GPU peut fournir des performances de calcul IA plus élevées, mais la consommation électrique d'un seul GPU augmente également. Par conséquent, les futurs grands centres de données d’IA doivent résoudre à la fois les problèmes de densité de calcul et d’approvisionnement en énergie.

Musk a également déclaré précédemment que xAI prévoyait d'augmenter considérablement la capacité électrique globale du centre de données vers 2027 et d'étendre la puissance de calcul à plusieurs fois son échelle précédente. Les plans pertinents montrent que la puissance totale des futurs centres de données de xAI pourrait atteindre plusieurs gigawatts, voire 10 gigawatts.

Une infrastructure aussi énorme signifie que xAI tente de construire une « super-usine » d'IA similaire à celle des grandes entreprises de cloud computing. Les serveurs GPU, les équipements réseau, les systèmes de stockage, les installations électriques et les systèmes de refroidissement liquide seront combinés dans un immense cluster informatique pour former et exécuter des modèles d'IA tels que Grok.

Cette stratégie rend également la concurrence entre xAI et OpenAI de plus en plus directe. OpenAI a également construit des centres de données IA à grande échelle ces dernières années et a établi un partenariat d'infrastructure à grande échelle avec NVIDIA. NVIDIA a annoncé son intention de fournir à OpenAI au moins 10 GW de systèmes d'IA, correspondant à des millions de GPU, et prévoit d'investir progressivement jusqu'à 100 milliards de dollars dans OpenAI avec le déploiement de l'infrastructure.

Le plan d'OpenAI signifie que l'industrie de l'IA entre dans une nouvelle étape avec des « centres de données de niveau gigawatt » comme unité concurrentielle de base. Dans le passé, la concurrence entre les entreprises d’IA se concentrait davantage sur les algorithmes, les talents et les données des modèles, mais aujourd’hui, l’infrastructure informatique elle-même est devenue un facteur important pour déterminer la vitesse et l’échelle de la formation des modèles.

xAI choisit de construire son propre centre de données Colossus à grande échelle, ce qui permet à l'entreprise de contrôler plus directement le déploiement des GPU, la structure du réseau, les logiciels du centre de données et l'infrastructure de formation. Pour les entreprises qui ont besoin de former en permanence des modèles à grande échelle, cette approche peut réduire la dépendance à l'égard des plateformes cloud externes tout en permettant aux équipes d'ingénierie d'optimiser le matériel et les logiciels pour leurs propres modèles.

Cependant, l'échelle de 1,2 million de GPU reste un objectif futur, et non le nombre actuellement déployé par xAI. La vitesse de construction du centre de données, l'alimentation en GPU, l'alimentation électrique, les installations de refroidissement, les équipements réseau et les investissements en capital affecteront tous la vitesse de déploiement finale. Par conséquent, le nombre réel de GPU en cours d’exécution et le temps d’exécution peuvent encore varier.

Peu importe si les chiffres finaux peuvent atteindre l'échelle actuellement prévue, le Colossus construit par xAI a montré que la compétition en matière d'infrastructures d'IA entre dans une nouvelle étape. À mesure qu'OpenAI, Google, Meta, Microsoft et d'autres sociétés d'IA construisent des centres de données de l'ordre du gigawatt, la concurrence entre les modèles d'IA à l'avenir évoluera largement vers une compétition entre l'échelle du centre de données, l'alimentation électrique et les capacités avancées d'acquisition de GPU.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire