Résumé :
Selon l'analyste de la chaîne d'approvisionnement Ming-Chi Kuo, le projet d'accélérateur d'IA « Rubin CPX » de NVIDIA, précédemment mis de côté, a maintenant été relancé et l'architecture de la mémoire a été repensée. This product was originally planned to be equipped with 128GB GDDR7 video memory, but now it is equipped with 168GB HBM4 high-bandwidth memory.

Nvidia a annoncé à la fin de l'année dernière son intention de développer un accélérateur dédié basé sur la famille de GPU Rubin, principalement pour les charges de travail d'intelligence artificielle d'agents à grande échelle. Après l'annonce du projet, il a été signalé qu'il avait été temporairement suspendu, mais Nvidia semble avoir terminé la replanification. Rubin CPX sera déployé dans des racks indépendants, chaque rack pouvant être configuré avec 64 à 256 GPU CPX indépendants.
Différent des GPU Rubin conventionnels responsables des tâches de décodage, les GPU CPX sont principalement utilisés pour l'étape de « pré-remplissage » dans le processus d'inférence de grands modèles de langage et sont responsables du traitement du contexte d'entrée et du cache KV. NVIDIA essaie de séparer les tâches de pré-remplissage et de décodage, le GPU CPX s'occupant du travail de pré-remplissage, puis le GPU Rubin standard s'occupant du décodage, améliorant ainsi l'efficacité globale de l'inférence.
Un plateau rack équipé de 8 GPU CPX peut gérer jusqu'à 1,34 To de données de pré-remplissage de contexte long et le cache KV associé, le tout s'appuyant sur la mémoire HBM4. HBM4 peut fournir une bande passante mémoire plus élevée, contribuant ainsi à accélérer le traitement des données contextuelles longues. Étant donné que la conception précédente ne nécessitait pas de HBM4 intégré, Nvidia doit également repenser le boîtier de la puce et devrait utiliser la technologie de boîtier avancée CoWoS-S ou CoWoS-L de TSMC.
En termes de performances informatiques, Rubin CPX adopte une conception de puce monolithique et peut fournir 30 gigaflops de performances informatiques NVFP4, ou 30 PFLOPS. La puce intègre également 4 moteurs d'encodage vidéo NVENC et 4 moteurs de décodage vidéo NVDEC, lui permettant d'effectuer des charges de travail multimédia plus efficaces sans recourir à des processeurs externes.
À mesure que l'échelle des paramètres des grands modèles de langage approche les milliards, le transfert des tâches de pré-remplissage et des tâches de décodage vers différents racks devrait augmenter considérablement la vitesse de génération et de livraison des jetons. Nvidia recommande également de maintenir un ratio de 1:1 entre les GPU CPX et les GPU Rubin classiques dans le rack de décodage.
Commentaires