Résumé :
Arm a officiellement lancé la plate-forme de sous-système informatique Neoverse CSS N4 «Ranger» de nouvelle génération pour renforcer encore sa présence sur les marchés des infrastructures de cloud computing et d'intelligence artificielle. En tant qu'élément important de la stratégie de puces semi-personnalisées d'Arm, Neoverse CSS N4 est construit sur la base du processus N3P de TSMC. Une seule puce peut intégrer jusqu'à 128 cœurs Neoverse N4, ce qui en fait l'un des sous-systèmes informatiques les plus flexibles et les plus grands de la famille Arm Neoverse.

Le nom complet de CSS dans Neoverse CSS est Compute Subsystem, qui est une solution semi-personnalisée lancée par Arm pour les grands fournisseurs de services cloud et les sociétés de conception de puces. Les clients peuvent configurer librement le nombre de cœurs, la capacité du cache, les systèmes de mémoire, les interfaces d'E/S et les structures d'interconnexion des puces sur le cadre IP de base fourni par Arm, créant ainsi rapidement des processeurs personnalisés répondant à leurs propres besoins. Au cours des dernières années, la plate-forme a été utilisée par Microsoft Azure, Google Cloud et d'autres sociétés pour le développement de processeurs de serveur, et a également été largement utilisée dans les produits d'unité de traitement de données (DPU) de Nvidia et d'Intel.
Selon les informations publiées par Arm, Neoverse CSS N4 prend en charge des configurations flexibles de 8 cœurs à 128 cœurs, avec une fréquence maximale allant jusqu'à 3,8 GHz. Bien qu'Arm n'ait pas divulgué les performances de fréquence spécifiques sous différentes tailles de cœur, on pense généralement qu'à mesure que le nombre de cœurs augmente, la fréquence de fonctionnement réelle peut être réduite en conséquence.
En termes de capacités d'extension du système, la plate-forme prend non seulement en charge une configuration monopuce à 128 cœurs, mais peut également étendre davantage l'échelle grâce à des solutions multicœurs et multi-emplacements. La plateforme prend en charge la norme d'interconnexion cœur à puce UCIe et permet aux partenaires d'utiliser une technologie d'interconnexion personnalisée pour construire des systèmes informatiques à plus grande échelle afin de répondre aux besoins des futurs centres de données et infrastructures d'intelligence artificielle à très grande échelle.

Les sous-systèmes de cache et de mémoire ont également été considérablement améliorés par rapport à la génération précédente. Une seule puce Neoverse CSS N4 prend en charge jusqu'à 256 Mo de cache de niveau 3, et chaque cœur peut être équipé jusqu'à 2 Mo de cache de niveau 2. Il dispose également d'un cache d'instructions de niveau 1 de 64 Ko intégré et d'un cache de données de niveau 1 de 64 Ko. En termes de mémoire, il prend non seulement en charge la DDR5, mais introduit également pour la première fois la prise en charge de LPDDR6 pour répondre aux exigences de consommation d'énergie et de bande passante de différents scénarios d'application.
Les capacités d'E/S ont également été considérablement améliorées. La nouvelle plate-forme prend en charge jusqu'à 128 voies PCIe 7.0 ou PCIe 6.0 et est compatible avec la norme CXL 4.0, offrant un plus grand espace d'extension pour les périphériques de stockage hautes performances, les accélérateurs d'IA et les interfaces réseau à haut débit.
Par rapport à la génération précédente Neoverse CSS N2, la nouvelle plate-forme a été presque entièrement mise à niveau. Le produit de la génération précédente prend en charge jusqu'à 64 cœurs, 1 Mo de cache L2 par cœur et 64 Mo de cache L3, et ne prend en charge que 64 voies PCIe 5.0 et CXL. En comparaison, Neoverse CSS N4 a réalisé des améliorations significatives en termes de nombre de cœurs, de taille de cache, de bande passante d'E/S et de prise en charge de la mémoire.
Arm a déclaré que dans la configuration de 128 cœurs, d'une fréquence de fonctionnement de 3 GHz et de 2 Mo de cache L2 par cœur, les performances d'un socket unique de Neoverse CSS N4 peuvent atteindre deux fois celles de la plate-forme Neoverse N3, avec des performances par watt augmentées d'environ 25 % et une bande passante mémoire augmentée d'environ 75 %. Ces améliorations visent principalement les besoins des centres de données à l'ère de l'intelligence artificielle, en particulier dans des scénarios tels que l'inférence à grande échelle, la gestion du cache KV, le traitement réseau et l'orchestration d'accélérateurs, qui peuvent fournir une densité de calcul et des capacités de débit plus élevées.
Arm a également souligné que le positionnement principal de la série Neoverse N est différent de celui de la série V. La série N vise principalement l'efficacité énergétique et le déploiement à haute densité, tandis que la série V recherche des performances ultimes. Actuellement, le processeur Grace de génération précédente de NVIDIA utilise le cœur Neoverse V2, et la série Graviton d'AWS et le projet Axion de Google Cloud utilisent également largement l'architecture Neoverse. En revanche, la série N est davantage utilisée pour les tâches de plan de contrôle, le traitement réseau et les scénarios informatiques sensibles à la consommation.

En plus de la sortie de Neoverse CSS N4, Arm a également annoncé les dernières avancées de son projet AGI CPU. Ce produit est construit sur l'architecture Neoverse V3 et a reçu le support de déploiement d'entreprises telles qu'Oracle, ByteDance, Meta, OpenAI, Cloudflare et SAP. Arm espère former une disposition à double route via le processeur AGI et Neoverse CSS N4. D'une part, il fournira aux clients une plate-forme de développement de puces hautement personnalisée et, d'autre part, il lancera une solution de processeur serveur de référence pour l'ère de l'intelligence artificielle.
Alors que l'IA générative et les applications d'agent continuent de stimuler les mises à niveau des centres de données, de plus en plus de fournisseurs de services cloud recherchent des puces personnalisées optimisées pour des charges de travail spécifiques. Le lancement par Arm de Neoverse CSS N4 est considéré comme une étape importante dans l’expansion de sa part de marché dans les centres de données. Avec une échelle maximale de 128 cœurs, la prise en charge de LPDDR6, la connectivité PCIe 7.0 et un processus de fabrication avancé de 3 nanomètres, la plate-forme devrait devenir l'une des infrastructures importantes pour l'infrastructure d'IA et les processeurs de cloud computing dans les prochaines années.
Commentaires