Résumé :
Intel a récemment annoncé plus de détails techniques sur sa plate-forme de processeur pour serveur Xeon 7 de nouvelle génération, Diamond Rapids (nom de code DMR), lors de la conférence Hot Chips. La plate-forme devait initialement être lancée en 2026, avec une configuration maximale de 192 cœurs et 16 canaux de mémoire, mais il a été confirmé qu'elle serait reportée à 2027. Dans le même temps, Intel a encore augmenté le nombre de cœurs de son modèle phare à 256 cœurs de performance, comparant directement la série EPYC Venice de sixième génération d'AMD, qui dispose également d'un maximum de 256 cœurs.

Différent des produits précédents ciblant le marché plus large des serveurs, Diamond Rapids se concentrera sur le calcul haute performance. Cette plate-forme annule complètement la technologie hyper-threading, souvent appelée multi-threading simultané (SMT) dans l'industrie, et ne fournit que des versions AP haut de gamme pour le marché haut de gamme. Le produit Diamond Rapids-SP à 8 canaux initialement prévu a été annulé. Par conséquent, DMR ne couvrira pas tous les niveaux de la gamme de produits AMD, mais se concentrera sur la concurrence pour le premier marché HPC.
Les produits Coral Rapids ultérieurs d'Intel devraient réintroduire la technologie hyper-threading et pourraient apporter une nouvelle génération de processeurs de la série SP. Cependant, en termes de complexité architecturale, Diamond Rapids reste à ce jour l'un des processeurs Intel Xeon les plus sophistiqués. Dans une certaine mesure, son idée de conception rappelle la voie des chipsets modulaires introduite par AMD avec EPYC Rome en 2019 : diviser les fonctions informatiques, d'E/S et de mémoire, puis les combiner de manière flexible en fonction des différents besoins du produit. Après avoir exploré plusieurs générations de produits, Intel semble avoir enfin trouvé une méthode d'intégration multicœur qui lui convient mieux.
Un seul processeur Diamond Rapids peut être composé jusqu'à 22 cœurs et peut être augmenté ou diminué en fonction des besoins en puissance de calcul, en capacité de cache et en configuration de la mémoire. Ces cœurs sont principalement divisés en trois catégories : jusqu'à 16 cœurs de calcul fabriqués à l'aide du processus Intel 18A-P, 4 cœurs de base de blocs de construction informatiques fabriqués à l'aide du processus Intel 3-T et 2 cœurs Fabric Hub évolutifs basés sur le processus Intel 3, qui sont responsables de la connexion de différentes parties du système.

Parmi eux, 18A-P est une version améliorée du processus 18A d'Intel et appartient à la technologie de processus de niveau 2 nm. Intel affirme qu'avec les mêmes performances, ce processus peut réduire la consommation d'énergie de 18 % ; avec la même consommation d'énergie, il peut entraîner une amélioration des performances allant jusqu'à 9 %. En plus des gains de processus, Diamond Rapids adoptera également une nouvelle microarchitecture de base de performances, de sorte que les performances réelles seront également affectées par les améliorations de base de l'IPC.
Chaque cœur de calcul intègre jusqu'à 16 cœurs et leur cache L2 correspondant. Jusqu'à quatre de ces cœurs de calcul seront empilés au-dessus d'un cœur de base de bloc de calcul utilisant la technologie de liaison hybride directe 3D de Foveros. La puce de base intègre un cache L3 : chaque bloc de calcul fournit 320 Mo de cache L3, et le modèle supérieur Diamond Rapids a une capacité totale de cache L3 allant jusqu'à 1,28 Go.

Intel n'utilise pas de ponts d'interconnexion multicœurs intégrés EMIB pour connecter les modules informatiques aux modules d'E/S et de mémoire. Au lieu de cela, il adopte une solution d'interconnexion de packaging plus proche du style UCIe-S, qui transmet les données via un substrat de packaging organique au lieu d'un pont en silicium. Intel appelle cette nouvelle architecture de puce une « architecture d'interconnexion à sortance ».
Deux puces Fabric Hub évolutives intègrent le contrôleur de mémoire et l'interface E/S. Leur concept de conception est similaire à celui de la matrice d'E/S des dernières générations de processeurs de serveur EPYC d'AMD. En reproduisant de telles puces, Intel peut étendre les canaux de mémoire et les capacités d'interconnexion. Deux Fabric Hubs peuvent fournir un total de 16 canaux de mémoire DDR5. Le taux de mémoire DDR5 standard peut atteindre jusqu'à 8 000 MT/s, et lors de l'utilisation de MRDIMM, il peut atteindre 12 800 MT/s.
En termes de connectivité étendue, Diamond Rapids prend en charge jusqu'à 128 voies PCIe 6.0, CXL 3 ou UPI 3, en plus de 8 voies PCIe 4.0, qui peuvent être utilisées pour les périphériques d'E/S auxiliaires tels que les contrôleurs de réseau embarqués, USB ou de gestion de carte mère.

Cette conception reflète également les ajustements apportés par Intel aux méthodes d'accès à la mémoire. Les précédents Granite Rapids-AP se présentaient par défaut comme trois nœuds d'accès mémoire non uniforme (NUMA), tandis que Xeon 7 Diamond Rapids espère offrir une architecture d'accès mémoire unifié (UMA). Grâce à la nouvelle méthode d'interconnexion du packaging, le bloc de construction informatique peut communiquer directement avec deux Fabric Hubs, évitant ainsi le problème de l'accès à différents modules d'E/S via des sauts supplémentaires. Intel estime que cette conception peut non seulement aider à réaliser l'UMA, mais également à contrôler le coût du packaging avancé.
Cependant, de nombreux paramètres clés de la plateforme DMR n'ont pas encore été annoncés. Intel n'a pas indiqué la fréquence maximale du cœur, ni divulgué l'amélioration IPC du nouveau cœur en termes de performances par rapport à Granite Rapids. Les détails spécifiques sur le niveau de cache sont également limités, et on ne peut que confirmer que sa capacité de cache L3 sera considérable.
En termes de jeu d'instructions, Diamond Rapids prendra en charge les instructions d'extension de matrice AMX mises à jour et ajoutera la prise en charge de FP8 pour améliorer l'efficacité du processeur lors de l'exécution de tâches d'apprentissage automatique. Le processeur sera également l'un des premiers produits à prendre entièrement en charge AVX 10.2. AVX 10.2 vise à améliorer certaines limitations de la première implémentation AVX-512 d'Intel et revêt une grande importance pour les applications de calcul et de supercalcul hautes performances.
Même si UMA devrait devenir la configuration par défaut, la prise en charge de NUMA reste essentielle pour les charges de travail HPC qui nécessitent de diviser un grand nombre de cœurs en domaines de ressources plus petits. Intel n'a pas encore détaillé comment DMR implémentera le partitionnement NUMA, mais d'un point de vue architectural, le processeur peut théoriquement être divisé en deux, quatre, voire plus, clusters sous-NUMA. L'ouverture ou non de cette fonctionnalité peut dépendre principalement des paramètres du BIOS.

La stratification des produits est un autre problème non résolu. On sait actuellement qu'Intel lancera des versions à 256 et 192 cœurs, mais il n'est pas clair dans quelle mesure le nombre de cœurs sera réduit. En théorie, Intel peut adapter le produit à une version avec un seul bloc de calcul et un cœur de calcul à 16 cœurs ; mais un jugement plus réaliste est que la configuration minimale de Diamond Rapids peut se situer entre 64 et 128 cœurs.
À en juger par les spécifications publiées, le Diamond Rapids devrait devenir la génération Intel de Xeon haut de gamme la plus compétitive de ces dernières années. Le Venice EPYC d'AMD et le DMR d'Intel fourniront tous deux jusqu'à 256 cœurs, 16 canaux de mémoire, plus de 1 Go de cache L3 et des capacités d'interconnexion similaires ; la consommation électrique thermique des produits phares des deux parties devrait également être d'environ 600 W.
Le défaut évident d'Intel est qu'il ne dispose pas de technologie hyper-threading. Dans certaines charges de travail qui dépendent fortement du nombre de threads, AMD peut toujours obtenir un avantage de performances à deux chiffres avec SMT, même si les performances de base des deux parties sont similaires. Mais dans le monde du HPC, l'hyper-threading n'apporte pas toujours des avantages. Par exemple, le benchmark HPL, utilisé pour classer les supercalculateurs mondiaux, ne bénéficie généralement pas nécessairement de l’hyper-threading. Arm a même déjà déclaré que le multithreading synchronisé pouvait faire plus de mal que de bien dans certains scénarios.
Cela donne également à Diamond Rapids la possibilité d'être positionné par Intel comme un processeur sandbox pour agent d'IA à faible latence, tel qu'un environnement d'exécution de code Python qui héberge la génération d'IA, ou un conteneur d'isolation pour compiler et exécuter du code C et Rust. Mais même ainsi, il y a une forte probabilité que le DMR ne devienne pas le produit à gros volume d'Intel, en particulier dans le contexte de la promotion par Nvidia du processeur Vera auto-développé en tant que processeur côté hôte préféré pour les systèmes d'IA.
En fin de compte, la performance du marché de Diamond Rapids dépendra toujours du prix et du rapport qualité-prix. Lorsque AMD a lancé EPYC Rome, il n'était peut-être pas en mesure de surpasser Intel en termes de performances monocœur, mais il offrait un coût unitaire plus attractif avec son nombre de cœurs plus élevé, ses E/S plus riches et ses capacités d'extension de mémoire plus importantes. Si Intel peut fournir plus de cœurs à un prix inférieur, le Xeon 7 pourrait encore être compétitif pour certains clients, même si AMD offre de meilleures performances absolues.
Commentaires