Résumé :
Affectée par la pénurie continue de DRAM, l'industrie de l'IA passe d'une « puissance de calcul limitée » à une « mémoire limitée ». Selon les rapports, Google a commencé à démanteler les serveurs mis hors service, à recycler les modules de mémoire DDR4 qui peuvent encore être utilisés et à les réutiliser dans certains serveurs IA nouvellement construits, établissant progressivement une chaîne d'approvisionnement interne de recyclage de la mémoire.

Nikhil Cherian, directeur principal de l'infrastructure de la chaîne d'approvisionnement chez Google, a récemment révélé lors d'un forum au sommet que la mémoire haute performance représente actuellement environ 75 % du coût de la nomenclature d'un serveur d'IA. Afin de briser le goulot d'étranglement de la mémoire, Google promeut des solutions logicielles et matérielles, notamment le démantèlement des serveurs mis hors service et le recyclage des composants utilisables.
Google a même conçu des adaptateurs matériels spécialement conçus pour permettre aux générations précédentes de solutions de mémoire, telles que la DDR4, d'être connectées aux serveurs IA de nouvelle génération. Cherian a également admis que Google rapatrierait spécifiquement certains serveurs retirés simplement pour supprimer les modules de mémoire DDR4.
Dans le même temps, Google continue également d'optimiser la bibliothèque de fonctions sous-jacente, l'architecture des modèles et la technologie de compression du cache KV afin de réduire la capacité de mémoire requise par unité de puissance de calcul.
Google a lancé cette année deux versions de TPU ASIC, dont TPU8t est principalement utilisé pour la formation de modèles d'IA, tandis que TPU8i est optimisé pour les tâches d'inférence. Pour éliminer les goulots d'étranglement en termes de performances, le TPU8i adopte une conception de mémoire multicouche hautement personnalisée.
Chaque puce TPU 8i est équipée de 288 Go de mémoire HBM3e, qui peut fournir une bande passante mémoire ultra-élevée de 8,6 To par seconde. La puce intègre également 384 Mo de SRAM sur puce pour stocker un cache clé-valeur actif afin d'éviter un accès fréquent à la mémoire système externe.
Dans la partie hôte du serveur, le serveur TPU 8i annule complètement le processeur principal x86 traditionnel et utilise le processeur Axion personnalisé de Google basé sur l'architecture Arm. Le processeur Axion s'appuie sur l'architecture de mémoire DDR5 haute vitesse et est principalement responsable des tâches au niveau de l'hôte telles que le prétraitement des données.
Cependant, d'après la dernière déclaration de Cherian, Google semble avoir utilisé une mémoire DDR4 plus ancienne dans certains nouveaux serveurs AI pour remplacer les modules DDR5 qui étaient initialement censés être équipés. La gamme spécifique de serveurs et le nombre de modules DDR4 impliqués n'ont pas encore été divulgués.
Commentaires