Qualcomm explique en détail la mise à niveau phare du NPU Snapdragon de nouvelle génération : des capacités de raisonnement IA plus fortes réduiront la dépendance à la mémoire

📅 2026-09-11

Résumé :

Qualcomm a récemment annoncé plus de détails sur les capacités de traitement de l'IA du Snapdragon 8 Elite Gen 6 Pro, dont le plus remarquable est la mise à niveau du nouveau Hexagon NPU. Contrairement à la simple poursuite de la croissance de la puissance de calcul de l'IA dans le passé, Qualcomm accorde cette fois plus d'attention à l'efficacité du fonctionnement des modèles d'IA, à l'accès à la mémoire et au contrôle de la consommation d'énergie, dans l'espoir de permettre à la prochaine génération de téléphones mobiles phares d'exécuter localement des modèles d'IA génératifs et des agents d'IA à plus grande échelle.

Qualcomm a déclaré qu'à mesure que l'IA générative devient progressivement une fonctionnalité importante des smartphones, les modèles d'IA eux-mêmes continuent de devenir plus grands et plus complexes. Pour les appareils mobiles, le véritable goulot d'étranglement n'est pas seulement la puissance de calcul, mais aussi la manière de traiter efficacement ces modèles avec une consommation d'énergie et une bande passante mémoire limitées. Par conséquent, le NPU du Snapdragon 8 Elite Gen 6 Pro a été repensé à bien des égards.

L'une des mises à niveau importantes est le nouvel Element Accelerator. Cette unité d'accélération matérielle dédiée est optimisée pour des opérations spécifiques dans le calcul de l'IA, ce qui peut améliorer l'efficacité du NPU lors de l'exécution des charges de travail associées. Par rapport à la simple augmentation de la puissance de calcul maximale du NPU, cette conception spécialisée permet à la puce d'effectuer des tâches d'IA spécifiques avec moins de ressources, réduisant ainsi la consommation d'énergie dans le processus informatique.

La nouvelle génération de Hexagon NPU bénéficie également d'une plus grande mémoire partagée. Qualcomm a déclaré que sa capacité de grande mémoire partagée a augmenté de 50 % par rapport à la génération précédente. Cette partie de la mémoire partagée à grande vitesse permet au NPU de sauvegarder plus facilement les données requises lors de l'exécution du modèle d'IA, réduisant ainsi le besoin d'accès fréquent à la mémoire système.

Ce changement est particulièrement important pour les modèles linguistiques volumineux. Lors de l’exécution de l’IA générative, les modèles doivent traiter en permanence de grandes quantités de données contextuelles, dont certaines doivent être conservées lors de l’inférence. Si ces données sont fréquemment transférées entre le NPU et la mémoire système, cela augmentera la latence et consommera plus d'énergie. En ajoutant une mémoire partagée à haut débit pouvant être utilisée directement à l'intérieur du NPU, Qualcomm espère réduire autant que possible cette manipulation de données.

L'un des objets qui en a considérablement bénéficié est KV Cache. À mesure que les utilisateurs ont des conversations continues de plus en plus longues avec les assistants IA, les modèles doivent enregistrer de plus en plus d’informations contextuelles. La taille du cache KV augmentera également en conséquence, et cela devient souvent une charge de mémoire importante lors de l'exécution locale de grands modèles. Une mémoire partagée plus grande permet aux données plus pertinentes de rester plus proches de l'unité de calcul, améliorant ainsi l'efficacité de l'inférence de l'IA.

Qualcomm estime que cette fonctionnalité est particulièrement importante pour les agents IA. Par rapport à l'IA traditionnelle par questions et réponses, les agents d'IA doivent effectuer plusieurs étapes en continu, telles que comprendre les besoins des utilisateurs, formuler des plans d'exécution, appeler différents outils, analyser les résultats renvoyés, puis passer à l'étape suivante. Tout au long du processus, l'état et le contexte du modèle doivent être enregistrés en permanence, de sorte que la réduction de l'accès à la mémoire peut contribuer à réduire la latence et permettre aux tâches d'IA complexes de s'exécuter plus facilement.

Les améliorations apportées par Qualcomm au NPU signifient également que lorsque les téléphones mobiles utiliseront l'IA à l'avenir, ils n'auront pas nécessairement besoin de simplement compter sur l'augmentation de la RAM système pour résoudre le problème. À mesure que les modèles d'IA locaux deviennent de plus en plus grands, les fabricants de téléphones mobiles ont continué à augmenter la capacité de mémoire de leurs produits phares ces dernières années. Cependant, l'augmentation de la RAM entraînera non seulement une augmentation des coûts matériels, mais également une augmentation de la consommation d'énergie et de la pression sur l'approvisionnement en mémoire. Qualcomm tente d'atténuer ce problème au niveau architectural en plaçant davantage de données dans la mémoire partagée à haut débit à l'intérieur de la puce.

En plus du NPU, le CPU et le GPU du Snapdragon 8 Elite Gen 6 Pro ont également été considérablement améliorés. Qualcomm a précédemment révélé que la plate-forme phare de nouvelle génération aura une fréquence de processeur allant jusqu'à 5 GHz. Si cette spécification est finalement mise en œuvre selon les informations actuellement annoncées, elle deviendra un nœud très symbolique dans les processeurs mobiles, car la fréquence la plus élevée des processeurs de smartphone entrera officiellement dans l'ère des 5 GHz.

Qualcomm a également introduit la technologie FlexCache pour les processeurs. L'idée principale est également de réduire la dépendance du processeur à l'égard de la mémoire système externe et d'utiliser de manière plus flexible le cache interne de la puce afin que le processeur puisse obtenir des données plus efficacement. Pour les processeurs mobiles modernes, l'efficacité de l'accès aux données entre le cache et la mémoire est devenue de plus en plus importante, cette conception peut donc améliorer dans une certaine mesure l'équilibre entre performances et efficacité énergétique.

Les GPU ont également connu des changements architecturaux importants. Qualcomm décrit la nouvelle génération de GPU Adreno comme une mise à niveau architecturale très importante qui améliore non seulement les performances graphiques traditionnelles, mais renforce également la capacité du GPU à effectuer des tâches d'IA.

L'un des changements importants est l'ajout des Adreno Matrix Cores, qui sont des cœurs dédiés aux calculs matriciels. Les opérations matricielles constituent un type de calcul important dans les modèles d'IA modernes, de sorte que les cœurs matriciels dédiés peuvent aider les GPU à effectuer plus efficacement les travaux liés à l'IA.

Cela signifie que les futures plates-formes phares Snapdragon ne confieront pas tous les calculs d'IA au NPU. En fonction des tâches spécifiques, le CPU, le GPU et le NPU peuvent chacun entreprendre différents types de travaux, formant ainsi un système informatique hétérogène plus évident. Pour les jeux, le GPU peut effectuer une partie des calculs de l'IA tout en complétant le rendu graphique traditionnel ; tandis que pour les charges de travail telles que l’IA générative, le NPU peut jouer un rôle plus important.

Qualcomm a également lancé la technologie Adreno Neural Fusion pour renforcer encore la combinaison entre l'IA et le rendu graphique. Cette technologie peut utiliser des algorithmes d'IA pour améliorer les effets visuels des écrans de jeu et aider à obtenir des effets de traitement graphique plus avancés tout en contrôlant la consommation d'énergie.

Cette conception est particulièrement adaptée aux technologies graphiques IA qui se sont développées rapidement ces dernières années, telles que la super-résolution et la génération de trames. La résolution et la complexité des images des jeux mobiles continuent d'augmenter. Si toutes les images reposent sur des méthodes traditionnelles de rendu natif, la charge du GPU et la consommation d'énergie augmenteront rapidement. L’utilisation de l’IA pour générer une partie des informations sur l’image peut permettre d’obtenir une qualité d’image finale supérieure à des coûts de rendu inférieurs.

Du point de vue de l'architecture globale, la mise à niveau de l'IA du Snapdragon 8 Elite Gen 6 Pro ne vise pas simplement à rendre le NPU plus rapide, mais à essayer de repenser la méthode de traitement des données à l'intérieur de l'ensemble du SoC. Le NPU dispose d'une mémoire partagée plus grande et d'accélérateurs dédiés. Le processeur réduit la dépendance à l'égard de la mémoire système grâce à FlexCache, tandis que le GPU ajoute des capacités de calcul matricielle spécialisées et participe au traitement graphique grâce à la technologie IA.

Ce changement reflète le fait que les puces mobiles entrent dans une nouvelle étape. Dans le passé, lors de la mesure des performances des SoC phares, les gens se concentraient principalement sur les scores de fonctionnement du CPU et du GPU, mais désormais la charge de travail de l'IA est devenue un facteur important pour déterminer l'expérience réelle de la puce. Pour la prochaine génération de téléphones mobiles, ce qui est vraiment important n'est pas seulement la puissance de calcul maximale de la puce, mais aussi sa capacité à exécuter des modèles d'IA pendant une longue période avec une consommation d'énergie limitée et sa capacité à contrôler efficacement le mouvement des données entre les différentes unités informatiques et mémoires.

L'accent particulier mis par Qualcomm sur la mémoire partagée et la réduction de l'accès à la mémoire montre également que la concurrence des puces à l'ère de l'IA passe progressivement d'une simple « guerre de la puissance de calcul » à une « guerre de l'efficacité du transfert de données ». Pour les grands modèles d'IA, le calcul lui-même est important, mais la manière d'envoyer en temps opportun les paramètres du modèle, le contexte et les résultats intermédiaires à l'unité de calcul appropriée affectera également directement les performances finales et la consommation d'énergie.

Par conséquent, ce qui est vraiment remarquable à propos du Snapdragon 8 Elite Gen 6 Pro n'est peut-être pas l'amélioration des performances individuelles de l'IA, mais le fait que Qualcomm essaie de permettre aux téléphones mobiles de gérer localement des tâches d'IA de plus en plus complexes grâce à une collaboration plus étroite entre le NPU, le CPU, le GPU, le cache et la mémoire partagée.

À mesure que les assistants IA, les agents IA, les applications génératives et les fonctions de jeu IA deviennent progressivement une partie importante des téléphones mobiles phares, cette idée architecturale pourrait également devenir une direction importante pour le développement des SoC mobiles à l'avenir. Par rapport à la RAM système en constante augmentation, la digestion des modèles d'IA en constante expansion grâce à des mécanismes de traitement des données et de mise en cache plus efficaces au sein de la puce devrait permettre d'atteindre un équilibre plus raisonnable entre performances, consommation d'énergie et coût.

La question de savoir si le Snapdragon 8 Elite Gen 6 Pro peut finalement atteindre ces objectifs techniques devra être vérifiée par des tests complets après le lancement de l'appareil lui-même. Cependant, à en juger par les informations publiées jusqu'à présent, l'objectif de la mise à niveau de la plate-forme phare de Qualcomm de cette génération a été très clair : non seulement rendre les calculs d'IA plus rapides, mais aussi rendre les calculs d'IA plus efficaces et minimiser les coûts de mémoire et de consommation d'énergie des téléphones mobiles afin d'exécuter l'IA locale.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire