Résumé :
Certaines grandes sociétés d'intelligence artificielle encouragent l'industrie de la téléphonie mobile à développer des appareils capables d'exécuter en continu des modèles de langage volumineux de 100 milliards de paramètres, l'objectif étant d'ici 2028. Cependant, cette idée se heurte à deux défis pratiques : premièrement, l'exécution d'un modèle aussi volumineux nécessite une grande quantité de mémoire, et deuxièmement, les centres de données d'intelligence artificielle sont en concurrence pour la capacité de production de mémoire mondiale, ce qui entraîne une offre limitée de mémoire grand public et une augmentation continue des prix.

Le PDG de Qualcomm, Amon, a déclaré dans une interview avec Fireside Alpha que certaines entreprises à la pointe du secteur de l'intelligence artificielle explorent les téléphones mobiles capables d'exécuter en continu des centaines de milliards de modèles de paramètres. Il n'a pas divulgué les noms précis de ces sociétés, mais des déclarations pertinentes montrent que les attentes des sociétés d'intelligence artificielle en matière d'appareils mobiles évoluent : à l'avenir, les téléphones mobiles ne seront peut-être plus simplement des terminaux qui appellent occasionnellement des services d'IA dans le cloud, mais des appareils informatiques personnels capables d'exécuter en continu de grands modèles localement et de gérer activement des tâches.
Cependant, la déclaration d'Amon visait davantage à décrire les objectifs proposés par les clients du secteur qu'à décrire la feuille de route produit officiellement annoncée par Qualcomm. À l'heure actuelle, Qualcomm n'a pas encore fourni de solution matérielle complète permettant d'atteindre cet objectif en 2028, et n'a pas non plus promis de lancer un téléphone mobile commercial doté des capacités correspondantes d'ici là.
D'un point de vue technique, le modèle à 100 milliards de paramètres impose des exigences bien plus élevées en matière de matériel de téléphonie mobile que les modèles d'IA actuellement courants sur les appareils. Les paramètres d'un grand modèle de langage déterminent le grand nombre de valeurs que le modèle doit enregistrer et appeler, et ces données doivent généralement être stockées en mémoire afin que le processeur puisse y accéder rapidement lors de l'inférence.
Prenons comme exemple un modèle avec 100 milliards de paramètres. Si une quantification sur 4 bits est utilisée, chaque paramètre ne nécessite théoriquement que 4 bits de stockage, donc seuls les paramètres du modèle eux-mêmes nécessitent environ 50 Go de mémoire. En fonctionnement réel, l'espace doit également être réservé pour le système d'exploitation, d'autres applications, le cache de contexte et les données temporaires pendant l'inférence. Par conséquent, 50 Go ne représentent pas la capacité de mémoire totale requise par un téléphone mobile pour faire fonctionner le modèle sans problème.
Si le modèle est quantifié davantage sur 2 bits, chaque paramètre ne nécessite que 2 bits et les besoins de stockage théoriques pour les paramètres du modèle peuvent être réduits à environ 25 Go. Cependant, cette solution nécessite toujours que les téléphones mobiles disposent d'une capacité de mémoire bien supérieure à celle des produits traditionnels actuels, et une quantification de très faible précision peut considérablement nuire à la qualité de sortie du modèle, en particulier dans les tâches d'inférence complexes.
Il convient de noter que le nombre de paramètres ne détermine pas directement toutes les capacités du modèle. Les données de formation, l'architecture, les méthodes de formation et les techniques d'inférence des différents modèles affecteront toutes la performance finale. Il est tout à fait possible qu’un petit modèle optimisé surpasse un modèle plus grand sur une tâche spécifique. Par conséquent, même si le téléphone mobile ne peut pas exécuter directement le modèle à 100 milliards de paramètres pour le moment, cela ne signifie pas qu'il ne peut pas offrir une expérience d'utilisation réelle proche de celle d'un grand modèle.
Actuellement, il existe encore un écart évident entre la configuration de la mémoire des smartphones et la capacité requise par des centaines de milliards de modèles de paramètres. Dans le passé, certains téléphones phares Android fournissaient autrefois 24 Go de mémoire LPDDR5X. Cependant, face à la pénurie de mémoire et à la hausse des prix, les fabricants de téléphones mobiles ont commencé à réévaluer la valeur commerciale des versions à mémoire élevée. Pour les consommateurs ordinaires, l’augmentation de la capacité de mémoire signifie des coûts matériels plus élevés, et il est difficile pour les fabricants de téléphones mobiles de déterminer si les utilisateurs sont prêts à payer un supplément pour exécuter des modèles d’IA locaux plus importants.
Cela crée une contradiction : les sociétés d'intelligence artificielle espèrent que les téléphones mobiles disposeront de capacités informatiques locales de plus en plus puissantes, mais la mémoire nécessaire pour atteindre cet objectif devient de plus en plus coûteuse et difficile à obtenir.
L'offre mondiale de mémoire est limitée, ce qui est étroitement lié à l'expansion rapide des centres de données d'intelligence artificielle. Les grandes entreprises technologiques continuent d'investir dans des serveurs d'IA, qui nécessitent de grandes quantités de DRAM, une mémoire à large bande passante et des périphériques de stockage à haut débit. Les fabricants de mémoire accordent également de plus en plus d'attention aux produits liés à l'intelligence artificielle, qui connaissent une forte demande et des bénéfices plus élevés lors de l'organisation de la production. La mémoire traditionnelle requise pour les équipements électroniques grand public est donc sous pression en termes d’offre.
Bien que la DRAM à faible consommation utilisée dans les smartphones et la mémoire à large bande passante utilisée dans les accélérateurs d'IA soient différentes en termes de structure de produit et d'exigences de fabrication, elles sont toujours affectées par les changements dans l'allocation des capacités de production ainsi que par l'offre et la demande du marché dans l'ensemble de l'industrie des semi-conducteurs. Plus la demande de mémoire provenant des infrastructures d’IA est forte, plus il sera difficile pour les fabricants d’électronique grand public de maintenir les conditions antérieures en termes de prix et d’offre.
Cette pression se reflète dans les coûts de fabrication des téléphones mobiles. Une analyse précédemment publiée par la société d'études de marché Counterpoint Research a montré qu'au deuxième trimestre 2026, les prix de la mémoire des smartphones ont augmenté de plus de 80 % par rapport au trimestre précédent. Parmi les téléphones mobiles de différents niveaux de prix, la hausse des coûts de mémoire a un impact significatif sur les coûts globaux des matériaux.
Counterpoint a souligné que le coût de la nomenclature des téléphones mobiles de milieu de gamme a augmenté d'environ 52 % d'une année sur l'autre, et que la mémoire représentait environ 40 % du coût global de la nomenclature. Les téléphones mobiles haut de gamme ont également été touchés, et la DRAM a même dépassé les puces au niveau système pour devenir le composant le plus cher de certains téléphones mobiles phares.
Cela signifie que les fabricants de téléphones mobiles doivent non seulement se demander s'ils ont la possibilité de configurer 50 Go ou plus de mémoire pour 100 milliards de paramètres de modèles, mais doivent également répondre à une question plus réaliste : les consommateurs sont-ils prêts à payer pour ces mémoires ?
S'il s'agit simplement d'exécuter de grands modèles, la mémoire du téléphone mobile doit être augmentée des 12 Go ou 16 Go actuellement courants à 64 Go ou même plus, et le coût de l'ensemble de la machine peut augmenter considérablement. Associé à des processeurs plus puissants, à un emballage avancé et à une conception thermique, le prix du produit final peut être encore plus éloigné de la fourchette acceptable pour les consommateurs ordinaires.
Qualcomm et Apple tentent d'atténuer ce problème en termes d'architecture de puce et de technologie de packaging. Des rapports connexes mentionnent qu'Apple A20 Pro et la plate-forme phare Snapdragon de nouvelle génération de Qualcomm explorent des conceptions de puces et des méthodes d'organisation de la mémoire plus propices au fonctionnement de grands modèles, dans l'espoir d'améliorer l'efficacité de l'accès aux données et de réduire la surcharge de transmission de données entre le processeur et la mémoire.
Cependant, l'amélioration de l'efficacité de l'encapsulation et de l'accès aux données ne signifie pas que les besoins en mémoire physique disparaîtront automatiquement. Même si le processeur peut utiliser la mémoire plus efficacement, le modèle de 100 milliards de paramètres lui-même doit encore sauvegarder de nombreuses données de paramètres. Pour rendre des modèles de cette envergure véritablement adaptables aux téléphones mobiles, l’industrie devra peut-être réaliser de nouvelles avancées en matière de compression des modèles, d’architecture d’inférence et d’accès au stockage.
Une solution possible est une technologie de quantification plus radicale. En réduisant le nombre de bits utilisés par paramètre, le modèle peut s'exécuter dans un espace mémoire plus petit. Cependant, la quantification n’est pas sans coût. Pour les tâches qui nécessitent un raisonnement logique complexe, une précision numérique trop faible peut entraîner une dégradation significative des performances du modèle. Par conséquent, la manière de trouver un équilibre entre l’utilisation de la mémoire et la qualité du modèle deviendra une direction de recherche importante pour l’IA finale.
Une autre solution est le modèle expert hybride, qui est l'architecture MoE. Contrairement aux architectures intensives traditionnelles qui nécessitent d'appeler l'intégralité du modèle pour chaque inférence, le modèle MoE sélectionne une partie du réseau d'experts pour participer à des calculs basés sur des tâches spécifiques. Avec une conception appropriée, seul un petit ensemble de paramètres du modèle doit être activé à chaque fois qu'un jeton est traité.
Si la technologie de déchargement des experts est adoptée davantage, le système peut conserver les experts actuellement nécessaires dans la DRAM et stocker temporairement les experts qui ne sont pas nécessaires dans la mémoire flash. Lorsque d'autres experts sont nécessaires pour le processus d'inférence, les données pertinentes sont lues de la mémoire flash vers la mémoire.
Cette approche peut réduire la quantité de données que le modèle doit résider dans la DRAM en même temps, mais au prix d'un accès au stockage et d'une surcharge de transfert de données accrus. Les caractéristiques de vitesse d'accès et de latence de la mémoire flash UFS utilisée dans les téléphones mobiles sont très différentes de celles de la DRAM. Si le modèle lit fréquemment les paramètres de la mémoire flash, la vitesse d'inférence peut être affectée.
Apple a également déjà étudié la possibilité d'utiliser le stockage intégré de l'appareil pour exécuter de grands modèles linguistiques. Ce type de technologie devrait réduire la dépendance à l'égard de la capacité DRAM, mais il reste encore à vérifier si elle peut atteindre une latence suffisamment faible, un débit élevé et une consommation d'énergie acceptable sur les téléphones mobiles.
De plus, le fonctionnement continu de grands modèles entraînera également des problèmes de dissipation thermique et de durée de vie de la batterie. L'espace interne des téléphones mobiles est limité et ils ne peuvent pas être équipés de systèmes de refroidissement à grande échelle comme les ordinateurs de bureau ou les serveurs. Si le processeur effectue une inférence IA de haute intensité pendant une longue période, la température de la puce peut continuer à augmenter, déclenchant par la suite le mécanisme de réduction de fréquence, entraînant une dégradation des performances.
Ce problème est particulièrement aigu pour les agents qui doivent travailler 24 heures sur 24. Les chatbots traditionnels commencent généralement à traiter les tâches après que l'utilisateur a fait une demande, mais la nouvelle génération d'agents IA peut avoir besoin de surveiller en permanence les informations, d'analyser le contexte et d'effectuer des opérations de manière proactive au moment approprié. Si le téléphone doit faire fonctionner de grands modèles 24 heures sur 24, non seulement la mémoire doit être disponible à tout moment, mais la consommation électrique du processeur et celle de la batterie doivent également être étroitement contrôlées.
Par conséquent, même si un futur téléphone mobile peut charger avec succès un modèle de 100 milliards de paramètres, cela ne signifie pas qu'il peut continuer à fonctionner à la vitesse idéale. La capacité du modèle à résider réellement en mémoire, le nombre de mots qu'il peut traiter par seconde, la quantité de chaleur qu'il génère pendant son fonctionnement et l'impact qu'il a sur la durée de vie de la batterie sont autant d'indicateurs importants pour mesurer la valeur d'utilisation réelle.
Par rapport au branchement direct d'un modèle de 100 milliards de paramètres sur un téléphone mobile, une solution plus réaliste pourrait consister à exécuter un modèle de taille moyenne distillé et optimisé.
La distillation de modèle tire généralement parti des capacités d'un grand modèle pour entraîner un modèle plus petit, afin que ce dernier puisse conserver autant que possible les performances du grand modèle dans une tâche spécifique tout en réduisant considérablement l'échelle des paramètres. Wccftech estime qu'un modèle correctement distillé de 20 à 30 milliards de paramètres pourrait approcher les performances d'un modèle de 100 milliards de paramètres sur certaines tâches, et est donc plus approprié pour devenir la principale force de l'IA locale dans les futurs smartphones.
L'avantage de cette solution est qu'elle ne nécessite pas une capacité de mémoire extrêmement importante et qu'elle a la possibilité de fournir des capacités de raisonnement assez puissantes. Pour les fabricants de téléphones mobiles, au lieu de simplement rechercher le nombre de paramètres pouvant être pris en compte, il est préférable d'obtenir une meilleure expérience réelle avec des ressources matérielles limitées grâce à l'architecture du modèle, à la quantification, à la distillation et à l'optimisation de l'inférence.
Bien sûr, les performances des différents modèles varient considérablement, et un modèle à 20 à 30 milliards de paramètres ne peut pas remplacer le modèle à 100 milliards de paramètres sur toutes les tâches. Des capacités telles que le raisonnement complexe, l’expertise et le traitement de contextes longs dépendent toujours de la formation et de la conception architecturale de modèles spécifiques. Mais du point de vue de la production, être capable d'accomplir la plupart des tâches quotidiennes avec une consommation d'énergie et un coût raisonnables peut s'avérer plus précieux que de rechercher une simple échelle de paramètres.
La déclaration du PDG de Qualcomm reflète également le fait que l'industrie des smartphones recherche de nouvelles directions de croissance. Alors que les avantages marginaux des mises à niveau matérielles traditionnelles diminuent progressivement, les fabricants de téléphones mobiles espèrent utiliser des agents IA pour redéfinir la façon dont les appareils sont utilisés.
Les futurs smartphones ne seront peut-être plus simplement des appareils attendant que les utilisateurs ouvrent des applications et saisissent des commandes, mais plutôt des assistants personnels capables de comprendre en permanence les besoins, d'organiser des tâches et d'appeler différents services dans le cadre de l'autorisation de l'utilisateur. De tels systèmes nécessitent des capacités de raisonnement local plus fortes, ainsi qu'une gestion de la mémoire plus efficace, un calcul à faible consommation et des mécanismes de sécurité.
Cependant, il existe encore une distance entre les objectifs de l'industrie et le produit final. Amon n'a pas annoncé le nom de l'entreprise partenaire spécifique, ni fourni de feuille de route matérielle complète ou de calendrier de production de masse. Il est plus approprié de considérer 2028 comme la date cible à laquelle certaines sociétés d’IA espèrent atteindre cette capacité, plutôt que comme la date de sortie du produit confirmée par Qualcomm.
À en juger par les conditions techniques actuelles, il n'est pas totalement impossible pour les téléphones mobiles d'exécuter des centaines de milliards de modèles de paramètres en 2028, mais la méthode de mise en œuvre peut être différente de ce que les gens imaginent en « chargeant tous les modèles complets dans la mémoire du téléphone mobile ». Une quantification plus agressive, une architecture MoE, un déchargement expert, une conception de mémoire dédiée et une distillation de modèles peuvent tous contribuer à atteindre cet objectif.
Dans le même temps, l'offre mondiale de mémoire et l'évolution des prix affecteront directement la viabilité commerciale de cette direction. Si l'offre de DRAM grand public est limitée pendant longtemps par les centres de données d'IA, même s'il est techniquement possible de fabriquer des téléphones mobiles avec 64 Go ou plus de mémoire, les fabricants pourraient ne pas être disposés à lancer de tels produits à grande échelle.
Par conséquent, la vision de Qualcomm d'un téléphone mobile doté de 100 milliards de paramètres doit vraiment être résolue non seulement en termes de performances de la puce, mais également en termes d'équilibre global entre la taille du modèle, la capacité de mémoire, le coût de fabrication, la dissipation thermique, la durée de vie de la batterie et la demande des consommateurs. Pour les utilisateurs ordinaires, la chose la plus remarquable à l'avenir n'est peut-être pas de savoir si le téléphone mobile peut exécuter un modèle avec 100 milliards de paramètres, mais s'il peut fournir des services d'IA locaux fiables, rapides et vraiment utiles sans augmenter considérablement le prix ni sacrifier sérieusement la durée de vie de la batterie.
Commentaires