La première puce « poivre » d'OpenAI submerge le GPT-6 de Nvidia et fait planter CUDA

📅 2026-08-26

Résumé :

Pouvez-vous croire que la première production de puces d'OpenAI a réellement vaincu toute la série NVIDIA ? ! Tout à l'heure, la première puce auto-développée d'OpenAI, Jalapeño, a livré le premier lot de résultats mesurés - les performances d'inférence de l'IA, dépassant complètement les NVIDIA GB200 et GB300.



Décollez directement à la vitesse mesurée !

Jalapeño peut cracher 1 459 jetons en une seconde, tandis que Nvidia GB200 ne peut cracher que 535 jetons, soit moins de la moitié.

Il ne faut que 1,65 seconde à « Pepper » pour accomplir une tâche, mais il faut près de 6 secondes au GB300, soit une différence de 3,6 fois.

Le plus cruel est que même si le GB300 est forcé à sa vitesse de décodage la plus rapide, le débit de Jalapeño est toujours 104,3 fois supérieur à celui-ci.

La consommation électrique nominale du Jalapeño n'est que de 700 W, tandis que celle du GB300 est de 1 400 W, soit exactement la moitié.

Le célèbre analyste des semi-conducteurs Dylan Patel a même déclaré durement : « Ce n'est pas seulement Blackwell qui a été renversé, même la puce Rubin de Nvidia a été surpassée » !


Pendant un certain temps, le cercle entier de l'IA a explosé. Les internautes se sont émerveillés qu'OpenAI soit si fou que Nvidia ait également été vaincu.

La déclaration d'Ultraman était autoritaire mais retenue : "Nous avons fabriqué une puce, c'est ridiculement rapide" !



01

Un "piment" a renversé le produit phare de Nvidia

Ce n'est pas OpenAI qui parle de lui-même.

SemiAnalysis s'est rendu au laboratoire pour des mesures réelles, et la conclusion qu'ils ont écrite est——

Jalapeño a vaincu toutes les puces Nvidia, AMD et Google qu'ils avaient testées auparavant.

Quelle est la différence ? La dernière Vera Rubin de Nvidia consomme suffisamment d’électricité pour nourrir près de trois Jalapeños.


Au cours du test, OpenAI a sélectionné trois modèles publics à exécuter : GPT-OSS 120B et un modèle 670B et 1T.

Cette série de tests couvre les architectures MoE allant de paramètres moyens à mille milliards. Les résultats globaux sont les suivants :

La charge de travail de l'IA par watt a été multipliée par 1,5 à 1,9

Latence de bout en bout réduite de 1,7 à 3,6 fois

Amélioration des performances de 2,1 à 4,1x sur les charges de travail hautement interactives


Les 1 459 jetons mentionnés précédemment ont été mesurés sur GPT-OSS 120B.

Converti en intervalle de mots, il n'y a que 0,69 milliseconde entre les deux jetons.

Une personne lit normalement environ cinq ou six mots en une seconde, mais elle crache 1 459 mots en une seconde. Les yeux ne peuvent pas suivre et l’écran ne peut pas les lire.


Le vert est le Jalapeño, le bleu est le plus fort disponible. Les trois modèles sont respectivement 2,7 fois, 4,1 fois et 3,8 fois plus rapides

L'écart de quatre secondes entre 1,65 seconde et 5,99 secondes peut être toléré dans le chat, mais c'est une autre affaire lorsqu'il est utilisé sur un agent, car une tâche nécessite des dizaines d'étapes consécutives, il faut donc multiplier la différence.

Ensuite, on a dit que l'ensemble du réseau tournait 104,3 fois.

Ce que cela signifie exactement, c'est qu'en poussant le GB300 à sa vitesse de décodage la plus rapide, qui est de 169 jetons par seconde, le débit de Jalapeño est alors 104,3 fois supérieur à celui de celui-ci.

Cette tendance est vraie pour les trois modèles, avec GPT-OSS atteignant 53,7 fois et le modèle 1T atteignant 56,1 fois.



Pour le même modèle, à mesure que la vitesse de production de mots requise augmente, la marge principale augmente de 1,7 fois à 104,3 fois

En d'autres termes, l'endroit où l'adversaire atteint la limite et commence à haleter est exactement l'endroit où il navigue encore calmement.

Si les valeurs maximales sont calculées sur la base de leurs meilleurs points de fonctionnement respectifs, la différence sera beaucoup plus légère, 1,9 fois, 1,7 fois et 1,5 fois pour les trois modèles respectivement.


Ce qui crée réellement de la distance, c'est la scène à forte interaction


L'axe horizontal de l'image de gauche est la vitesse de sortie du mot, et l'axe horizontal de l'image de droite est le délai de la requête complète. Le Jalapeño vert appuie sur le GB200 bleu sur toute la courbe

SemiAnalysis prend en compte l'alimentation électrique, la dissipation thermique et le réseau, puis les répartit sur chaque puce.

En conséquence, Jalapeño a 1,125 kilowatts par unité, GB200 a 1,87 kilowatts et Vera Rubin a 3,3 kilowatts.

Lors de l'exécution de GPT-OSS à ce calibre, Jalapeño crache environ 53 millions de jetons par mégawatt par seconde, et le GB200 NVL72 n'en crache qu'environ 10 millions.


Le violet est Jalapeño, l'axe horizontal est la vitesse d'interaction et l'axe vertical est le nombre de jetons crachés par mégawatt par seconde

En termes de coût, le coût total de possession par heure de puce est de 1,56 $ pour Jalapeño, ce qui équivaut presque à 1,55 $ pour le H100, tandis que Vera Rubin est de 3,61 $.


Le vert est Vera Rubin, le violet est Jalapeño. Après 200 jetons par seconde, le violet est allé jusqu'à un endroit hors de portée du vert.

Le plus terrible, c'est que ces résultats ne reflètent pas toute la puissance du Jalapeño.

Il ne permet même pas le décodage spéculatif et la prédiction de jetons, et n'effectue pas non plus de déploiement séparé du pré-remplissage et du décodage. Cependant, toutes les autres puces de l’image exécutent leur propre configuration optimale, et aucune des optimisations qui devraient être activées n’est laissée de côté.

SemiAnalysis estime que le décodage spéculatif à lui seul peut réduire le coût par jeton de plus de 2/3.


Un Jalapeño peut également exécuter le "Doom Slayer"

02

En neuf mois, GPT‑Astra a travaillé jusqu'à la salle d'enregistrement

Pour une telle chose, il n'a fallu que neuf mois entre la conception et l'enregistrement d'OpenAI. En comparaison, un délai courant dans l’industrie est de 18 à 36 mois.

Tous ceux qui ont utilisé ASIC savent que le travail le plus épuisant de ce cycle est la vérification. La simulation doit être répétée encore et encore, et si vous changez de lieu, vous devez tout recommencer.

La raison pour laquelle OpenAI peut « tricher » est qu'il invite son modèle le plus puissant dans la salle d'enregistrement——

Le modèle qui a aidé à développer Jalapeño s'appelle GPT-Astra, qui est le GPT-6 qui a fait l'objet de rumeurs dans le monde extérieur !





Tout au long du processus, GPT-Astra est devenu le soutien le plus important de l'équipe.

Il permet d'explorer des solutions de mise en œuvre, de serrer à mort tout le cercle « conception-mesure-vérification », et également de micro-manipuler les circuits arithmétiques.

Dans quelle mesure la microgestion est-elle effectuée ? Les chiffres découverts par SemiAnalysis indiquent que la conception assistée par l'IA réduit la surface de l'unité SIMD de 8 % et la surface du moteur matriciel de 10 %.

En même temps, ces modules sont meilleurs que la première version en termes de timing et de consommation électrique.


La puce informatique est au centre, avec trois HBM4 de chaque côté, et celle du haut est la puce d'E/S

La matrice de calcul principale mesure environ 840 millimètres carrés et la limite de masque de la machine de lithographie EUV est de 858 millimètres carrés. Ce morceau de silicium se trouve à seulement 18 millimètres carrés du plafond physique.

On peut dire que la zone où la machine de photolithographie peut être utilisée pour dessiner est pratiquement occupée, ne laissant rien du tout.


La ligne rose est Jalapeño, et les trois colonnes les plus à droite sont la bande passante HBM par watt, les FLOP par watt et le rapport puissance de calcul/bande passante

En termes de bande passante HBM par watt, Jalapeño est à 22, Rubin en deuxième position à 11,1 et GB300 à seulement 5,71. C'est exactement le double de la deuxième place.

Le FLOP par watt est de 19,1 et celui de Rubin est de 19,4. Les deux sont presque à égalité, mais le Rubin brûle plus de 1 800 watts, tandis que le Jalapeño ne brûle que 700 watts.

Cela fonctionne simplement avec les étapes A0. Le B0 est déjà en usine et sa performance par watt est environ 25 % supérieure à celle du A0.

De cette manière, en s'appuyant sur la puissante combinaison du Codex et de GPT-Astra, OpenAI a transformé trois modèles open source qui n'étaient pas initialement prévus en un état haute performance en seulement deux mois.

Ce qui est encore plus effrayant, c'est que dans les modules « d'attention » et MoE les plus gourmands en performances, le code saisi par l'IA s'exécute 1,5 à 1,8 fois plus rapidement que les meilleurs experts humains.

L'IA conçoit la puce, la puce exécute l'IA et l'IA revient pour optimiser l'IA sur la puce.

Ce volant d'inertie, OpenAI, tourne déjà.



Douves CUDA, mortes ?

Le fossé le plus profond de NVIDIA a toujours été CUDA.

La pile logicielle accumulée au cours des deux dernières décennies a cultivé la mémoire musculaire des ingénieurs du monde entier. Chaque fois que le matériel est modifié, ils doivent le démonter et tout recommencer.

SemiAnalysis a émis un jugement très sévère dans l'article, affirmant que les douves de CUDA pourraient être mortes.


La raison est la vitesse.

Ils ont également ajouté une comparaison plus déchirante : Rubin de Nvidia a en fait terminé l'enregistrement CoWoS un mois plus tôt que Jalapeño.

Mais jusqu'à présent, les seuls résultats Rubin que le monde extérieur peut voir sont les données des échantillons d'ingénierie CoreWeave. Nvidia ne fait pas appel à des tiers en laboratoire pour des tests aléatoires comme OpenAI.

Le problème réside donc dans la vitesse à laquelle le logiciel démarre. Il n'y a rien de mal avec le matériel NVIDIA lui-même.

Partir de zéro donne même un avantage à OpenAI. Il n’est pas nécessaire de transporter un bagage historique et l’architecture peut être entièrement dessinée sur une feuille de papier vierge.

La dernière phrase de SemiAnalysis est très graphique——

Ils disent que des modèles OpenAI tels que GPT-5.6 Sol fonctionnant sur des GPU NVIDIA ont été utilisés pour concevoir une puce qui menace véritablement le fossé CUDA. Les GPU de NVIDIA engendrent leurs propres « successeurs » en temps réel.


03

10 gigawatts, ce n'est qu'un début

Le Jalapeño n'est que le premier coup sur un front.

En octobre de l'année dernière, OpenAI et Broadcom ont fait un grand pas en avant et ont signé une importante commande de coopération pour un accélérateur personnalisé de 10 GW.


Chen Fuyang, PDG d'Ultraman et de Broadcom, a présenté la plaquette Jalapeño, avec la plaque signalétique indiquant « Jalapeño Intelligence Processor »

Le niveau de 10 GW équivaut presque à dix centrales nucléaires fonctionnant à pleine capacité.


Le coffret principal CPU à gauche, le coffret ASIC à droite, 128 puces dans un coffret, le total des deux coffrets est d'environ 160 kilowatts

Au fait, le plateau qui contient le processeur s'appelle Katsu, la puce s'appelle Vindaloo Indian curry et le commutateur s'appelle Chana chiches pois. De la cuisine japonaise à la cuisine indienne épicée, ces gens veulent vraiment que vous vous souveniez de ce système.

Et Jalapeño n'est que la première génération sur la feuille de route, OpenAI l'a clairement indiqué dans le rapport——

Gen2 est déjà en plein développement, et Gen3 prend également forme.

La production de masse n’augmentera progressivement qu’en 2027, et la prochaine étape sera de 100 mégawatts.


Cependant, aujourd'hui encore, il a été révélé que le responsable du centre de données d'OpenAI, Chris Malone, avait disparu !

Malone est le chef de Stargate.

Maintenant, l'introduction en bourse se rapproche de plus en plus. À ce stade, la perte du principal commandant de l’infrastructure informatique amène les gens à s’interroger sur le courant sous-jacent derrière OpenAI.


Bien sûr, un seul Jalapeño ne suffit pas pour renverser Nvidia.

Mais le véritable signal de danger est qu'OpenAI a transformé les modèles, les puces et les logiciels en un volant d'inertie accéléré.

Le Jalapeño actuel n'est que la première génération, suivi par les Gen2, Gen3 et une puissance de calcul de 10 GW. Même si les principaux dirigeants partent, cela ne peut pas empêcher cette voie de continuer à avancer.

Nvidia est toujours sur le trône.

Mais cette fois, le remplaçant ne s'est pas aligné devant la porte, il avait déjà couru dans la salle informatique.

Les rivaux de Nvidia ont finalement commencé à construire leur propre Nvidia.

Tags associés

Articles similaires

Commentaires

0/500
验证码
Aucun commentaire