
#OpenAIInferenceCostTest
About OpenAIInferenceCostTest
OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio
Populaire
Récents
OpenAIInferenceCostTest Publications populaires
#OpenAIQ2LossWidens
Les entreprises à forte croissance ne deviennent pas toujours de grandes entreprises.
OpenAI continue de croître, mais les pertes augmentent aussi. Anthropic suit une voie différente en montrant des signes précoces de rentabilité. Les revenus font les gros titres.
L'économie durable décide généralement qui gagne le marathon. Qu'est-ce qui compte le plus pour vous aujourd'hui, la croissance ou la rentabilité ?

JUST IN : Les chances que Anthropic fasse son introduction en bourse dépassent la valorisation en hausse de 1,77 billion de dollars de SpaceX $SPCX.

Toute l'attention autour de Jalapeño semble centrée sur la performance par rapport à Nvidia, mais la vitesse d'ingénierie derrière est vraiment remarquable. Quelques points forts de la présentation @hotchipsorg :
1. La conception de puces personnalisées nécessitait autrefois d'immenses équipes d'ingénieurs et des délais de plusieurs années. OpenAI est passé du code RTL initial à la gravure en seulement 9 mois en utilisant XLS (un langage proche de Rust pour le matériel de Google) et une co-conception pilotée par l'IA.
2. Une boucle d'IA a pris un noyau brut, à peine fonctionnel (DeepSeek) avec une efficacité de 0,31 % et l'a optimisé de manière autonome à 88,94 % de la limite physique de la puce en moins de 2 jours.
3. Le code généré par l'IA fonctionnait jusqu'à 1,8 fois plus vite sur les blocs critiques que les implémentations réglées à la main par des ingénieurs noyaux de classe mondiale.
4. L'IA n'a pas seulement écrit le logiciel pour la puce. Elle a optimisé les circuits matériels physiques avant la gravure.
Encore une fois, ce n'est pas un jeu à somme nulle ni un impact négatif net pour Nvidia. Les ASIC personnalisés débloquent des efficacités de service absurdes pour des charges de travail spécialisées et vont élargir la part totale de calcul pour toute l'industrie.
Depuis l'annonce de Jalapeño, notre premier circuit d'inférence personnalisé, nous l'avons testé ainsi que le système qui l'entoure.
Les résultats montrent une avancée majeure : plus d'intelligence par watt et des réponses plus rapides, offrant à la fois un débit plus élevé et une latence plus faible dans une seule architecture sans sacrifier l'efficacité.

OpenAI affirme que sa nouvelle puce d'IA Jalapeño pourrait réduire considérablement le coût d'exécution de l'intelligence artificielle, mais Jim Cramer (@jimcramer) reste sceptique quant à la menace sérieuse qu'elle représenterait pour Nvidia ($NVDA).
Jalapeño est la première puce d'inférence personnalisée d'OpenAI et a été développée avec Broadcom ($AVGO). L'entreprise prévoit de commencer à la déployer en interne d'ici la fin de 2026, avec une montée en production attendue en 2027.
Le PDG d'OpenAI, Sam Altman (@sama), a simplement décrit la puce en disant : « Nous avons fabriqué une puce et elle est rapide. » L'entreprise travaille déjà sur des versions de deuxième et troisième génération.
OpenAI affirme que Jalapeño peut offrir à la fois un débit plus élevé et une latence plus faible, une combinaison difficile à atteindre. Ses benchmarks internes ont montré une meilleure performance par watt que les systèmes GB200 et GB300 de Nvidia sur plusieurs grands modèles d'IA.
Selon la charge de travail, OpenAI affirme que Jalapeño a délivré environ 1,5 à 1,9 fois plus de performance par watt et une latence significativement plus faible. La puce est conçue spécifiquement pour l'inférence plutôt que pour l'entraînement de l'IA.
Le responsable matériel d'OpenAI, Richard Ho, a déclaré que ces gains d'efficacité pourraient éventuellement se traduire par des prix de jetons plus bas pour les clients à mesure que la puce sera produite à grande échelle.
Pourtant, OpenAI ne prévoit pas de remplacer Nvidia entièrement. L'entreprise a indiqué qu'elle continuerait à utiliser les accélérateurs Nvidia et le matériel d'autres partenaires pour l'entraînement et l'inférence.
Cramer a rejeté l'idée que chaque nouvelle puce d'IA représente un concurrent sérieux à Nvidia. Il a déclaré entendre régulièrement des affirmations sur des puces supérieures, mais continue de ne voir « aucun véritable concurrent » à Nvidia à grande échelle.


Jalapeno d'OpenAI est un signal que l'industrie de l'IA entre dans l'ère du « contrôle complet de la chaîne ».
La stratégie consistait auparavant à rester dans son domaine et à se concentrer.
Les entreprises de modèles entraînaient des modèles. Les entreprises de puces fabriquaient des puces. Les entreprises de données collectaient des données.
Cette époque est révolue.
OpenAI a commencé comme un laboratoire purement dédié aux modèles. Maintenant, ils conçoivent des siliciums personnalisés et optimisent l'ensemble des systèmes autour de leurs charges de travail réelles.
Cette semaine, nous avons également vu @Figure_robot s'engager dans la couche de données et lancer Index, leurs propres efforts de collecte de données couvrant 108 pays.
Tout le monde monte et descend la chaîne.
Une partie de cela vise probablement à renforcer des douves étroites, une autre à réduire les coûts, et une autre encore à justifier les valorisations.

OpenAI a conçu une puce d'inférence personnalisée (Jalapeño) et est passé du premier RTL au tapeout en 9 mois.
Lorsque je concevais et réalisais le tapeout de SoC complexes, 18 à 24 mois du RTL au tapeout étaient la norme. La vérification et la conception physique consommaient la majeure partie de ce délai.
L'écriture de Verilog/VHDL par l'IA est un peu attendue avec tous les agents de codage. La partie impressionnante était que l'équipe @OpenAI a utilisé un modèle interne avec un retour rapide sur la qualité de la synthèse (QoR) et une vérification robuste pour optimiser le RTL
L'IA compresse vraiment le cycle de conception... c'est bénéfique pour tout le monde. Nous verrons plus de silicium et plus d'innovation. Maintenant, la différenciation se déplace vers la sécurisation de la capacité TSMC et l'allocation HBM..
Plus de puces peuvent être conçues... mais moins peuvent être produites à grande échelle.



OpenAI prend au sérieux la maîtrise de toute la pile AI
Jalapeño passe enfin des tests à l'infrastructure d'OpenAI
> plus de travail AI par watt
> débit plus élevé avec une latence plus faible
> réponses plus rapides de ChatGPT et Codex
ceci n'est que la Gen 1, la Gen 2 est déjà en développement, tandis que la Gen 3 prend forme.
OpenAI dispose déjà des modèles, des utilisateurs et de la demande.
maintenant, elle construit aussi la puissance de calcul sous-jacente.
la vraie question est jusqu'où cela ira lorsque Jalapeño commencera à se déployer à grande échelle dans leur infrastructure.
qu'en pensez-vous, à quoi ressemblera la Gen 2 ?


Depuis l'annonce de Jalapeño, notre premier circuit d'inférence personnalisé, nous l'avons testé ainsi que le système qui l'entoure.
Les résultats montrent une avancée majeure : plus d'intelligence par watt et des réponses plus rapides, offrant à la fois un débit plus élevé et une latence plus faible dans une seule architecture sans sacrifier l'efficacité.
Les premiers tests Jalapeño d'OpenAI indiquent un changement potentiellement significatif dans l'économie de l'inférence : un débit 1,5x à 1,9x supérieur par watt et une latence de bout en bout 1,7x à 3,6x plus faible sur des modèles ouverts. GPT-5.6 Sol aurait également utilisé 54 % de jetons de sortie en moins qu'un concurrent de premier plan sur des tâches de codage.
Le jugement mesuré est que les gains d'efficacité pourraient améliorer l'économie unitaire, mais les benchmarks testés par l'entreprise ne sont pas encore une preuve de coûts agrégés plus faibles. Avec 6,7 milliards de dollars de revenus au T2 contre une perte d'exploitation de 12,3 milliards de dollars, le déploiement à grande échelle et la croissance de la charge de travail compteront plus que la performance annoncée. Ce n'est pas un conseil, juste une analyse.
#OpenAIInferenceCostTest

La première puce d'inférence personnalisée d'OpenAI offre un débit plus élevé, une latence plus faible et une meilleure efficacité dans une seule architecture.
Lorsque le plus grand laboratoire d'IA commence à concevoir son propre silicium, l'économie de l'inférence à grande échelle rencontre un problème.
La couche de calcul est en train d'être reconstruite de zéro.
Depuis l'annonce de Jalapeño, notre premier circuit d'inférence personnalisé, nous l'avons testé ainsi que le système qui l'entoure.
Les résultats montrent une avancée majeure : plus d'intelligence par watt et des réponses plus rapides, offrant à la fois un débit plus élevé et une latence plus faible dans une seule architecture sans sacrifier l'efficacité.


