
#OpenAIInferenceCostTest
About OpenAIInferenceCostTest
OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio
Popolari
Più recenti
OpenAIInferenceCostTest Post popolari
#OpenAIQ2LossWidens
Le aziende in rapida crescita non diventano sempre grandi imprese.
OpenAI continua a crescere, ma anche le perdite aumentano. Anthropic sta seguendo una strada diversa mostrando i primi segni di redditività. I ricavi fanno notizia.
L'economia sostenibile di solito decide chi vince la maratona. Cosa conta di più per te oggi, la crescita o la redditività?

APPENA ARRIVATO: Probabilità che Anthropic faccia un'IPO superiore alla valutazione di $SPCX di SpaceX, che ha raggiunto 1,77 trilioni di dollari.

Tutta l'attenzione intorno a Jalapeño sembra concentrata sulle prestazioni rispetto a Nvidia, ma la velocità ingegneristica dietro è davvero notevole. Alcuni punti salienti dal talk di @hotchipsorg:
1. Costruire chip personalizzati richiedeva enormi eserciti di ingegneri e tempi pluriennali. OpenAI è passata dal codice RTL iniziale al tapeout in soli 9 mesi usando XLS (un linguaggio simile a Rust per hardware di Google) e co-design guidato dall'AI.
2. Un ciclo AI ha preso un kernel grezzo, appena funzionante (DeepSeek) con un'efficienza dello 0,31% e lo ha ottimizzato autonomamente fino all'88,94% del limite fisico del chip in meno di 2 giorni.
3. Il codice generato dall'AI ha funzionato fino a 1,8 volte più velocemente su blocchi critici rispetto a implementazioni ottimizzate a mano da ingegneri kernel di livello mondiale.
4. L'AI ha fatto più che scrivere software per il chip. Ha ottimizzato i circuiti hardware fisici prima del tapeout.
Ancora una volta, questo non è un gioco a somma zero né un effetto negativo netto per Nvidia. Gli ASIC personalizzati sbloccano efficienze di servizio assurde per carichi di lavoro specializzati e amplieranno la torta totale del calcolo per l'intera industria.
Da quando abbiamo annunciato Jalapeño, il nostro primo chip di inferenza personalizzato, lo abbiamo testato insieme al sistema che lo circonda.
I risultati mostrano un grande progresso: più intelligenza per ogni watt e risposte più rapide, offrendo sia una maggiore capacità di elaborazione che una latenza inferiore in un'unica architettura senza sacrificare l'efficienza.

OpenAI afferma che il suo nuovo chip AI Jalapeño potrebbe ridurre significativamente il costo di esecuzione dell'intelligenza artificiale, ma Jim Cramer (@jimcramer) rimane scettico sul fatto che rappresenti una seria minaccia per Nvidia ($NVDA).
Jalapeño è il primo chip di inferenza personalizzato di OpenAI ed è stato sviluppato con Broadcom ($AVGO). L'azienda prevede di iniziare a utilizzarlo internamente entro la fine del 2026, con una produzione che dovrebbe aumentare ulteriormente nel 2027.
Il CEO di OpenAI, Sam Altman (@sama), ha descritto il chip semplicemente dicendo: “Abbiamo creato un chip ed è veloce.” L'azienda sta già lavorando su versioni di seconda e terza generazione.
OpenAI afferma che Jalapeño può offrire sia una maggiore capacità di elaborazione che una latenza inferiore, una combinazione difficile da ottenere. I suoi benchmark interni hanno mostrato prestazioni migliori per watt rispetto ai sistemi GB200 e GB300 di Nvidia su diversi grandi modelli AI.
A seconda del carico di lavoro, OpenAI sostiene che Jalapeño ha fornito circa 1,5x a 1,9x più prestazioni per watt e una latenza significativamente inferiore. Il chip è progettato specificamente per l'inferenza piuttosto che per l'addestramento AI.
Il dirigente hardware di OpenAI, Richard Ho, ha detto che questi guadagni di efficienza potrebbero eventualmente tradursi in prezzi per token più bassi per i clienti man mano che il chip entra in produzione.
Tuttavia, OpenAI non prevede di sostituire completamente Nvidia. L'azienda ha dichiarato che continuerà a utilizzare acceleratori Nvidia e hardware di altri partner sia per l'addestramento che per l'inferenza.
Cramer ha respinto l'idea che ogni nuovo chip AI rappresenti un concorrente significativo per Nvidia. Ha detto di sentire regolarmente affermazioni su chip superiori ma continua a non vedere “veri concorrenti” di Nvidia su larga scala.


Jalapeno di OpenAI è un segnale che l'industria dell'AI sta entrando nell'era del “possedere l'intero stack”.
Il manuale prevedeva di restare nel proprio ambito e concentrarsi.
Le aziende di modelli addestravano modelli. Le aziende di chip producevano chip. Le aziende di dati raccoglievano dati.
Quell'era è finita.
OpenAI è iniziata come un laboratorio puro di modelli. Ora progettano silicio personalizzato e ottimizzano l'intero sistema intorno ai loro carichi di lavoro effettivi.
Questa settimana abbiamo anche visto @Figure_robot muoversi nel livello dati e lanciare Index, i loro sforzi di raccolta dati che coprono 108 paesi.
Tutti stanno muovendosi su e giù per lo stack.
Parte di questo probabilmente serve a rafforzare fossati sottili, parte a ridurre i costi, parte a giustificare le valutazioni.

OpenAI ha realizzato un chip di inferenza personalizzato (Jalapeño) e ha impiegato 9 mesi dal primo RTL al tapeout.
Quando progettavo e realizzavo SoC complessi, 18-24 mesi dal RTL al tapeout erano la norma. La verifica e il design fisico consumavano la maggior parte di quel tempo.
L'AI che scrive Verilog/VHDL è un po' prevedibile con tutti gli agenti di codifica. La parte impressionante è stata... il team @OpenAI ha utilizzato un modello interno con feedback QoR rapido e verifica robusta per ottimizzare l'RTL
L'AI sta davvero comprimendo il ciclo di progettazione... è un bene per tutti. Vedremo più silicio e più innovazione. Ora la differenziazione si sposta sulla sicurezza della capacità TSMC e sull'allocazione HBM..
Si possono progettare più chip... ma meno possono essere prodotti su larga scala.



OpenAI sta diventando seria nel possedere l'intero stack AI
Jalapeño sta finalmente passando dai test all'infrastruttura di OpenAI
> più lavoro AI per ogni watt
> maggiore throughput con latenza inferiore
> risposte più veloci di ChatGPT e Codex
questa è solo la Gen 1, la gen 2 è già in sviluppo, mentre la Gen 3 sta prendendo forma.
OpenAI ha già i modelli, gli utenti e la domanda.
ora sta costruendo anche il calcolo sottostante.
la vera domanda è fino a che punto arriverà quando Jalapeño inizierà a scalare su tutta la loro infrastruttura.
cosa pensi che sarà la Gen 2?


Da quando abbiamo annunciato Jalapeño, il nostro primo chip di inferenza personalizzato, lo abbiamo testato insieme al sistema che lo circonda.
I risultati mostrano un grande progresso: più intelligenza per ogni watt e risposte più rapide, offrendo sia una maggiore capacità di elaborazione che una latenza inferiore in un'unica architettura senza sacrificare l'efficienza.
I primi test Jalapeño di OpenAI indicano un potenziale cambiamento significativo nell'economia dell'inferenza: da 1,5 a 1,9 volte più throughput per watt e da 1,7 a 3,6 volte minore latenza end-to-end su modelli open. Si dice inoltre che GPT-5.6 Sol abbia utilizzato il 54% in meno di token di output rispetto a un concorrente leader nei compiti di coding.
Il giudizio misurato è che i guadagni di efficienza potrebbero migliorare l'economia unitaria, ma i benchmark testati dall'azienda non sono ancora una prova di costi aggregati inferiori. Con 6,7 miliardi di dollari di ricavi nel Q2 contro una perdita operativa di 12,3 miliardi, la distribuzione su larga scala e la crescita del carico di lavoro saranno più importanti delle prestazioni di punta. Non è un consiglio, solo un'analisi.
#OpenAIInferenceCostTest

Il primo chip di inferenza personalizzato di OpenAI offre maggiore throughput, latenza inferiore e migliore efficienza in un'unica architettura.
Quando il più grande laboratorio di AI inizia a progettare il proprio silicio, l'economia dell'inferenza su larga scala ha un problema.
Il livello di calcolo viene ricostruito da zero.
Da quando abbiamo annunciato Jalapeño, il nostro primo chip di inferenza personalizzato, lo abbiamo testato insieme al sistema che lo circonda.
I risultati mostrano un grande progresso: più intelligenza per ogni watt e risposte più rapide, offrendo sia una maggiore capacità di elaborazione che una latenza inferiore in un'unica architettura senza sacrificare l'efficienza.


