Jalapeño: o ASIC de retículo inteiro que a OpenAI desenhou para não movimentar dados
o primeiro chip da OpenAI parte de uma premissa única — mover dados é o inimigo — e por isso coloca memória, KV cache e rede dentro da mesma decisão de arquitetura, num die que ocupa o retículo inteiro de 3 nm e dissipa até 700 W.
O que a OpenAI construiu
O Jalapeño, anunciado em 24 de junho de 2026 com a Broadcom e integrado em sistema pela Celestica, não é um processador de propósito geral nem um chip de treinamento. É um ASIC de inferência de LLM — a OpenAI o chama de "Intelligence Processor" —, arquitetado em torno do que a empresa entende de cargas de linguagem: prefill (processar o prompt, limitado por compute) e decode (gerar token a token, limitado por banda de memória), mais a movimentação de KV cache entre as duas fases.
A descrição física é incomum para um acelerador de primeira geração de uma empresa de software. Segundo dados técnicos apresentados na Hot Chips 2026, trata-se de um ASIC com die de retículo integral, na casa de 840 mm², fabricado pela TSMC em classe de 3 nm, em arquitetura espacial do tipo NUMA — memória de acesso não uniforme, com os recursos de memória distribuídos e endereçáveis pelos núcleos conforme a necessidade da carga.
Um dado que circulou errado e precisa ser corrigido: a memória é de 6 pilhas de HBM4 por pacote, totalizando 216 GiB a 15,4 TB/s. A versão de "8 pilhas laterais" não tem fonte que a sustente e foi descartada pela própria investigação. Em escala de sistema, isso vira 2.048 chips, 432 TB de HBM4, 27 EFLOPS em MXFP4 e 32 PB/s de banda agregada — os 32 PB/s são do sistema, não do chip.
A potência é a métrica que a OpenAI escolheu destacar: rating de 700 W por pacote, com potência sustentada medida em até 550 W nas cargas testadas. É um dos poucos números que a empresa confirma diretamente, e não por acaso. Em inferência, o que importa não é FLOPS brutos, e sim trabalho por watt.
Por que a arquitetura é assim — a razão está no software
A decisão de projeto mais reveladora do Jalapeño não é o tamanho do die. É o que ele faz com o estado do modelo.
O chip foi feito para posicionar explicitamente e manter local o estado do modelo, incluindo o KV cache, enquanto ativa a combinação certa de compute, memória e rede para cada fase. Em vez de espalhar o estado por uma hierarquia de memória e buscá-lo a cada passo, o Jalapeño mantém esse estado junto dos núcleos que vão usá-lo. É uma escolha de silício que só faz sentido se você sabe exatamente que carga vai rodar — e a OpenAI sabe, porque escreveu a pilha de serving.
A segunda consequência é tratar a rede como parte da arquitetura, e não como periférico: um "domínio grande" mantém toda a carga dentro de um único sistema conectado, minimizando movimento de dados e atrasos de comunicação entre chips. A terceira é a meta declarada de um acelerador balanceado e fungível, capaz de acompanhar mudanças de arquitetura de modelo — porque modelos de fronteira mudam mais rápido do que o ciclo de um chip.
A origem disso está na declaração oficial: "usamos IA para desenhar o chip, e desenhamos o chip para que a IA pudesse programá-lo". Modelos das gerações anteriores ajudaram a projetar e a dar bring-up ao silício; os mais recentes aceleram otimização e programação. O ciclo entre o primeiro RTL funcional e a produção foi de 9 meses — um recorde citado pela indústria. Dados de terceiros sugerem que modelos internos (ecossistema Codex e variações do GPT-4) foram usados na automação e na caça a bugs, com protótipos avançados operando diretamente em Verilog. É informação não confirmada por fonte primária.
Do lado do software que acompanha o chip, o desenho é "blank-slate", voltado estritamente a inferência de LLM, com foco em kernels, nos padrões de atendimento de chamadas de API e no tratamento do KV cache. Recursos citados incluem decodificação especulativa e armazenamento agressivo de KV cache diretamente nos núcleos, sem dependência declarada do ecossistema CUDA nas cargas de alta volumetria.
Do chip ao pod: como isso se organiza fisicamente
Um ASIC de 700 W não vive sozinho.
Segundo dados técnicos, cada rack leva 16 bandejas "Vindaloo" com 8 ASICs cada — 128 chips por rack — e o rack de ASICs se conecta a um rack host separado, com 16 bandejas de CPU. A rede é um Clos de 2 saltos "meio achatado" sobre switches Broadcom Tomahawk 6, escalando até 2.048 ASICs num pod de 16 racks, a 200 GB/s por processador.
Repare no encadeamento: o "domínio grande" que o software exige só existe porque existe Tomahawk 6 e essa topologia. E o Clos de 2 saltos é uma escolha de custo e de latência — quanto menos saltos, menos movimento de dados, que é exatamente o que a arquitetura do chip tenta evitar na escala do die.
A camada de dados do desempenho é igualmente física. O ganho de eficiência do Jalapeño é medido em tokens por segundo por kilowatt, com TDP nominal de 700 W. Isso significa que a vantagem declarada de 1,5 a 1,9x mais trabalho por watt não é uma propriedade abstrata do silício: ela depende de o chip rodar perto da potência nominal sem estourar o envelope térmico. Num data center de escala gigawatt, cada watt economizado por token se multiplica por milhões de requisições — e é por isso que a OpenAI insiste na métrica.
Onde esse hardware se apoia — e onde ele pode travar
O Jalapeño depende de três elos externos que a OpenAI não controla.
O primeiro é a fundição e o empacotamento. O silício vem da TSMC em 3 nm, e segundo o Tom's Hardware a TSMC faz tanto os wafers quanto o empacotamento avançado — mas a variante de empacotamento (CoWoS-S, L ou R) não foi publicada. Um die de retículo inteiro é, por definição, o caso mais difícil de empacotar: qualquer problema de rendimento ou de capacidade nessa etapa limita o volume.
O segundo é a HBM4. O chip leva 6 pilhas por pacote, e a memória de alta largura de banda está em disputa global em 2026. A Samsung é apontada como fornecedora por fontes de terceiros, sem confirmação oficial — a própria OpenAI declarou em 11/09/2026 não ter nada novo a anunciar com a Samsung. Preço e disponibilidade de HBM4 são, portanto, variáveis do desempenho e do custo deste hardware.
O terceiro é energia e refrigeração. Os sites em questão são de escala gigawatt: o programa Stargate já superou a meta original de 10 GW até 2029, com mais de 3 GW adicionados em 90 dias segundo dados de abril de 2026. Abilene, no Texas, opera em Oracle Cloud Infrastructure com sistemas NVIDIA GB200 e usa closed-loop cooling, sem torres evaporativas tradicionais — o preenchimento inicial de cada prédio equivale a cerca de duas piscinas olímpicas. Vale um alerta de escopo que a investigação corrigiu: o campus SB Energy de PORTS-Pike, em Ohio, não é site do Jalapeño. A NVIDIA garantiu que só computação NVIDIA será usada ali, com PUE de 1,04 citado apenas por agregador e sem confirmação oficial.
E há o contexto que impede tratar o Jalapeño como substituto: a frota continua híbrida. O acordo entre NVIDIA e OpenAI registrado na SEC em 17/08/2026 limita a obrigação agregada da NVIDIA a US$ 105 bilhões, cobrindo cerca de 4,25 GW com opção para ~3,8 GW adicionais, com vigência por fases a partir do ano fiscal de 2029. GPUs de terceiros, como as GB200 usadas em Abilene, seguem na operação — o Jalapeño complementa, não substitui.
O que ainda não se sabe sobre esse hardware
- Não existe teardown nem análise física independente: o deploy em massa só começa no fim de 2026, e não há medição externa de consumo real.
- A variante de empacotamento não foi publicada.
- O fornecedor de HBM4 não é oficialmente confirmado.
- Refrigeração, PUE e comportamento térmico dos clusters do Jalapeño não têm medição, porque os sites ainda não estão em operação.
- Prazos por site e capacidade já instalada não são divulgados — só a projeção de 1,3 GW em 2027, citada pelo CNBC e pela Broadcom.
O que se pode afirmar com segurança é o encadeamento que a investigação sustenta: uma carga de software muito específica — inferência de LLM em duas fases, com estado de modelo que precisa ficar perto dos núcleos — produziu uma arquitetura de silício em que memória, rede e energia foram dimensionadas em conjunto; essa arquitetura só entrega a eficiência declarada dentro de um rack e de um pod específicos; e esse conjunto depende de uma cadeia de fornecimento global que é hoje o gargalo físico mais concreto da IA.
Veja também
O software que faz o Jalapeño funcionar — e que ninguém de fora pode medir
Os kernels, o modelo de programação espacial e os benchmarks que transformam essas especificações em números de desempenho estão lá — junto com a ressalva de que todos foram medidos pela própria OpenAI.
Jalapeño: por que a OpenAI, que queima bilhões, decidiu desenhar o próprio chip
A conta que justifica um chip desse porte — capital captado, queima projetada, custo por token e a garantia registrada na SEC — está detalhada nesse texto.
Fontes
- OpenAI — "OpenAI and Broadcom unveil LLM-optimized inference chip" — 24/06/2026 — design do zero, 9 meses, Celestica, Tomahawk, escala gigawatt.
- OpenAI — "Jalapeño's first results show industry-leading speed and efficiency in AI inference" — 25/08/2026 — prefill/decode, KV cache local, domínio de rede, 700 W / ≤550 W.
- ServeTheHome — "OpenAI Jalapeño ASIC at Hot Chips 2026" — 2026 — die ~840 mm², 6 pilhas de HBM4 / 216 GiB / 15,4 TB/s, sistema de 2.048 chips, racks "Vindaloo", Clos de 2 saltos, Tomahawk 6, 200 GB/s por processador.
- DataCenterDynamics — 2026 — TDP de 700 W, arquitetura e topologia.
- Tom's Hardware — 2026 — TSMC como fundição e empacotadora; variante não publicada.
- Economy Tribune / TokenPost — 2026 — Samsung apontada como fornecedora de HBM4 (sem confirmação oficial).
- OpenAI — "Building the compute infrastructure for the Intelligence Age" — 29/04/2026 — Stargate, +3 GW em 90 dias, Abilene/OCI/GB200, closed-loop cooling.
- SEC — registro do acordo NVIDIA–OpenAI — 17/08/2026 — US$ 105 bi agregados, ~4,25 GW + opção de ~3,8 GW.
- CNBC — 31/03/2026 — 1,3 GW de capacidade Jalapeño em 2027.
- Broadcom — teleconferência de resultados do 3º tri fiscal — 02/09/2026 — 1,3 GW em 2027.
- Dados do campus SB Energy de Ohio — 2026 — campus 100% NVIDIA, não site do Jalapeño.
- Dados de pesquisa externa fornecida pelo usuário, sem URL — 24/09/2026 — TSMC 3 nm, die ~840 mm², NUMA espacial, CoWoS, arquitetura NUMA e implantação no fim de 2026. Requer verificação.
Nota de produção
Conteúdo produzido a partir de um dossiê de investigação com fontes citadas, com apoio de assistência de IA e revisão editorial humana antes da publicação. Não houve acesso físico ao chip nem teardown; nada aqui foi medido, aberto ou testado por esta redação. Especificações de origem técnica e de terceiros estão identificadas como tal, e as lacunas conhecidas estão declaradas no texto.