O software que faz o Jalapeño funcionar — e que ninguém de fora pode medir
o primeiro chip da OpenAI não foi desenhado como hardware de catálogo, e sim como parte de uma pilha — kernels, serving, rede e armazenamento próprios —, e é essa camada que transforma especificações em tokens por watt; o problema é que todos os números dela saem de dentro da própria OpenAI.
O que a OpenAI afirma ter construído
A frase que resume o Jalapeño não é sobre silício. É esta, da própria empresa: "usamos IA para desenhar o chip, e desenhamos o chip para que a IA pudesse programá-lo".
Do lado do software, isso significa três coisas concretas. Primeiro, que o chip foi projetado "blank-slate" com foco em kernels, nos padrões de atendimento de chamadas de API e na movimentação de KV cache — os detalhes operacionais de servir um modelo de linguagem, não de treinar um. Segundo, que firmwares e kernels foram portados e otimizados nativamente para a stack de serving da OpenAI, com um modelo de programação espacial desenhado estritamente para inferência de LLM. Terceiro, que o conjunto declaradamente não depende do ecossistema CUDA para as cargas de alta volumetria — a diferença mais política do projeto, porque CUDA é o que hoje prende praticamente todo o mercado de inferência ao silício da NVIDIA.
Entre as otimizações nativas citadas por fontes de terceiros estão a decodificação especulativa e o armazenamento agressivo de KV cache diretamente nos núcleos. Do lado do desenvolvimento, o ciclo entre o primeiro RTL funcional e a produção foi de 9 meses — a OpenAI atribui parte disso a modelos internos que ajudaram a projetar e a dar bring-up ao chip, com relatos de terceiros sobre modelos operando diretamente em Verilog, sem traduções intermediárias.
É um ciclo fechado e raro na indústria: IA desenha silício, silício roda IA.
Cada afirmação de software tem um endereço físico
Software de inferência não existe no ar. Cada promessa da pilha do Jalapeño aponta para um pedaço específico de hardware — e é isso que impede avaliar as duas camadas separadamente.
"KV cache mantido local" só é possível porque o pacote carrega 6 pilhas de HBM4, totalizando 216 GiB a 15,4 TB/s. Manter o estado do modelo junto dos núcleos exige, literalmente, banda de memória suficiente para não haver espera — e é por isso que a fase de decode, limitada por banda, é o gargalo que a arquitetura ataca. Em escala de sistema, isso vira 432 TB de HBM4 e 32 PB/s de banda agregada em 2.048 chips.
"Domínio grande" de rede só existe porque o pod é um Clos de 2 saltos "meio achatado" sobre switches Broadcom Tomahawk 6, com 200 GB/s por processador, ligando 128 ASICs por rack (16 bandejas "Vindaloo" de 8 chips, mais um rack host com 16 bandejas de CPU) até 2.048 ASICs num pod de 16 racks. A arquitetura do chip minimiza movimento de dados dentro do die; a topologia de rede minimiza o movimento entre chips. São a mesma decisão em duas escalas.
"Trabalho por watt" só é uma unidade comparável porque existe um TDP declarado: 700 W de rating, com até 550 W medidos nas cargas testadas. Sem esse denominador, a métrica escolhida pela OpenAI para se posicionar seria incomparável — e é exatamente por isso que a empresa insiste nela.
"Programação espacial" só faz sentido porque o chip é um ASIC de retículo integral (~840 mm²) em 3 nm, com arquitetura NUMA espacial: os recursos de memória são endereçáveis e posicionáveis, o que permite ao software decidir onde o estado do modelo mora. Um chip de propósito geral teria que esconder essa decisão do programador; aqui ela é a interface.
E a razão de tudo isso ser assim está nas cargas-alvo: agentes que encadeiam muitos passos. Um agente mantém contexto longo, acumula KV cache a cada passo e passa a maior parte do tempo em decode, não em prefill. Uma arquitetura pensada para essa carga é diferente de uma pensada para um prompt único — e é essa a premissa que a OpenAI diz ter usado para projetar o chip do zero.
Os números: o que foi medido, com que régua, e por quem
O Jalapeño tem resultados publicados desde 25 de agosto de 2026, e a régua escolhida foi um benchmark público: o InferenceX, da SemiAnalysis, que mede o processo completo de servir uma requisição e normaliza pelo rating de potência publicado de cada acelerador. A OpenAI posiciona o chip na fronteira de Pareto de desempenho por watt × latência nos três modelos testados.
Modelos usados nos testes públicos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T — ou seja, modelos de dentro e de fora da OpenAI, o que é um sinal relevante de que a arquitetura não foi ajustada a uma única família. Amostras de engenharia já haviam rodado GPT-5.3-Codex-Spark em laboratório em junho, e a empresa afirma que, em testes internos, a vantagem aumenta com modelos de fronteira da própria OpenAI.
Os números oficiais: 1,5 a 1,9x mais trabalho de IA por watt em pico, 1,7 a 3,6x menos latência fim-a-fim e 2,1 a 4,1x em cargas interativas. Na apresentação da Hot Chips, segundo dados de terceiros, aparecem 3,4 a 3,8x menos tempo até o último token, com 694 tokens/s por usuário único contra 182 tokens/s dos rivais — além de mais de 700 tokens/s por usuário em concorrência única e picos de até 1.500 tokens/s em modelos menores.
Agora a ressalva, que é o ponto mais importante deste texto: todos esses números vêm de execuções da própria OpenAI, em silício de engenharia. Não há medição independente, porque o hardware não está disponível para equipes externas. O que existe de avaliação de fora são opiniões de analistas, não testes: a Yole disse à CNBC que um chip de hyperscaler já iguala ou supera a Blackwell em eficiência de inferência, e a Omdia classificou o resultado como impressionante. São declarações qualificadas de quem também não mediu.
Isso não invalida os resultados. Uma empresa medir seu próprio chip num benchmark público de terceiros, com modelos abertos, é mais verificável do que medir com régua própria. Mas significa que a afirmação correta, hoje, é: a OpenAI reporta esses números. Não que eles tenham sido confirmados.
O software por trás do software
O Jalapeño não é a única peça de software própria que a OpenAI construiu para viabilizar a operação.
O Habitat, plataforma de armazenamento online da empresa, serve mais de 70 milhões de requisições por segundo, para mais de 1 bilhão de pessoas por semana, em cerca de 40 regiões, com mais de 500 PB — e passou por uma migração de Python para Rust, com camada de banco sobre Azure Cosmos DB. O MRC (Multipath Reliable Connection), protocolo de rede co-desenvolvido com AMD, Broadcom, Intel, Microsoft e NVIDIA e publicado no Open Compute Project, usa redes multi-plane, packet spraying adaptativo e source routing estático para resiliência no treinamento.
Nenhum dos dois é "do Jalapeño". Mas os três juntos mostram o mesmo padrão: uma empresa que passou a construir a própria camada de infraestrutura em vez de depender de fornecedores para cada nível.
Do lado das dependências de terceiros dentro do Jalapeño, a resposta é desconfortavelmente curta: não divulgado. Não há confirmação pública sobre frameworks ou compiladores suportados (PyTorch, Triton, JAX ou compilador próprio), nem SDK, nem acesso externo. O chip é de uso estritamente interno — alimenta a API da OpenAI e serviços integrados na Microsoft Azure, segundo dados de mercado não confirmados oficialmente. Fora dele, a OpenAI segue usando Oracle Cloud Infrastructure, Azure, NVIDIA GB200 (as usadas em Abilene) e Azure Cosmos DB.
O que decidiria a leitura para o mercado
A eficiência de software é o que dá sentido econômico ao chip. Se a OpenAI entrega 1,5 a 1,9x mais trabalho por watt, o custo por token cai — e inferência é hoje o maior custo variável da operação. Estimativas de terceiros falam em até 50% de redução no custo operacional de processamento frente à compra de GPUs equivalentes. Num cenário de mais de US$ 100 bilhões de gasto com compute em 2026 e US$ 278 bilhões de queima acumulada projetada entre 2026 e 2030, isso deixa de ser detalhe técnico e passa a ser variável de sobrevivência econômica.
Mas o caminho entre o benchmark e a economia real depende de escala que ainda não existe. A implantação inicial em data center está prevista para o final de 2026, com ramp-up de produção e workloads comerciais ao longo de 2027; o CNBC e a teleconferência de resultados da Broadcom de 02/09/2026 citam 1,3 GW de capacidade Jalapeño em 2027, com projeção de mais de 5 GW de XPUs para a OpenAI em 2028. Estimações de banco (UBS, citadas em segunda mão) falam em 150 mil unidades em 2026 e 600 a 700 mil em 2027. Nada disso substitui a medição que só será possível quando o hardware estiver em volume.
O que fecha o raciocínio é a natureza da afirmação que a OpenAI está fazendo. Uma empresa que passa anos comprando GPUs diz que desenhou seu próprio silício, que esse silício é mais eficiente por watt, que o software foi co-desenhado e que a economia resultante é de outra ordem. Tudo isso pode ser verdade — mas é uma tese cuja verificação depende de um relatório de produção que a empresa prometeu publicar e ainda não publicou, e de hardware que ninguém de fora pode tocar até 2027.
Até lá, a leitura honesta é esta: o software é o que faz o Jalapeño funcionar, e é exatamente por isso que o Jalapeño não pode ser avaliado de fora. A pilha é a prova e a barreira ao mesmo tempo.
Veja também
Jalapeño: o ASIC de retículo inteiro que a OpenAI desenhou para não movimentar dados
As especificações físicas que sustentam cada afirmação de software deste texto — 6 pilhas de HBM4, Tomahawk 6, die de ~840 mm², 700 W — estão detalhadas lá, junto com a cadeia de fornecimento.
Jalapeño: por que a OpenAI, que queima bilhões, decidiu desenhar o próprio chip
A economia que esse software deveria destravar — custo por token, capital captado, barganha com fornecedores e volumes projetados — está analisada nesse texto.
Fontes
- OpenAI — "Jalapeño's first results show industry-leading speed and efficiency in AI inference" — 25/08/2026 — declaração "IA desenha o chip"; arquitetura de serving; modelos testados; 1,5–1,9x trabalho/watt; 1,7–3,6x latência; 700 W / ≤550 W.
- OpenAI — "OpenAI and Broadcom unveil LLM-optimized inference chip" — 24/06/2026 — 9 meses de RTL à produção; amostras de engenharia; GPT-5.3-Codex-Spark.
- OpenAI — "The full stack behind abundant intelligence" — 25/08/2026 — tese de sistema integrado e portfólio de compute.
- OpenAI — "Rapidly scaling online storage to serve over 1 billion ChatGPT users" — 11/09/2026 — Habitat: 70M req/s, 500+ PB, Python→Rust, Cosmos DB.
- OpenAI — "Unlocking large scale AI training networks with MRC" — 05/05/2026 — protocolo MRC, OCP, multi-plane, source routing.
- ServeTheHome / DataCenterDynamics — 2026 — die, HBM4, racks, topologia, Tomahawk 6, 200 GB/s por processador.
- CNBC (Yole, Omdia) — 2026 — avaliações de analistas sobre eficiência de inferência (opiniões, não medições).
- CNBC — 31/03/2026 — 1,3 GW de capacidade Jalapeño em 2027.
- Broadcom — teleconferência de resultados do 3º tri fiscal — 02/09/2026 — 1,3 GW em 2027; >5 GW em 2028.
- UBS (citado em segunda mão) — 2026 — 150 mil unidades em 2026; 600–700 mil em 2027.
- Dados de pesquisa externa fornecida pelo usuário, sem URL — 24/09/2026 — Codex/GPT-4 no design; Verilog direto; kernels próprios sem CUDA; Hot Chips 2026; >700 e 1.500 tokens/s; economia de ~50% no custo operacional. Requer verificação.
Nota de produção
Conteúdo produzido a partir de um dossiê de investigação com fontes citadas, com apoio de assistência de IA e revisão editorial humana antes da publicação. Não houve acesso ao hardware, aos kernels ou aos testes; nenhum benchmark foi reproduzido por esta redação. Todos os números de desempenho citados são reportados pela OpenAI ou por terceiros identificados, e permanecem sem verificação independente.