tech · mercado · hardware · software

Início › Mercado › Jalapeño: por que a OpenAI, que queima bilhões, decidiu desenhar o próprio chip

Mercado Série Jalapeño 24/09/2026

Jalapeño: por que a OpenAI, que queima bilhões, decidiu desenhar o próprio chip

o primeiro chip de inferência da OpenAI não nasceu de ambição de fabricante, e sim de uma conta — reduzir o custo de servir os modelos e recuperar poder de barganha com quem vende aceleradores.

Jalapeño: por que a OpenAI, que queima bilhões, decidiu desenhar o próprio chip

O que aconteceu

Em 24 de junho de 2026, a OpenAI anunciou o Jalapeño, seu primeiro acelerador de inferência desenhado internamente, em parceria com a Broadcom (NASDAQ: AVGO) e com integração de sistemas pela Celestica. Em 25 de agosto, publicou os primeiros resultados medidos. No fim daquele mês, levou arquitetura e benchmarks para a Hot Chips 2026.

O chip existe e já foi medido — mas em silício de engenharia, nos laboratórios da própria OpenAI. A implantação inicial em data center está prevista para o final de 2026, com ramp-up de produção e cargas comerciais em larga escala ao longo de 2027. Não há teardown independente, nem hardware disponível para equipes externas.

Um detalhe muda toda a leitura do anúncio: segundo dados de mercado não confirmados oficialmente, o Jalapeño não será vendido nem alugado a terceiros. É infraestrutura interna. Alimenta a API da OpenAI e serviços integrados na Microsoft Azure. Não é um produto que gera receita; é um produto que reduz custo. E é por isso que ele precisa ser lido como peça financeira, não como lançamento comercial.

A conta que explica o chip

A OpenAI descreve o Jalapeño como uma forma de obter "maior controle sobre a economia de servir os modelos" e de criar "um caminho de primeira-parte ao lado dos aceleradores que usamos de outros parceiros". Em linguagem direta: quem compra todo o silício de terceiros paga o preço que o fornecedor define.

O ganho de eficiência é o vetor dessa economia. Nos números oficiais, o Jalapeño entrega 1,5 a 1,9x mais trabalho de IA por watt em pico e 1,7 a 3,6x menos latência fim-a-fim que os sistemas comerciais comparados, chegando a 2,1 a 4,1x em cargas interativas. Inferência é hoje o maior custo variável de uma operação de IA, então cada ponto percentual de eficiência vale muito. Dados de terceiros estimam redução de até 50% no custo operacional de processamento frente à compra direta de GPUs equivalentes. É estimativa, não número auditado — mas aponta a ordem de grandeza da aposta.

De onde vem o dinheiro — e para onde ele vai

O contexto em que esse chip aparece é de capital numa escala sem paralelo na indústria de software.

Em 27 de fevereiro de 2026, a OpenAI anunciou US$ 110 bilhões em novo investimento a US$ 730 bilhões pre-money, com US$ 30 bi da SoftBank, US$ 30 bi da NVIDIA e US$ 50 bi da Amazon. Em 31 de março, a rodada fechou com US$ 122 bilhões comprometidos a US$ 852 bilhões post-money. Os dois números se referem ao mesmo ciclo de captação, em momentos diferentes — não devem ser somados. Em meados de setembro, começaram a circular negociações de uma rodada pré-IPO com oferta de US$ 1,2 trilhão, com a empresa tentando chegar a US$ 1,5 trilhão; Sam Altman descartou publicamente um IPO ainda em 2026.

Do outro lado do balanço, estimativas de terceiros apontam mais de US$ 100 bilhões de gasto com compute só em 2026, US$ 856 bilhões projetados em infraestrutura até 2030 e uma queima acumulada de US$ 278 bilhões entre 2026 e 2030. Números dessa natureza circulam em segunda mão e devem ser tratados como projeção, não como fato.

O retrato mais preciso do ponto de partida veio de forma torta: as demonstrações auditadas de 2025 foram obtidas pelo jornalista Ed Zitron e verificadas de forma independente pelo Financial Times, segundo a investigação. Os números: receita de US$ 13,07 bilhões, custos e despesas de US$ 34 bilhões e prejuízo operacional de US$ 20,92 bilhões. O prejuízo líquido de US$ 38,5 bilhões embute uma despesa contábil de US$ 41,55 bilhões sem efeito caixa, o que leva o resultado ajustado para cerca de US$ 8 bilhões. A OpenAI nunca divulgou esses documentos, e os valores por linha não são auditados publicamente. Há conflitos entre fontes, inclusive sobre o prejuízo operacional (US$ 20,1 bi em uma, US$ 20,92 bi em outras). A conciliação oficial só existiria num S-1 na SEC, que não foi apresentado.

O que não tem divergência é a escala da demanda: mais de 900 milhões de usuários semanais no ChatGPT (fev/2026), mais de 50 milhões de assinantes de consumo, mais de 9 milhões de usuários empresariais pagantes, o Codex com 1,6 milhão de usuários semanais e o ChatGPT Ads chegando a US$ 1 bilhão de run-rate anualizado em agosto de 2026. Em setembro, fontes de mercado falavam de um run rate acima de US$ 40 bilhões, contra projeção de receita de US$ 36 bilhões para o ano — mais uma vez, números de terceiros.

O quadro é esse: receita crescendo rápido, prejuízo estrutural grande, e o custo dominante é justamente servir o modelo.

O que o chip ataca é o custo por token — e é aí que a conta encontra o silício

Custo por token não se reduz por decreto. Reduz-se entregando mais trabalho por watt e menos latência dentro de uma máquina específica. E é aqui que a economia do Jalapeño deixa de ser planilha e passa a ser questão física.

Um ganho de 1,5 a 1,9x em trabalho por watt só é verificável quando existe um pacote de silício que o produza. O Jalapeño é um ASIC de inferência de LLM com die de retículo integral (~840 mm²) em 3 nm, 6 pilhas de HBM4 por pacote (216 GiB a 15,4 TB/s) e rating de 700 W, medindo ≤550 W sustentados nas cargas testadas. Escala para 2.048 chips por sistema, 432 TB de HBM4 e 32 PB/s de banda agregada. O BOM não foi divulgado — o chip é de uso interno, e a economia é expressa em custo operacional, não em preço de hardware.

A dependência física, porém, tem consequências de mercado. O desempenho declarado depende de TSMC em 3 nm, de empacotamento avançado de retículo inteiro e de HBM4, um insumo em disputa global em 2026 — a Samsung é apontada como fornecedora sem confirmação oficial, e a própria OpenAI declarou em 11/09/2026 não ter nada novo a anunciar com a Samsung. Se o insumo escasseia, o custo sobe exatamente onde a OpenAI quer economizar. Não existe economia de silício que não passe por uma cadeia de fornecimento que a empresa não controla.

E sem o software, a economia não aparece

Há uma segunda dependência, menos intuitiva: o ganho de eficiência não é uma propriedade do chip isolado. A OpenAI construiu kernels, firmware e stack de serving junto com o silício. O conjunto foi desenhado para lidar com prefill, decode e movimentação de KV cache de uma forma específica, e declara não depender do ecossistema CUDA nas cargas de alta volumetria.

Ou seja: o Jalapeño não pode ser avaliado como componente de catálogo, comprado por qualquer operador e plugado em qualquer pilha. Ele funciona dentro do sistema da OpenAI, sobre os modelos da OpenAI, com a camada de software da OpenAI. A economia de ~50% no custo operacional é resultado do conjunto — e é justamente por isso que nenhum terceiro pode confirmá-la hoje. Os números são auto-reportados, em silício de engenharia, sem medição externa. O que existe de avaliação independente são opiniões de analistas, como a da Yole dizendo à CNBC que um chip de hyperscaler já iguala ou supera a Blackwell em eficiência de inferência.

O que volta para o mercado

O efeito mais imediato do Jalapeño não é a redução de custo — que só começa a valer em escala em 2027 —, mas a barganha. A OpenAI mantém hoje um portfólio deliberado de fornecedores (Microsoft, NVIDIA, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy, SoftBank) e descreve a estratégia como usar "sistemas premium onde a capacidade importa mais e otimizar eficiência onde escala e custo pesam mais", de modo a "manter disciplina de preços quando as condições de mercado mudam". Um caminho de primeira-parte é o que dá lastro a essa frase.

O mercado já precifica esse volume, ainda que em estimativas: o UBS estimaria 150 mil unidades em 2026 e 600 a 700 mil em 2027; na teleconferência de resultados da Broadcom de 02/09/2026, o Jalapeño aparece como 1,3 GW em 2027, com projeção de mais de 5 GW de XPUs para a OpenAI em 2028. E há um risco pouco discutido: segundo o The Decoder, teria sido a Broadcom quem exigiu que a Microsoft garantisse a compra de cerca de 40% da produção inicial. Nenhuma das empresas confirmou, e o valor total do lote não foi divulgado.

Vale também corrigir um número que circulou muito. Os US$ 250 bilhões de garantia da NVIDIA eram negociação noticiada em julho de 2026. O acordo final, registrado na SEC em 17 de agosto de 2026, limita a obrigação agregada da NVIDIA a US$ 105 bilhões, cobrindo cerca de 4,25 GW com opção para mais ~3,8 GW, com entrada em vigor por fases a partir do ano fiscal de 2029 e encerramento caso a OpenAI obtenha rating de crédito satisfatório. É um número regulatório, não jornalístico — e mostra que a frota continuará híbrida: o Jalapeño complementa GPUs de terceiros, não as substitui.

Sobre o efeito do anúncio nas ações, a investigação é explícita: não dá para isolar. O anúncio caiu em 24/06/2026, um dia depois de o índice de semicondutores SOX cair 7,87% com os 30 componentes em queda. No dia do anúncio a Nasdaq caiu 0,43% e a NVIDIA cerca de 0,26%; no dia seguinte, a NVIDIA caiu ~2%, mas o balanço da Micron saiu no mesmo dia — o que impede atribuir a diferença ao Jalapeño. Da Broadcom, sabe-se da alta de 3,4% na manhã do anúncio.

O fechamento é este: a OpenAI não entrou no negócio de chips para vender chips. Entrou para deixar de ser tomadora de preço num insumo que é o seu maior custo variável. O Jalapeño é, ao mesmo tempo, uma peça de engenharia e uma peça de negociação — e o que se pode medir dele até agora é o que a própria empresa mediu.

Veja também

Jalapeño: o ASIC de retículo inteiro que a OpenAI desenhou para não movimentar dados

A estrutura física citada aqui como pré-requisito da economia — die de ~840 mm², 6 pilhas de HBM4, racks e topologia — está detalhada lá, incluindo a cadeia de fornecimento e o que continua sem confirmação.

O software que faz o Jalapeño funcionar — e que ninguém de fora pode medir

Se a economia só existe dentro da pilha completa, esse texto explica qual pilha é essa, quais benchmarks foram usados e por que as medições permanecem auto-reportadas.

Fontes

  • OpenAI — "OpenAI and Broadcom unveil LLM-optimized inference chip" — 24/06/2026 — anúncio, Broadcom, Celestica, escala gigawatt.
  • OpenAI — "Jalapeño's first results show industry-leading speed and efficiency in AI inference" — 25/08/2026 — 1,5–1,9x trabalho/watt; 1,7–3,6x latência; 700 W/≤550 W.
  • OpenAI — "The full stack behind abundant intelligence" (Sarah Friar) — 25/08/2026 — tese de sistema integrado e portfólio de compute.
  • OpenAI — "Scaling AI for everyone" — 27/02/2026 — US$ 110 bi a US$ 730 bi pre-money; 900M usuários semanais.
  • OpenAI — "OpenAI raises $122 billion…" — 31/03/2026 — US$ 122 bi a US$ 852 bi post-money.
  • OpenAI — "A milestone in expanding access to AI" — 31/08/2026 — ChatGPT Ads a US$ 1 bi de run-rate.
  • SEC — registro do acordo NVIDIA–OpenAI — 17/08/2026 — obrigação agregada limitada a US$ 105 bi.
  • Broadcom — teleconferência de resultados do 3º tri fiscal — 02/09/2026 — 1,3 GW em 2027; >5 GW em 2028.
  • CNBC — 31/03/2026 — rodada de US$ 122 bi; 1,3 GW de capacidade Jalapeño em 2027.
  • Ed Zitron / Financial Times — demonstrações auditadas de 2025 — receita, custos e conciliação do prejuízo.
  • The Decoder — 2026 — garantia de ~40% da produção inicial pela Microsoft (não confirmada).
  • UBS (citado em segunda mão) — 2026 — 150 mil unidades em 2026; 600–700 mil em 2027.
  • ServeTheHome / DataCenterDynamics — 2026 — die, HBM4, potência, racks e topologia.
  • CNBC (Yole, Omdia) — 2026 — avaliações de analistas sobre eficiência de inferência.
  • Dados de bolsa — 23–25/06/2026 — comportamento de SOX, Nasdaq, NVDA e AVGO no anúncio.
  • Dados de pesquisa externa fornecida pelo usuário, sem URL — 24/09/2026 — queima de US$ 278 bi, compute >US$ 100 bi em 2026, ~50% de economia operacional, chip não comercializado. Requer verificação.

Nota de produção

Conteúdo produzido a partir de um dossiê de investigação com fontes citadas, com apoio de assistência de IA e revisão editorial humana antes da publicação. Não houve acesso ao chip nem às demonstrações financeiras da OpenAI; nenhuma medição própria foi feita. Números de terceiros, projeções de bancos e declarações da empresa estão identificados como tais ao longo do texto.

Explore também