Depois de revelar o Jalapeño no Hot Chips 2026 e publicar benchmarks comparando o chip com as GPUs da NVIDIA, a OpenAI precisou responder uma pergunta óbvia: para quem é esse acelerador? Em entrevista, Richard Ho, head de hardware da empresa, confirmou que o ASIC é feito para a demanda interna da OpenAI, mas deixou a porta aberta para uma adoção mais ampla — e explicou por que o verdadeiro objetivo do projeto nunca foi vencer a NVIDIA em performance bruta.
"Vamos Ter As Mãos Ocupadas" Atendendo a Nós Mesmos
A resposta de Ho sobre o mercado foi direta: a demanda interna da OpenAI por compute é tão grande que preencher a própria demanda já levará um bom tempo, e essa demanda cresce continuamente.
"Acho que vamos ter as mãos ocupadas apenas fornecendo compute para a OpenAI por um bom tempo. Isso não quer dizer que o chip não possa ser usado em outro lugar. Acredito que pode — mas nossa prioridade é garantir que as necessidades da OpenAI sejam atendidas primeiro."
Ho ainda afirmou que "você poderia usá-lo para qualquer pessoa, sinceramente", deixando claro que a arquitetura não foi desenhada como um produto fechado para um único cliente.
Benchmarks Contra GB200 e GB300
No Hot Chips, a OpenAI divulgou medições do Jalapeño no benchmark InferenceX da SemiAnalysis, comparando o ASIC com as plataformas NVIDIA GB200 e GB300. Os testes usaram o cenário fixo de 8k1k — 8 mil tokens de entrada e 1 mil de saída — e cobriram modelos de pesos abertos e de terceiros:
- GPT-OSS, modelo open-weight da própria OpenAI;
- DeepSeek R1;
- Kimi K2.5.
O objetivo dos números, segundo Ho, era derrubar "a percepção errônea na indústria de que nosso chip de inferência customizado era só para modelos da OpenAI". "Ele é programável e general purpose, não é hard-coded para os modelos da OpenAI", explicou o executivo.
Questionado sobre por que a comparação foi feita contra o Blackwell e não contra a plataforma seguinte, Ho respondeu que foi "porque eram os melhores resultados publicados que conseguimos encontrar" — e revelou que a OpenAI já rodou comparações internas contra a Vera Rubin com resultados favoráveis: "estamos indo muito bem nessas". Na época da implantação real, o chip competirá com Vera Rubin ou até com Vera Rubin Ultra em parte do cronograma.
Eficiência, Não Velocidade Pura
Quando perguntado qual foi a força motriz por trás do design, Ho foi econômico: "foi eficiência". O executivo descreveu a eficiência como "prima da compute", porque em um data center de IA limitado por energia, um motor de inferência mais eficiente representa mais compute efetivo — sem precisar ampliar o orçamento de potência.
Esse raciocínio explica por que o Jalapeño se mostra competitivo mesmo sem ser o chip mais rápido do mercado: o gargalo deixou de ser apenas a die e passou a ser o kilowatt disponível por rack.
Roadmap Multi-Geração e a Parceria Com a Broadcom
O Jalapeño é co-desenvolvido com a Broadcom, parceria anunciada no ano passado, e a OpenAI usou o Hot Chips para apresentar um roadmap de múltiplas gerações do chip. A estratégia coloca a empresa na mesma direção de outros hyperscalers que buscam silício próprio para inferência:
- Amazon + Qualcomm: acordo de US$ 60 bilhões para silício customizado de inferência;
- Meta: chip Iris em produção, com Broadcom como design partner e TSMC na fabricação;
- Alibaba: Zhenwu V900, revelado na Apsara Conference 2026;
- Google: família TPU, com versão híbrida AMD em desenvolvimento.
A diferença da OpenAI está no papel: enquanto os concorrentes vendem silício ou o usam para reduzir custos de nuvem, a OpenAI parte da condição de maior consumidor potencial do próprio chip — e só depois avalia se sobra capacidade para o mercado externo.
Pontos-Chave
- Richard Ho, head de hardware da OpenAI, confirma que o Jalapeño atende primeiro à demanda interna
- Porta para uso externo fica aberta: "você poderia usá-lo para qualquer pessoa"
- Benchmarks no Hot Chips 2026 usaram InferenceX (SemiAnalysis) no cenário 8k1k contra GB200 e GB300
- Chip rodou GPT-OSS, DeepSeek R1 e Kimi K2.5 — prova de que é programável e general purpose
- Driver de design foi eficiência energética, não performance bruta
- Comparações internas contra Vera Rubin e Vera Rubin Ultra já foram executadas
- Desenvolvido com a Broadcom, com roadmap multi-generacional apresentado no Hot Chips 2026
- Contexto: corrida por silício próprio na inferência (Amazon/Qualcomm, Meta Iris, Alibaba Zhenwu, Google TPU)