A AWS anunciou nesta quarta-feira o Trainium3, a terceira geração do seu acelerador de treinamento de IA, com uma proposta que dispensa comparações de marketing: entregar mais computação por watt consumido. O chip vem acompanhado da prévia do EC2 Trn3 UltraServers, disponível para clientes selecionados, com general availability prevista para o fim do ano.
Depois do Trainium2, a Conta Passou a Ser Energia
A geração anterior, o Trainium2, chegou ao mercado prometendo cerca de 4x mais performance que o Trainium e foi disponibilizado nas instâncias Amazon EC2 Trn2. Com ele, a AWS consolidou o Trainium e o Inferentia como parte do próprio portfólio de silício, já em produção e responsáveis por uma fatia relevante do capex de IA da empresa.
O Trainium3 mantém a lógica, mas muda o indicador principal: em vez de performance isolada por chip, a AWS passa a publicar performance por watt e custo por hora de treinamento — métricas que importam quando a restrição deixou de ser a placa e passou a ser a subestação.
EC2 Trn3 UltraServers: Escala em uma Unidade Só
Os Trn3 UltraServers agrupam múltiplos aceleradores em um único domínio de treinamento, com interconect de alta largura de banda e memória compartilhada entre chips. A ideia é reduzir a fração de tempo gasta com comunicação entre nós — o overhead que consome ciclos caríssimos em treinamentos longos.
- Prévia imediata para clientes de treinamento contínuo, com limites de cota por região;
- Compatibilidade com o mesmo software usado no Trainium2, para não forçar refatoração de containers e pipelines;
- Integração com os serviços de orquestramento já usados em cargas de IA da AWS;
- General availability esperada em dezembro, no calendário do re:Invent.
O Gargalo Agora é Infraestrutura, Não Modelo
O timing do anúncio faz sentido olhando para os números. A Amazon anunciou US$ 220 bilhões em capex de IA, com seus chips Trainium e Inferentia consumindo parte relevante desse orçamento. Em paralelo, a TSMC elevou o capex para US$ 64 bilhões diante da demanda por silício de IA, e hyperscalers seguem disputando capacidade de fabricação, energia e refrigeração.
Nesse cenário, ganhar performance por watt significa exatamente uma de três coisas: mais modelos treinados na mesma conta de energia, o mesmo volume com folga no orçamento, ou a possibilidade de enfiar mais cargas em um data center que já está no limite da rede elétrica.
A Corrida de Silício Além da NVIDIA
O Trainium3 entra em uma lista que cresce a cada trimestre:
- Google TPU e Microsoft Maia, silício próprio dos hiperscalers;
- Meta Iris, que acabou de entrar em produção;
- AMD MI455X e Positron Atlas, como alternativas de GPU e acelerador;
- Qualcomm C1000 e Asimov, reforçados pelo acordo de US$ 60 bilhões entre Amazon e Qualcomm para silício customizado de inferência;
- NVIDIA, ainda referência de mercado, com as famílias atuais e o roadmap de data center.
A diversificação deixou de ser promessa de roadmap e virou prática de compras: nenhum grande operador de IA quer depender de um único fornecedor para treinar, servir e escalar.
Pontos-Chave
- AWS anuncia Trainium3, terceira geração do acelerador de treinamento de IA
- Foco passa de performance por chip para performance por watt e custo por hora de treinamento
- Trainium2 entregou cerca de 4x a geração anterior e roda nas instâncias EC2 Trn2
- Prévia do EC2 Trn3 UltraServers para clientes selecionados; GA esperada em dezembro
- UltraServers reduzem overhead de comunicação entre nós em treinamentos longos
- Contexto: capex de IA de US$ 220 bilhões na Amazon e US$ 64 bilhões na TSMC
- Concorrentes diretos: Google TPU, Microsoft Maia, Meta Iris, AMD MI455X e Qualcomm
- Acordo Amazon-Qualcomm de US$ 60 bilhões reforça a tese de silício customizado