Uma startup desconhecida da Coreia do Sul acaba de superar gigantes como SK Telecom, LG e Upstage em um dos benchmarks de IA mais observados do mundo. A Motif Technologies, fundada há poucos anos, divulgou na quarta-feira que seu modelo de linguagem, o Motif 3, alcançou a pontuação mais alta entre todos os participantes coreanos em um teste global de performance de modelos de IA.
O número: 47 pontos no Artificial Analysis Intelligence Index (AAII), um índice composto que avalia modelos de IA em capacidades como raciocínio, codificação e conhecimento. Para contextualizar, as empresas que ele superou — SK Telecom, LG AI Research e Upstage — são nomes estabelecidos no mercado de IA coreano, com equipes maiores e mais recursos.
O Que é o Motif 3
O Motif 3 é um modelo de linguagem com uma arquitetura que combina vários recursos técnicos avançados. Ele possui 314 bilhões de parâmetros no total, mas ativa apenas 13,2 bilhões para cada pedaço de texto que processa. Isso é possível graças a uma técnica chamada Mixture-of-Experts (MoE), na qual o modelo mantém centenas de "especialistas" internos e seleciona apenas alguns deles para cada tarefa.
Para dar uma ideia da escala: o modelo contém 384 especialistas rotulados, mas usa apenas oito de cada vez. Isso permite que ele tenha uma capacidade enorme de conhecimento sem precisar de tanto poder de processamento para cada consulta.
O Motif 3 também introduz uma nova arquitetura de atenção chamada GDLA (Grouped Differential Latent Attention), que combina dois conceitos existentes — atenção diferencial e atenção latente multi-head — para melhorar a eficiência e reduzir a quantidade de memória necessária para armazenar informações durante o processamento.
Desenvolvido do Zero em Cinco Meses
O que torna a história da Motif particularmente surpreendente é o tempo de desenvolvimento. A empresa afirmou que construiu o Motif 3 inteiramente do zero — desde o pré-treinamento até o pós-processamento — em aproximadamente cinco meses.
Isso incluiu coletar e processar dados de treinamento, projetar a arquitetura do modelo, treiná-lo em uma escala massiva e refinar o resultado com técnicas de pós-treinamento como aprendizado por reforço e destilação multi-professor.
O modelo foi treinado com aproximadamente 12,5 trilhões de tokens — uma unidade de medida que representa pedaços de texto. Para efeito de comparação, isso equivale a mais de 15 trilhões de tokens quando medido com tokenizadores de outras empresas. Os dados incluíram documentos web, conteúdo acadêmico, código de programação, dados matemáticos e conteúdo especializado em coreano e outros idiomas.
Os Números do Benchmark
No AAII, a Motif 3 pontuou 47, ficando à frente de:
- Upstage Solar Open2 — 37 pontos
- SK Telecom A.X-K2 — 35 pontos
- LG AI Research K-EXAONE 2.0 — 31 pontos
Globalmente, o Motif 3 ficou em nono lugar no ranking geral, e em quarto lugar entre modelos de peso aberto (open-weight). Isso é significativo porque significa que o código e os pesos do modelo estão disponíveis publicamente, permitindo que qualquer pessoa o use, modifique e estude.
Nos benchmarks individuais, o Motif 3 apresentou resultados particularmente fortes em tarefas agênticas (onde o modelo precisa tomar decisões e usar ferramentas), raciocínio matemático e geração de código. No SWE-Bench Verified, que avalia a capacidade de resolver problemas reais de software, o modelo pontuou 76,2%, um resultado competitivo com modelos muito maiores.
Os Limites dos Benchmarks
Apesar dos números impressionantes, especialistas alertam para cautela. O AAII não avalia desempenho em coreano, uma das principais exigências do projeto de modelo coreano apoiado pelo governo. E a indústria de IA tem enfrentado crescente crítica sobre a prática de "benchmaxxing" — otimizar modelos especificamente para testes de benchmark, sem necessariamente melhorar o desempenho real.
O AAII é composto por múltiplos benchmarks combinados em um único índice. Dependendo de quais testes são incluídos, o resultado pode variar significativamente. E o teste cobre apenas parte da avaliação total do projeto coreano: os benchmarks representam 40 dos 100 pontos possíveis, com avaliação de especialistas (35 pontos) e avaliação de usuários (25 pontos) ainda por vir.
O governo coreano deve anunciar em breve os resultados completos da segunda rodada de avaliação. Das quatro equipes participantes, apenas três avançarão para a próxima fase.
O Que Significa para a Corrida pela IA
A Motif 3 representa um fenômeno crescente na indústria de IA: pequenas empresas e startups desafiando gigantes com modelos desenvolvidos internamente. Enquanto a atenção global se concentra em OpenAI, Google, Anthropic e Meta, uma série de empresas menores estão produzindo resultados surpreendentes.
O CEO da Motif, Lim Jung-hwan, disse em um comunicado que "no mercado de modelos de IA, fronteiras são insignificantes, e apenas demonstrar performance de classe mundial dá a um modelo nativo seu verdadeiro significado." A empresa planeja continuar desenvolvendo modelos que possam competir de igual para igual com as fronteiras dos Estados Unidos e da China.
A história também levanta questões sobre a eficiência do desenvolvimento de IA. Se uma startup pode construir um modelo competitivo do zero em cinco meses, isso desafia a narrativa de que a corrida pela IA é exclusivamente uma questão de recursos financeiros e escala. Inovação técnica, escolhas arquiteturais inteligentes e dados de treinamento bem curadorados podem compensar, pelo menos em parte, a desigualdade de recursos.
Para o público brasileiro, a lição é clara: a corrida pela IA não é mais uma disputa apenas entre as gigantes americanas e chinesas. Ela está se tornando mais fragmentada, mais competitiva e, potencialmente, mais acessível. E os próximos meses, com os resultados finais do projeto coreano, prometem revelar se a Motif é o início de uma nova tendência ou uma exceção isolada.