Qwen3.8-2.4T-A95B: Eleva a disputa pela IA de fronteira

Com 2,4 trilhões de parâmetros, arquitetura Mixture of Experts, 95 bilhões de parâmetros ativos por token e contexto que pode ultrapassar 1 milhão de tokens, o novo Qwen mostra que a disputa entre modelos abertos e proprietários entrou em uma nova fase.

A Alibaba acaba de dar um passo importante na corrida global pela Inteligência Artificial ao disponibilizar os pesos do Qwen3.8-2.4T-A95B, modelo que representa pela primeira vez a chegada de uma soluçao da classe Qwen-Max ao ecossistema de modelos com pesos abertos.

O número que imediatamente chama a atenção é gigantesco: 2,4 trilhões de parâmetros. Entretanto, talvez a informação mais importante esteja escondida na segunda parte de seu nome, A95B. Graças à arquitetura Mixture of Experts (MoE), o modelo não utiliza seus 2,4 trilhões de parâmetros simultaneamente para processar cada token. Aproximadamente 95 bilhões de parâmetros são ativados durante cada passagem, permitindo combinar uma capacidade total gigantesca com um custo computacional por token muito menor do que seria necessário em um modelo denso de tamanho equivalente. A própria Qwen descreve esta geração como a mais capaz de sua família aberta até o momento e afirma que ela foi desenvolvida especialmente para programação, trabalho profissional, pesquisa e tarefas autônomas de longa duração.

2,4 trilhões de parâmetros não significam 2,4 trilhões trabalhando ao mesmo tempo

É importante compreender a arquitetura para não interpretar incorretamente os números. Em um modelo tradicional denso, praticamente todos os parâmetros participam de cada etapa de inferência. No Qwen3.8-2.4T-A95B, a estratégia é diferente. O sistema possui 512 especialistas, mas seleciona apenas 10 especialistas roteados e um especialista compartilhado para cada token. Essa arquitetura permite que diferentes regiões do modelo se especializem em diferentes tipos de informação e tarefas. Em vez de utilizar indiscriminadamente toda a capacidade da rede neural, um mecanismo de roteamento decide quais especialistas são mais apropriados para processar determinado conteúdo. Segundo a especificação oficial, o modelo possui 92 camadas, dimensão interna de 8.192 e uma organização híbrida que combina Gated DeltaNet, Gated Attention e camadas MoE.

Essa abordagem é particularmente interessante porque representa uma mudança na forma como devemos analisar o tamanho dos grandes modelos. Os 2,4 trilhões de parâmetros representam a capacidade total disponível, enquanto os 95 bilhões ativos representam uma aproximação mais útil da quantidade de computação realizada por token. Isso não significa, entretanto, que estamos diante de um modelo de 95 bilhões de parâmetros comum. Todos os especialistas continuam fazendo parte do modelo e seus pesos precisam estar disponíveis no sistema de inferência. O resultado é uma característica típica dos grandes MoEs: o custo computacional ativo é muito inferior ao de um modelo denso com trilhões de parâmetros, mas os requisitos de memória e movimentação dos pesos continuam enormes.

Um modelo aberto que exige infraestrutura de datacenter

É justamente neste ponto que é necessário separar duas ideias frequentemente confundidas: ter acesso aos pesos de um modelo não significa que seja simples executá-lo localmente. Com 2,4 trilhões de parâmetros, o Qwen3.8-2.4T-A95B está muito distante da categoria de modelos que normalmente instalamos em uma única GPU de workstation. Uma conta teórica simples mostra a dimensão do problema: 2,4 trilhões de parâmetros armazenados com dois bytes por parâmetro representam algo próximo de 4,8 TB apenas para os pesos em BF16, sem considerar cache, buffers, estados intermediários e demais estruturas utilizadas durante a inferência. Mesmo representações de menor precisão continuam colocando o modelo na escala de terabytes.

A NVIDIA, que disponibilizou suporte ao modelo já no lançamento, classifica explicitamente sua execução como uma tarefa de computação acelerada em escala de datcenter. Em seus testes iniciais, a empresa utilizou uma plataforma GB300 NVL72, formada por 72 GPUs Blackwell Ultra interligadas em um domínio NVLink de alta velocidade. A NVIDIA reportou, em condições específicas de benchmark e utilizando FP8, throughput superior a 4 mil tokens por segundo por GPU no cenário de máxima vazão e mais de 350 tokens por segundo por usuário em sua configuração de teste. Esses valores não devem ser interpretados como desempenho esperado em qualquer hardware, mas demonstram o nível de engenharia de infraestrutura envolvido na exploração eficiente de um MoE dessa escala.

Isso cria uma situação interessante. O Qwen3.8 é um modelo com pesos disponíveis para download e implantação própria, porém sua escala significa que self-hosting completo continua sendo uma atividade destinada principalmente a empresas, provedores de nuvem, universidades, centros de pesquisa e organizações com clusters de aceleradores. Para a maioria dos desenvolvedores, consumir o modelo através de uma API ou de provedores especializados continuará sendo consideravelmente mais simples do que mantê-lo integralmente em infraestrutura própria.

A nova disputa passa a ser sobre quem conseguirá transformar essa capacidade computacional gigantesca em sistemas eficientes, privados, especializados, sustentáveis e realmente úteis.

A batalha deixa de ser apenas pelo melhor modelo

O lançamento também revela uma tendência maior no mercado de Inteligência Artificial. Durante algum tempo, a discussão foi dominada por uma pergunta simples: qual empresa possui o modelo mais inteligente? A evolução de arquiteturas como o Qwen3.8 sugere que a pergunta está ficando mais complexa.

Precisaremos perguntar qual modelo oferece a melhor relação entre qualidade e custo, qual consegue trabalhar autonomamente durante mais tempo, qual lida melhor com milhões de tokens, qual pode ser executado dentro da infraestrutura de uma organização, qual pode ser especializado para determinado domínio e, principalmente, quem controla os dados, o modelo e a infraestrutura utilizados durante a operação.

Nesse cenário, o Qwen3.8-2.4T-A95B representa mais do que outro lançamento da Alibaba. Ele demonstra que modelos com pesos disponíveis publicamente chegaram a uma escala que, há pouco tempo, parecia reservada aos maiores laboratórios privados do planeta. Não significa o fim dos modelos proprietários, tampouco prova superioridade absoluta sobre eles. Significa algo talvez mais transformador: a fronteira entre IA aberta e IA fechada está ficando cada vez mais estreita.

E quando um modelo com 2,4 trilhões de parâmetros, 95 bilhões ativos por token, mais de 500 especialistas e capacidade para trabalhar com aproximadamente 1 milhão de tokens de contexto pode ter seus pesos baixados e implantados por terceiros, a discussão deixa de ser apenas sobre quem consegue construir a maior Inteligência Artificial.

A nova disputa passa a ser sobre quem conseguirá transformar essa capacidade computacional gigantesca em sistemas eficientes, privados, especializados, sustentáveis e realmente úteis.

Mais informações : https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B

Um comentário em “Qwen3.8-2.4T-A95B: Eleva a disputa pela IA de fronteira”

Deixe um comentário

Este site utiliza o Akismet para reduzir spam. Saiba como seus dados em comentários são processados.