Xiaomi MiMo V2.6: a Xiaomi entra de vez na disputa pelos modelos abertos de IA

Com modelos de até 1 trilhão de parâmetros, contexto de 1 milhão de tokens, multimodalidade nativa e treinamento por reforço em larga escala, a Xiaomi mostra que sua ambição em inteligência artificial vai muito além de celulares, carros e dispositivos inteligentes.

Quando pensamos na Xiaomi, a primeira associação normalmente é com smartphones, dispositivos IoT ou, mais recentemente, veículos elétricos. Mas a empresa chinesa vem construindo silenciosamente uma operação bastante mais ambiciosa na área de inteligência artificial.

Em setembro de 2026, essa estratégia ganhou um novo capítulo com o lançamento da família Xiaomi MiMo V2.6, composta principalmente pelos modelos MiMo-V2.6-Pro e MiMo-V2.6-Flash, além da variante de inferência acelerada MiMo-V2.6-Pro-UltraSpeed.

A novidade não chama atenção apenas pelo tamanho dos modelos. A Xiaomi combinou arquitetura Mixture of Experts, contexto extremamente longo, entrada multimodal e treinamento por Reinforcement Learning em larga escala. E, talvez mais importante para a comunidade, publicou pesos, relatório técnico e parte importante da infraestrutura utilizada nos experimentos.

Um modelo de mais de 1 trilhão de parâmetros

O principal modelo da família é o MiMo-V2.6-Pro. Ele utiliza uma arquitetura Sparse Mixture of Experts : MoE, com aproximadamente 1,02 trilhão de parâmetros totais, mas apenas cerca de 42 bilhões de parâmetros ativados durante o processamento de cada token.

Essa diferença é importante.

Em um Transformer tradicional, praticamente todos os parâmetros participam de cada inferência. Em um modelo MoE, diferentes especialistas são selecionados dependendo do conteúdo processado. Isso permite aumentar consideravelmente a capacidade total do modelo sem aumentar proporcionalmente o custo computacional de cada token.

O MiMo-V2.6-Pro suporta ainda uma janela de contexto de 1 milhão de tokens e recebe nativamente texto, imagens, vídeo e áudio. Seu encoder visual possui 681 milhões de parâmetros, enquanto a arquitetura de áudio combina um AudioTokenizer de 308 milhões de parâmetros com outro encoder de 127 milhões.

Há também o MiMo-V2.6-Flash, pensado para reduzir o custo de inferência. Ele possui aproximadamente 309 bilhões de parâmetros totais e 15 bilhões ativos, mantendo a mesma janela de contexto de 1 milhão de tokens e as mesmas quatro modalidades de entrada. Ou seja: Flash não significa exatamente um modelo pequeno. Ele continua sendo gigantesco, apenas utiliza uma arquitetura mais econômica.

Um milhão de tokens muda bastante o jogo

A janela de contexto de 1 milhão de tokens talvez seja uma das características mais interessantes para aplicações reais. Em vez de trabalhar somente com algumas páginas de informação, um agente pode manter grandes quantidades de código, documentação, histórico de execução, resultados de ferramentas e outros dados dentro da mesma sessão.

Para engenharia de software, por exemplo, isso permite que um agente analise repositórios muito maiores sem depender exclusivamente de mecanismos externos de RAG para recuperar pequenos trechos a cada interação.

Em aplicações empresariais, o mesmo conceito pode ser usado para trabalhar com documentação extensa, especificações técnicas, contratos, histórico de sistemas, logs ou grandes conjuntos de informações. Isso aproxima cada vez mais o LLM de uma espécie de motor de raciocínio para agentes, e não simplesmente de um chatbot.

A parte mais interessante talvez tenha sido o treinamento

O lançamento também chamou atenção pela forma como a Xiaomi realizou parte do treinamento de Reinforcement Learning. Segundo a empresa, aproximadamente seis dias do processo de RL foram apresentados publicamente, mostrando a evolução do treinamento. Pro e Flash completaram 30 etapas de RL cada, acumulando aproximadamente 750 mil trajetórias.

A Xiaomi informa custos aproximados de US$ 850 mil para o Flash e US$ 2,62 milhões para o Pro nessa etapa, com melhorias significativas nos resultados das tarefas utilizadas durante o treinamento. Esse experimento faz parte de uma estratégia que a empresa chama de busca por Recursive Self-Improvement, ou melhoria recursiva.

A ideia fundamental é interessante: em vez de depender exclusivamente de enormes quantidades de novos dados produzidos por humanos, o modelo executa tarefas, recebe feedback, compara diferentes estratégias e utiliza os resultados para aperfeiçoar o próprio comportamento.

Não significa que o modelo simplesmente “aprenda sozinho” indefinidamente. Existe toda uma infraestrutura envolvendo ambientes controlados, funções de recompensa, verificadores e mecanismos para evitar problemas como reward hacking.

Mas mostra claramente uma mudança na indústria: depois da corrida para aumentar os dados de pré-treinamento, estamos entrando na corrida para aumentar a quantidade e a qualidade da experiência computacional gerada durante o pós-treinamento.

Código, agentes, interfaces gráficas e até robótica

A Xiaomi está posicionando o MiMo V2.6 principalmente como um modelo voltado a tarefas agentivas. Isso inclui desenvolvimento de software, utilização de ferramentas, navegação por interfaces gráficas, automação de aplicações e resolução de tarefas longas envolvendo múltiplas etapas.

A empresa demonstrou, por exemplo, o modelo trabalhando com criação de ambientes 3D no Blender, geração de aplicações, construção de interfaces, criação de vídeos e até controle de um braço robótico Franka Panda utilizando feedback visual. Há também experimentos voltados para pesquisa científica. Em um deles, o MiMo-V2.6-Pro foi utilizado como auxiliar na pesquisa de materiais; em outro, participou da formalização matemática no Lean 4, resultando em milhares de linhas de código verificadas pelo próprio kernel do Lean.

Esses exemplos não significam que um LLM esteja substituindo pesquisadores ou engenheiros. O ponto mais interessante é outro: os modelos estão deixando de ser apenas sistemas que geram respostas para se tornar sistemas capazes de observar um ambiente, executar ações, verificar resultados e tentar novamente. Essa talvez seja a transformação mais importante ocorrendo atualmente no campo da IA generativa.

E os benchmarks?

O MiMo-V2.6-Pro alcançou 46 pontos no Artificial Analysis Intelligence Index, ficando, naquele momento, como o modelo de pesos abertos com maior resultado nessa avaliação. A medição independente também colocou o modelo à frente de outros modelos open-weight presentes no ranking. Esse resultado é relevante, mas precisa ser interpretado corretamente.

Não existe um único benchmark capaz de determinar qual é “o melhor modelo de inteligência artificial”. Desempenho varia bastante dependendo da tarefa, do framework agentivo, das ferramentas disponíveis, da quantidade de contexto, do método de avaliação e até da configuração de inferência.

A própria Xiaomi mostra benchmarks em que o MiMo lidera e outros em que modelos concorrentes permanecem superiores. Portanto, é mais preciso dizer que o MiMo-V2.6-Pro entrou no grupo dos modelos abertos de maior desempenho disponíveis atualmente, em vez de simplesmente declarar que ele é melhor em qualquer situação.

O preço também é parte da estratégia

Outra área onde a Xiaomi decidiu competir agressivamente é preço de API. Para usuários internacionais, a documentação oficial apresenta o MiMo-V2.6-Pro por US$ 0,435 por milhão de tokens de entrada sem cache e US$ 0,87 por milhão de tokens de saída.

No MiMo-V2.6-Flash, os valores caem para aproximadamente US$ 0,14 na entrada e US$ 0,28 na saída. A modalidade Batch API custa metade do preço da inferência em tempo real. A Xiaomi afirma que, considerando modelos com níveis semelhantes de desempenho, o custo do Pro pode chegar a ser dezenas de vezes menor que determinadas alternativas proprietárias. Essa comparação é uma afirmação da própria fabricante e depende naturalmente do modelo, benchmark e workload considerados.

Existe ainda o MiMo-V2.6-Pro-UltraSpeed, serviço que pretende entregar as capacidades do Pro com velocidade de geração até 20 vezes maior, destinado a aplicações nas quais latência é crítica.

Open source ou apenas open-weight?

Aqui existe outro detalhe interessante. Muitos modelos atualmente chamados de “open source” disponibilizam somente seus pesos. O restante do processo que levou até aqueles pesos continua fechado. No caso do MiMo V2.6, a Xiaomi foi consideravelmente além.

Os model cards estão publicados sob licença MIT, e a empresa disponibilizou os pesos do Pro e Flash, relatório técnico, um modelo destilado de 9 bilhões de parâmetros e recursos ligados ao treinamento por Reinforcement Learning.

Segundo a Xiaomi, foram disponibilizados mais de 7 mil ambientes de tarefas para RL, além de componentes para coleta de trajetórias, avaliação de recompensas, otimização das políticas e construção de agent harnesses.

Isso transforma o projeto em algo particularmente interessante para universidades, pesquisadores e empresas que estudam agentes inteligentes e treinamento por reforço.

Dá para executar localmente?

Tecnicamente, sim. O próprio repositório no Hugging Face já mostra utilização com Transformers, vLLM e SGLang, além de indicar a existência de quantizações para ecossistemas como llama.cpp, Ollama e LM Studio.

Mas precisamos colocar “local” em perspectiva. Estamos falando de um modelo Pro com 1,02 trilhão de parâmetros. Mesmo utilizando quantização agressiva, armazenar todos esses pesos exige uma quantidade enorme de memória. O fato de apenas 42 bilhões de parâmetros serem ativados em determinado token reduz principalmente o custo de computação; não significa automaticamente que seja necessário armazenar somente esses 42 bilhões.

Portanto, o Pro é muito mais adequado para servidores com grandes quantidades de GPU ou infraestrutura distribuída. O Flash, com 309 bilhões de parâmetros, é substancialmente menor, mas também continua muito além da categoria de modelos que normalmente colocamos em uma única GPU doméstica.

Para experimentação local, o MiMo-V2.6-Distill-Qwen-9B provavelmente será muito mais interessante, principalmente para pesquisadores interessados em estudar os métodos de Reinforcement Learning publicados junto com o projeto.

O que o MiMo V2.6 realmente representa

Talvez a parte mais importante desse lançamento não seja descobrir se o MiMo ganhou ou perdeu determinado benchmark. O que chama atenção é observar quem está construindo esses modelos. Até poucos anos atrás, a fronteira dos grandes modelos estava praticamente concentrada em empresas especializadas em inteligência artificial e alguns gigantes de nuvem.

Agora uma empresa conhecida mundialmente por fabricar celulares, televisores, eletrodomésticos, dispositivos IoT e veículos elétricos está apresentando um modelo de mais de um trilhão de parâmetros, multimodal, orientado a agentes e disponibilizando boa parte da tecnologia para a comunidade.

Isso também revela uma tendência maior. A próxima disputa talvez não seja simplesmente por quem possui o chatbot que responde melhor.

A verdadeira competição está migrando para modelos capazes de raciocinar por longos períodos, operar ferramentas, controlar computadores, programar, enxergar, ouvir, interagir com ambientes físicos e executar tarefas inteiras com pouca intervenção humana.

Nesse cenário, o MiMo V2.6 coloca a Xiaomi definitivamente entre as empresas que precisam ser acompanhadas de perto na evolução da inteligência artificial.

E talvez seja justamente essa a principal mensagem do lançamento: na atual corrida da IA, novos protagonistas continuam surgindo — e a próxima grande inovação pode não vir de onde estamos acostumados a procurar.


Deixe um comentário

Este site utiliza o Akismet para reduzir spam. Saiba como seus dados em comentários são processados.