Prévia do Mistral Large 4: a IA europeia com 1 bilhão de parâmetros
Em 6 de outubro, a Mistral AI lançou uma prévia pública do Mistral Large 4, o maior modelo já desenvolvido pela empresa francesa. Ele possui aproximadamente 1 trilhão de parâmetros, aceita texto e imagens como entrada e já pode ser utilizado via API no Mistral Studio, ao preço de US$ 1,36 por milhão de tokens para entrada e US$ 4,18 para saída. Os pesos, valores numéricos que permitem que o modelo seja baixado e executado independentemente, ainda não estão disponíveis. A empresa prometeu que estarão disponíveis até o final de outubro.
Quase todos os dados de desempenho são da Mistral. A primeira medição independente vem da Artificial Analysis, que atribui à versão de pré-visualização uma pontuação de 38 no seu Índice de Inteligência, em comparação com uma média de 26 entre modelos numa faixa de preço semelhante. O mesmo teste regista uma velocidade de 116 tokens por segundo e uma verbosidade muito elevada, com aproximadamente 200 milhões de tokens gerados para concluir os testes, em comparação com uma média de 81 milhões.
Como é construído e o que os benchmarks da empresa indicam: O Large 4 utiliza uma arquitetura Mixture of Experts, na qual a rede é dividida em vários submodelos especializados e apenas uma parte deles é ativada para cada token. De acordo com a documentação técnica, o total de parâmetros é de 1,05 trilhão, com 49 bilhões ativos por token, além de um codificador visual de 1,6 bilhão. A janela de contexto declarada é de 1 milhão de tokens, enquanto a Artificial Analysis reporta aproximadamente 524.000 para a versão que mediu. A Mistral afirma que treinou o modelo do zero em 3.800 GPUs NVIDIA Grace Blackwell em seus data centers europeus, com dados em mais de 160 idiomas.
Na área de programação, a empresa reporta uma pontuação de 61,7% no DeepSWE v1.1 e de 28,3% no Terminal-Bench 4, dois testes nos quais o modelo precisa resolver problemas de código do mundo real e operar a partir da linha de comando. Em uma avaliação humana às cegas realizada com o Surge AI, com notas de 1 a 5, a prévia obteve 3,74 pontos e ficou em segundo lugar entre cinco modelos, atrás do Claude Opus 5 (4,22). No índice agregado para agentes de programação, a pontuação de 49,8% o colocaria à frente do DeepSeek V4 Pro e do Qwen3.8 Max.
A área em que a Mistral está mais focada é a cibersegurança. O modelo resolveria 93% do Cybench, um conjunto de 40 exercícios retirados de competições de hacking ético, e alcançaria 82% em um teste do Índice de Análise Artificial Cibernética (AICI), que exige a reprodução e correção de uma vulnerabilidade real em software de código aberto. No mesmo teste, segundo o anúncio, modelos fechados como o Claude Opus 5.5 e o GPT-6 Astra ficaram próximos de zero porque se recusaram a realizar a tarefa.
O que falta para que se torne um modelo verdadeiramente aberto?
Até que os pesos sejam liberados, o Large 4 permanece um serviço em nuvem. A Artificial Analysis o classifica atualmente como um modelo proprietário, justamente por não ser possível baixá-lo. Enquanto isso, a Mistral está realizando testes de vulnerabilidade — simulações de ataques para descobrir suas falhas — com empresas de segurança, parceiros selecionados e autoridades governamentais, que estão recebendo uma versão com moderação reduzida. Com a liberação dos pesos, a empresa promete detalhes arquitetônicos, benchmarks adicionais e a metodologia pós-treinamento.
A capacidade de executar o modelo em seus próprios servidores é o principal diferencial da Mistral para profissionais das áreas de cibersegurança, finanças e administração pública. Em relação ao risco de abuso, a empresa afirma uma taxa de rejeição de solicitações ofensivas superior à de todos os modelos abertos testados no JailbreakBench, StrongREJECT e AgentHarm, além de resistência a 93,3% dos ataques no benchmark B3 da Lakera. Esses dados são internos e ainda não foram replicados.
Mistral finalmente especifica que a fase de aprendizado por reforço, a técnica que recompensa o modelo quando ele completa uma tarefa, ainda está em andamento, portanto a versão final pode se comportar de maneira diferente da prévia. O projeto faz parte do plano financiado pela rodada de investimentos Série D de € 3 bilhões concluída pela empresa e, segundo a própria empresa, servirá de base para uma nova série de modelos específicos para diversos setores.

