Tecnologia

O Gemini 4 foi lançado oficialmente e, finalmente, temos um modelo de ponta em que a escrita é superior à programação

O modelo topo de linha Gemini, que estava em hiato há sete meses e meio, foi finalmente atualizado.

Neste momento, diversas contas relacionadas ao Google anunciaram simultaneamente: o Gemini 4 Argon foi lançado oficialmente.

Além disso, este pode ser o único modelo de ponta recente em que as capacidades de escrita, conhecimento e texto longo são significativamente mais fortes do que as capacidades de programação e de agentes.

Em apenas três dias, até mesmo a convenção de nomenclatura do Gemini 4 mudou, fazendo com que ele se pareça quase com um modelo da OpenAI . A explicação oficial para esse nome é mínima; sabemos apenas que se trata de um codinome interno usado durante a fase de testes e que agora está sendo utilizado na versão final.

Literalmente, representa o elemento 18, o argônio, um gás nobre, o que estabelece um paralelo interessante com o cromo.

Não se apresse em testá-lo no aplicativo Gemini — seguindo a recente narrativa popular de "segurança", o Gemini 4 Argon está disponível atualmente apenas para um número limitado de parceiros de cibersegurança por meio do programa Fairwind. O anúncio oficial não listou um cronograma para o lançamento público completo, afirmando apenas que "estará disponível primeiro para usuários pagos da API e assinantes do Google AI Ultra". Os assinantes regulares terão que esperar um pouco mais.

Imagem

Anteriormente, um modelo supostamente do Gemini 4 vazou em um teste de campo, mas como a autoridade nunca o confirmou oficialmente, ninguém sabe se é um Gemini 4 de verdade ou se contém Fable e Astra. Esses supostos resultados de testes comparativos não são muito confiáveis. Por enquanto, podemos apenas listar os dados divulgados pelas autoridades oficiais (o que também facilita bastante a elaboração deste artigo).

Pelo menos, a julgar pelos resultados oficiais dos testes de desempenho, o Gemini 4 Argon é extremamente potente:

Imagem

Você leu certo. Dos 18 testes listados, o Gemini 4 obteve resultados excelentes em 13 deles.

A maior vantagem aparece no trabalho intelectual. Tanto no teste Vals Finance Agent v2 quanto no Harvey's Legal Agent Benchmark, que envolvem análises financeiras reais e trabalho jurídico real, não é exagero dizer que o Gemini 4 está dois níveis à frente de qualquer outro modelo. Isso não é surpreendente — mesmo em seus piores momentos, ninguém jamais duvidou da capacidade do Gemini em gerar conhecimento global.

Imagem

Outro ponto forte tradicional do Gemini é seu contexto longo. No benchmark GraphWalks, que testa a capacidade de utilizar com eficácia contextos ultralongos que variam de 256k a 1M, o Gemini 4 também superou outros modelos de ponta em mais de 10%.

Uma nova funcionalidade pode explicar essa pista.

Imagem

Gemini 4 Argon aumenta o limite de saída de 64.000 tokens na geração anterior para 1 milhão de tokens. Isso significa que, se sua carteira suportar e o Gemini estiver disposto a se expressar, ele poderá gerar aproximadamente de 700.000 a 1 milhão de caracteres chineses de uma só vez, o que representa uma atualização épica para a construção de redes mentais. A explicação oficial é:

Quando um modelo tem espaço suficiente para pensar profundamente e gera centenas de milhares de unidades lexicais em uma única trajetória de raciocínio, ele traz um nível totalmente novo de profundidade ao raciocínio, resolvendo assim problemas complexos de uma só vez.

Em contrapartida, o desempenho de programação do Gemini 4 é um tanto inconsistente. No DeepSWE v1.1, o teste de compilação de software de ciclo longo mais comumente usado em situações reais, o Gemini 4 alcançou uma pontuação de 77,9%, superando o GPT-6 Astra e Claude Opus 5.5 por quase 4 pontos percentuais.

Imagem

No entanto, o Gemini 4 apresenta baixo desempenho no FrontierSWE v2, que exige a criação de projetos do zero para solucionar problemas, e no Terminal-Bench 4.0, que utiliza terminais Linux para lidar com tarefas complexas.

Podemos resumir as características do Gemini 4 da seguinte forma: Conhecimento/Escrita > Programação > Terminal.

Testes realizados por terceiros também podem corroborar essa avaliação.

No sistema de votação às cegas da Arena.ai, o Gemini 4 ficou em primeiro lugar na Arena de Texto devido às suas altas pontuações em lidar com prompts desafiadores, seguir instruções e escrever de forma criativa. No entanto, na Arena de Código: Desenvolvimento Web e na Arena de Agentes, que se concentram mais em habilidades de engenharia, o Gemini 4 ficou apenas em 8º lugar.

Imagem

De certa forma, as limitações de programação do Gemini são uma bênção disfarçada. A otimização excessiva da programação de agentes parece ter tornado muitos modelos de ponta "incomunicativos", incluindo as quebras de linha generalizadas que persistem desde a era do GPT-5.3 e a gíria misteriosa que começou com o Opus 4.7. Em tais situações, um modelo Gemini que mantém um certo senso estético da linguagem, apesar de suas capacidades de programação limitadas, pode resolver muitos problemas de escrita.

Outra mudança notável é a diminuição significativa na taxa de alucinações.

Imagem

No teste de Análise Artificial, o Gemini 4 apresentou uma taxa de alucinações de apenas 15%, a mais baixa entre todos os modelos de ponta. Isso significa que, ao se deparar com respostas incertas, é mais provável que ele diga "Não sei" do que inventar uma resposta.

Mas para os usuários comuns, a questão mais importante é, obviamente, o preço, e o Google sempre foi muito generoso nesse aspecto.

O preço oficial da API para Gemini 4 Argon é de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com uma taxa de acerto de 5% (US$ 0,10). O anúncio oficial afirma que o preço dobrará após o período inicial de desconto de lançamento, mas, com base na experiência, é muito provável que o período de desconto não termine até o lançamento do modelo da próxima geração.

Imagem

Com base no preço com desconto, o Gemini 4 custa um quinto do preço do GPT-6 Astra e do Fable 5.1, ficando praticamente no mesmo nível do GPT-6.1 Sol e do Sonnet 5.5. Em outras palavras, desde que não haja publicidade enganosa, o Gemini 4 é atualmente o modelo com a melhor relação custo-benefício, oferecendo inteligência de ponta a um preço intermediário.

O lançamento do Gemini 4 Argon também pôs fim a um recorde vergonhoso: por quase meio ano, os benefícios do pacote Google AI Pro foram descritos como "ser capaz de usar o modelo 3 Pro"… Considerando que até mesmo os modelos Flash conseguem superar os modelos Pro após a era do Flash 3.5, esse pacote de assinatura parece bastante irônico, visto que grande parte das pessoas comprava a assinatura apenas pelos 5 TB do Google Drive.

Imagem

Pelo menos agora, o Google finalmente pode promover abertamente seu programa de membros.

Neste momento, gostaria também de dizer algumas palavras sobre um assunto diferente.

Cada um tem seu próprio "dispositivo ideal", e para mim, esse "dispositivo ideal" na área de IA é o Gemini 2.5 Pro. No início do ano passado, os recursos de processamento de texto do 2.5 Pro eram realmente impressionantes, e foi depois disso que incorporei oficialmente a IA ao meu fluxo de trabalho. Mais tarde, quando vi o lançamento do Gemini 3, compartilhei imediatamente no meu WeChat Moments.

Nesse sentido, ninguém quer que o Gemini 4 se destaque mais do que eu.

Imagem

Este é o sonho de um fã de Gêmeos.

No entanto, ainda devemos respeitar as leis objetivas. Como muitos já comentaram, a produção em larga escala é, em última análise, um tipo de indústria manufatureira, como a fabricação de celulares e chips. Não podemos esperar que um modelo que não foi atualizado por muito tempo domine repentinamente o mercado; isso é tão irreal quanto uma fábrica de chips que está presa à tecnologia de 10 nm começar a produzir chips de 2 nm.

A discrepância significativa entre os resultados do benchmark Flash do Gemini 3.8 e o desempenho no mundo real sugere que o Google pode ter implementado algumas "otimizações especiais" para inflar os resultados do benchmark numa tentativa de encobrir o seu constrangimento. Da mesma forma, é altamente questionável se o Gemini 4 atinge níveis de última geração (SOTA) na maioria dos testes de benchmark.

Quase simultaneamente ao anúncio do Gemini 4, a Bloomberg também noticiou que funcionários do Google estavam céticos quanto ao desempenho real do Gemini 4. Eles citaram "fontes internas" que afirmaram que o Gemini 4 teve um desempenho ruim em tarefas do mundo real e "apresentou dificuldades para lidar com certas tarefas de programação".

Imagem

Embora o Google tenha refutado rapidamente as alegações, e alguns funcionários tenham afirmado que o Gemini 4 era bastante bom, podemos provavelmente acreditar que a versão final do Gemini 4 não será tão poderosa quanto os resultados dos testes de benchmark sugerem. Além disso, o tempo necessário para a implementação do Gemini 4 é suficiente para que ChatGPT e Claude passem por diversas iterações.

Em todo caso, o lado positivo é que o lançamento do Gemini 4 Argon significa que o Google finalmente voltou à competição.

Seu limite superior pode não ser muito alto, mas seu limite inferior ainda pode ser garantido. O que precisa ser feito a seguir é recuperar o atraso passo a passo, utilizando os métodos de fabricação de modelos em grande escala.