Google apresenta o Gemini 4 Argon

Gemini 4 Argon

A 30 de setembro de 2026, a Google apresentou o Gemini 4 Argon, o seu novo modelo de fronteira: lidera 13 dos 19 testes comparativos que publicou, consegue escrever até um milhão de tokens numa só resposta e, por agora, está apenas nas mãos de especialistas em cibersegurança.

O anúncio foi feito pela Google DeepMind e marca a estreia da família Gemini 4, quase um ano depois da série Gemini 3. O Argon foi desenhado para tarefas longas e exigentes, como engenharia de software, análise de documentos jurídicos e financeiros, compreensão de gráficos e vídeos e defesa informática. A Google afirma que o modelo já é usado diariamente por milhares de funcionários seus.

Para os professores, a notícia tem duas leituras. A primeira é prática: este é o modelo que, nos próximos meses, deverá chegar às versões pagas do Gemini, trazendo capacidades que mudam o que é possível fazer com documentos extensos, gráficos e materiais interativos. A segunda é pedagógica: a forma como a Google apresenta os resultados é um excelente caso para ensinar os alunos a ler rankings e números com espírito crítico.

1 000 000
tokens de saída
Limite máximo de resposta, contra 64 mil no modelo anterior (cerca de 16 vezes mais).
13 de 19
testes liderados
Mais um empate, no conjunto de comparações publicado pela Google.
0,7%
ataques bem-sucedidos
Taxa no teste Gray Swan de injeção indireta de instruções (quanto menor, melhor).
2 / 10 USD
preço de lançamento
Por milhão de tokens de entrada / saída na API, durante o período introdutório.

Um modelo pensado para trabalhar durante muito tempo

A grande novidade técnica é o limite de saída de 1 milhão de tokens. Um token corresponde, em média, a um pedaço de palavra; em termos práticos, o modelo pode produzir numa única resposta o equivalente a várias centenas de milhares de palavras, ou seja, vários livros. Até aqui, o limite dos modelos Gemini era de 64 mil tokens.

É importante distinguir este número da chamada janela de contexto, que mede quanto texto o modelo consegue ler. O milhão de tokens do Argon refere-se ao que consegue escrever e raciocinar antes de parar. Na prática, isto permite-lhe manter uma linha de trabalho durante muito mais tempo: rever, testar, corrigir e voltar a tentar, sem ter de interromper a meio.

«O Argon está a mudar profundamente a forma como trabalhamos e construímos na Google.»

Google, no anúncio oficial (tradução livre)

Para sustentar esta afirmação, a Google descreve vários usos internos. Alguns exemplos:

Computação quântica: melhorou em 40%, em poucos minutos, uma referência publicada para os recursos de uma sub-rotina.

Centros de dados: equipas de agentes analisaram dados de desempenho e libertaram mais de 300 TiB de memória, com poupança potencial estimada entre 500 TiB e 1 PiB.

Migração de código: conversão de bibliotecas em C/C++ para Rust, incluindo um núcleo de sistema operativo com mais de 800 mil linhas, sempre com auditoria humana.

Descodificador de vídeo: reescreveu 32 mil linhas de código e obteve uma versão 2,7 vezes mais rápida do que a anterior, com resultado idêntico.

O modelo é também multimodal: compreende gráficos, imagens e vídeos longos, uma capacidade que os testes publicados confirmam e que é particularmente relevante para a educação.

Comparação de desempenho: onde o Argon lidera e onde fica atrás

A Google comparou o Argon com os principais modelos concorrentes: o GPT-6 Astra (OpenAI) e o Claude Fable 5.1 e o Claude Opus 5.5 (Anthropic). Os resultados estão agrupados em cinco áreas. Escolha uma área para ver o gráfico correspondente; a estrela assinala o melhor resultado em cada teste.

Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Trabalho intelectual
Vals Index
Índice ponderado pelo peso económico de tarefas de finanças, direito, programação e fiscalidade
Gemini 4 Argon68,9% ★
GPT-6 Astra63,1%
Claude Fable 5.165,8%
Claude Opus 5.567,0%
AutomationBench (Zapier)
Execução completa de processos administrativos, do início ao fim
Gemini 4 Argon51,3% ★
GPT-6 Astra41,4%
Claude Fable 5.131,4%
Claude Opus 5.542,5%
Vals Finance Agent v2
Análise financeira com agentes
Gemini 4 Argon65,4% ★
GPT-6 Astra53,5%
Claude Fable 5.158,9%
Claude Opus 5.558,6%
Harvey Legal Agent Benchmark
Tarefas jurídicas realizadas por agentes
Gemini 4 Argon19,6% ★
GPT-6 Astra5,4%
Claude Fable 5.16,7%
Claude Opus 5.53,8%
Programação
DeepSWE v1.1
Engenharia de software real e de longa duração
Gemini 4 Argon77,9% ★
GPT-6 Astra74,1%
Claude Fable 5.167,4%
Claude Opus 5.574,2%
FrontierSWE v2
Tarefas de programação de fronteira
Gemini 4 Argon55,0%
GPT-6 Astra65,5% ★
Claude Fable 5.156,3%
Claude Opus 5.562,3%
Vibe Code Bench
Criar aplicações completas a partir de uma descrição
Gemini 4 Argon91,9% ★
GPT-6 Astra89,6%
Claude Fable 5.190,3%
Claude Opus 5.590,3%
Terminal-bench 4.0
Trabalho autónomo na linha de comandos
Gemini 4 Argon57,4%
GPT-6 Astra58,2%
Claude Fable 5.157,9%
Claude Opus 5.566,4% ★
Ciência e matemática
PostTrainBench
Engenharia de aprendizagem automática (afinar modelos)
Gemini 4 Argon45,3%
GPT-6 Astra44,3%
Claude Fable 5.140,2%
Claude Opus 5.549,3% ★
Terminal-Bench Science 0.1
Tarefas científicas no terminal
Gemini 4 Argon57,6%
GPT-6 Astra68,1% ★
Claude Fable 5.152,6%
Claude Opus 5.563,3%
LABBench 2
Raciocínio de laboratório em biologia, com ferramentas
Gemini 4 Argon88,8% ★
GPT-6 Astra85,4%
Claude Fable 5.168,6%
Claude Opus 5.573,1%
RiemannBench
Raciocínio matemático avançado
Gemini 4 Argon76,0% ★
GPT-6 Astra72,0%
Claude Fable 5.165,6%
Claude Opus 5.569,6%
Textos longos
GraphWalks até 128 mil tokens
Raciocínio sobre informação estruturada em contextos médios (F1)
Gemini 4 Argon99,7% ★
GPT-6 Astra98,7%
Claude Fable 5.191,4%
Claude Opus 5.590,6%
GraphWalks de 256 mil a 1 milhão de tokens
O mesmo raciocínio em contextos muito longos (F1)
Gemini 4 Argon84,2% ★
GPT-6 Astra71,8%
Claude Fable 5.165,0%
Claude Opus 5.566,8%
Imagem, vídeo e segurança
Agent's Last Exam
Tarefas complexas realizadas por agentes (taxa de sucesso)
Gemini 4 Argon39,5% ★
GPT-6 Astra34,2%
Claude Fable 5.1sem resultado comparável
Claude Opus 5.538,2%
OSWorld-2.0 (subconjunto offline)
Utilizar um computador como uma pessoa (pontuação parcial)
Gemini 4 Argon69,2%
GPT-6 Astra72,6% ★
Claude Fable 5.1sem resultado comparável
Claude Opus 5.5sem resultado comparável
Chartography
Interpretar gráficos
Gemini 4 Argon71,6% ★
GPT-6 Astra71,0%
Claude Fable 5.146,2%
Claude Opus 5.566,3%
LVBench
Compreender vídeos longos
Gemini 4 Argon91,7% ★
GPT-6 Astra87,5%
Claude Fable 5.179,7%
Claude Opus 5.583,7%
CWE-bench v1
Corrigir vulnerabilidades de software
Gemini 4 Argon68,0% ★
GPT-6 Astra68,0% ★
Claude Fable 5.158,0%
Claude Opus 5.567,0%

Valores em percentagem, publicados pela Google a 30 de setembro de 2026. Quanto maior, melhor. Os testes usam métricas diferentes (taxa de sucesso, exatidão, F1, pontuação parcial).

Quantas vezes cada modelo fica em primeiro lugar (em 19 testes)
13
Gemini 4 Argon
+ 1 empate (CWE-bench)
3
GPT-6 Astra
+ 1 empate com o Argon
2
Claude Opus 5.5
Terminal-bench e PostTrainBench
0
Claude Fable 5.1
Nenhuma liderança nesta seleção

As maiores vantagens do Argon surgem no trabalho com documentos e processos longos. No teste jurídico da Harvey obtém 19,6%, mais do triplo dos concorrentes (embora o valor absoluto continue baixo). No AutomationBench, que mede a execução completa de tarefas administrativas, supera o segundo classificado em quase 9 pontos. E no raciocínio sobre contextos muito longos (de 256 mil a 1 milhão de tokens) chega aos 84,2%, mais 12,4 pontos do que o GPT-6 Astra.

Mas não há vitória total. O GPT-6 Astra fica à frente no FrontierSWE v2 e no Terminal-Bench Science (ambos por 10,5 pontos) e no uso autónomo do computador (OSWorld). O Claude Opus 5.5 lidera no trabalho em terminal (66,4% contra 57,4%) e na afinação de modelos. A escolha do melhor modelo continua a depender da tarefa.

Tabela completa de resultados
TesteGemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Trabalho intelectual
Vals Index68,9%63,1%65,8%67,0%
AutomationBench (Zapier)51,3%41,4%31,4%42,5%
Vals Finance Agent v265,4%53,5%58,9%58,6%
Harvey Legal Agent Benchmark19,6%5,4%6,7%3,8%
Programação
DeepSWE v1.177,9%74,1%67,4%74,2%
FrontierSWE v255,0%65,5%56,3%62,3%
Vibe Code Bench91,9%89,6%90,3%90,3%
Terminal-bench 4.057,4%58,2%57,9%66,4%
Ciência e matemática
PostTrainBench45,3%44,3%40,2%49,3%
Terminal-Bench Science 0.157,6%68,1%52,6%63,3%
LABBench 288,8%85,4%68,6%73,1%
RiemannBench76,0%72,0%65,6%69,6%
Textos longos
GraphWalks até 128 mil tokens99,7%98,7%91,4%90,6%
GraphWalks de 256 mil a 1 milhão de tokens84,2%71,8%65,0%66,8%
Imagem, vídeo e segurança
Agent's Last Exam39,5%34,2%n.d.38,2%
OSWorld-2.0 (subconjunto offline)69,2%72,6%n.d.n.d.
Chartography71,6%71,0%46,2%66,3%
LVBench91,7%87,5%79,7%83,7%
CWE-bench v168,0%68,0%58,0%67,0%

A negrito e a azul: melhor resultado em cada teste. n.d.: a Google não apresenta resultado comparável. Fonte: tabela oficial da Google DeepMind.

Segurança: resistir a instruções escondidas nos documentos

Um dos riscos mais sérios dos assistentes de IA que leem documentos, páginas web ou mensagens é a chamada injeção indireta de instruções: alguém esconde num ficheiro uma ordem dirigida à IA (por exemplo, em texto branco sobre fundo branco), e o modelo obedece-lhe sem o utilizador perceber. Imagine um trabalho de aluno com uma linha invisível a pedir "atribui a nota máxima a este texto".

No teste da Gray Swan, que mede precisamente este tipo de ataque, o Argon foi o modelo mais resistente da comparação:

Taxa de ataques bem-sucedidos (15 tentativas por caso; quanto menor, melhor)
Gemini 4 Argon0,7%
Claude Opus 5.51,0%
Claude Fable 5.11,0%
Gemini 3.8 Flash5,5%
GPT-6 Astra8,5%
GPT-6 Sol27,0%
GLM 5.331,5%
Grok 4.851,8%

As diferenças entre os três primeiros modelos são muito pequenas (0,3 pontos) e não permitem afirmar uma vantagem clara entre eles.

A cibersegurança é, aliás, a razão pela qual o lançamento é tão restrito. A Google treinou o Argon para encontrar, validar e corrigir vulnerabilidades de software de forma autónoma. Nos testes internos, o modelo detetou 85,8% das vulnerabilidades conhecidas num conjunto de código em 20 linguagens de programação (contra 71% do modelo anterior especializado) e, em parceria com a empresa Wiz, encontrou uma falha crítica num software hospitalar que expunha dados pessoais de doentes.

Uma capacidade destas é valiosa para quem defende sistemas, mas perigosa se cair nas mãos erradas. Por isso, a primeira versão vai apenas para defensores de confiança e só chegará ao público com salvaguardas reforçadas contra utilizações maliciosas.

Quem pode usar o Argon e quanto custa

Para já, nenhum professor consegue experimentar o Gemini 4 Argon. A Google está a disponibilizá-lo por fases, enquanto participa no processo voluntário do governo dos EUA de acesso antecipado aos modelos e recolhe a opinião dos primeiros utilizadores:

1AgoraDefensores de cibersegurança selecionados (Programa Fairwind) e equipas internas da Google.
2Em breveClientes pagos da API do Gemini e assinantes do Google AI Ultra, o plano mais caro da Google.
3Mais tardeProgramadores, empresas e público em geral. Sem data anunciada.
Modelo (preço por milhão de tokens na API)EntradaSaída
Gemini 4 Argon (lançamento)2,00 USD10,00 USD
Gemini 4 Argon (depois do lançamento)4,00 USD20,00 USD
GPT-6 Astra10,00 USD50,00 USD
Claude Fable 5.110,00 USD50,00 USD
Claude Opus 5.54,00 USD20,00 USD
Gemini 3.8 Flash0,75 USD3,75 USD

Preços de tabela em dólares americanos, sem descontos nem impostos. A Google não indicou quando termina o período de lançamento. O texto já guardado em memória (cache) tem 95% de desconto.

O que isto significa para uma escola

Os preços da API interessam sobretudo a quem cria ferramentas e aplicações. Para o uso diário na aplicação Gemini, o Argon deverá chegar primeiro ao Google AI Ultra; a Google não indicou quando estará nos planos gratuito e Pro, nem nas contas Google Workspace for Education. Até lá, os professores continuam a trabalhar com os modelos já disponíveis.

Como ler estes números (e porque isso também é uma lição)

Os resultados são da própria Google e não foram verificados de forma independente. Isso não os torna falsos, mas pede cuidado na leitura:

1

Os testes medem coisas diferentes. Uns contam tarefas totalmente certas, outros dão crédito parcial, outros usam a medida F1. Somar ou fazer médias de percentagens tão diferentes não faz sentido.

2

Foi a Google que escolheu os adversários. Ficaram de fora modelos que, noutros rankings, batem o Argon em testes concretos. No Vibe Code Bench, por exemplo, o Claude Sonnet 5.5 tem 92,39%, acima dos 91,9% do Argon.

3

As condições nem sempre são iguais. No teste de vídeo, o Gemini analisou um fotograma por segundo, enquanto os concorrentes receberam números fixos de fotogramas (entre 300 e 800). Num teste de ciência, o Argon teve mais tempo de verificação.

4

Liderar não é acertar sempre. No teste jurídico, o melhor resultado é 19,6%. Ser o primeiro com menos de um quinto das tarefas resolvidas é muito diferente de ser fiável.

Estes cuidados são exatamente os que se pedem aos alunos quando analisam uma sondagem, uma publicidade ou uma notícia com gráficos. Um anúncio de um modelo de IA é, por isso, um material autêntico e atual para trabalhar a literacia estatística e a literacia mediática.

Porque é que isto interessa aos professores

Mesmo sem acesso imediato, o Argon mostra para onde caminham as ferramentas que os professores vão usar. Estes são os pontos com maior impacto no trabalho docente:

1Documentos longos deixam de ser um obstáculo

O desempenho em contextos de até um milhão de tokens indica que será possível analisar de uma vez Aprendizagens Essenciais, regulamentos, projetos educativos, relatórios de avaliação externa ou dezenas de trabalhos de alunos, cruzando informação com mais fiabilidade.

2Materiais completos numa só resposta

Com um limite de saída 16 vezes maior, o modelo pode gerar um caderno de atividades inteiro, uma sequência de aulas detalhada ou uma aplicação interativa extensa, sem cortes a meio nem necessidade de pedir "continua".

3Gráficos e vídeos compreendidos com mais rigor

Os bons resultados em interpretação de gráficos e em vídeos longos são relevantes para todas as disciplinas: analisar um documentário, extrair ideias de uma aula gravada ou verificar se um gráfico de um manual está bem interpretado.

4Mais segurança quando a IA lê ficheiros de terceiros

A maior resistência a instruções escondidas importa quando se pede a um assistente que leia trabalhos de alunos, emails ou páginas web. Reduz o risco de manipulação, embora não o elimine.

5Agentes que fazem tarefas administrativas

Os resultados no AutomationBench sugerem que tarefas repetitivas (organizar grelhas, preencher registos, preparar comunicações) poderão ser cada vez mais delegadas, libertando tempo para o essencial: ensinar.

6Expectativas realistas

Nada disto está ainda disponível nas escolas. Saber o que vem a caminho ajuda a planear formação, a discutir regras de utilização no agrupamento e a não tomar decisões com base apenas em anúncios.

Como pode melhorar a aprendizagem dos alunos

O valor educativo de um modelo mais capaz não está em fazer o trabalho pelos alunos, mas em permitir apoios que antes eram difíceis de concretizar:

Feedback sobre trabalhos longos. Um modelo que mantém o raciocínio ao longo de textos extensos pode comentar relatórios, portefólios ou projetos inteiros de forma coerente, apontando problemas de estrutura e não apenas de frase. O professor revê e decide.

Recursos adaptados a cada aluno. A maior capacidade de produção facilita criar versões diferenciadas da mesma tarefa (com mais apoio, mais desafio ou em formato visual), um passo importante para a inclusão e para a diferenciação pedagógica.

Aprender com gráficos e vídeo. Os alunos podem questionar um vídeo ou um gráfico e receber explicações ancoradas no que está realmente lá, desde que sejam desafiados a confirmar as respostas.

Simulações e aplicações interativas. Gerar aplicações completas para explorar conceitos (da física à história) torna-se mais rápido, o que favorece a aprendizagem ativa e a experimentação.

Há, contudo, limites claros. Os resultados mostram que mesmo o melhor modelo falha uma parte significativa das tarefas complexas, pelo que a verificação humana continua indispensável. Antes de usar qualquer ferramenta com alunos, convém confirmar a idade mínima exigida, as regras do agrupamento e o tratamento dos dados pessoais à luz do RGPD.

Proposta de atividade: "Quem ganhou o campeonato da IA?"

Adaptável ao 3.º ciclo e ao secundário, em Matemática, Português, TIC ou Cidadania e Desenvolvimento (cerca de 45 minutos).

1. Mostrar a tabela de resultados e perguntar: qual é o melhor modelo?

2. Em grupos, contar vitórias, calcular diferenças em pontos percentuais e identificar onde o Argon perde.

3. Discutir: faz sentido calcular a média de todas as percentagens? Quem escolheu os testes e os adversários?

4. Reescrever o título do anúncio de forma rigorosa, sem exageros, e comparar com o original.

Em síntese

O Gemini 4 Argon devolve à Google a liderança em número de testes ganhos, com vantagens claras no trabalho com documentos longos, na compreensão de gráficos e vídeo e na resistência a manipulações. Não é, porém, o melhor em tudo, e ainda não está ao alcance das escolas.

Para os professores, o mais útil agora é acompanhar a chegada do modelo às versões pagas do Gemini, preparar formas responsáveis de o usar e aproveitar o próprio anúncio para ensinar os alunos a ler números com rigor.

Deixa um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *