Saltar para o conteúdo
Gemini 4 Link
English简体中文繁體中文DeutschEspañolPortuguês

Gemini 4 Argon em análise: o que os testes independentes encontram e a tabela da Google omite

A Google publicou a sua própria tabela de testes em 30 de setembro de 2026. A Artificial Analysis publicou nesse mesmo dia uma segunda leitura do mesmo modelo, construída a partir de avaliações que executa por conta própria. As duas tabelas respondem a perguntas diferentes.

Gráfico em cascata intitulado Custo por tarefa do Intelligence Index desde o Gemini 3.1 Pro Preview até ao Gemini 4 Argon: começa em 0,67 dólares, soma 1,76 pelo uso de tokens até 2,43, soma 2,19 pela subida do preço do token até 4,62, subtrai 0,64 pelo maior desconto de cache até 3,98 e subtrai 1,99 pelo desconto de 50 por cento até 1,99 dólares
Como se chega aos 1,99 dólares por tarefa e o que acontece quando a promoção termina. Fonte: Artificial Analysis.

A segunda tabela chegou no mesmo dia

A Google fechou o seu anúncio a 30 de setembro de 2026 com uma tabela comparativa de dezoito linhas. A Artificial Analysis publicou no mesmo dia a sua própria leitura do mesmo modelo, construída a partir de avaliações que ela própria corre, em vez de números fornecidos pelo fabricante.

No Intelligence Index da Artificial Analysis, o Gemini 4 Argon obtém 53 com a definição de raciocínio alta. Isso empata com o GPT-6 Astra em raciocínio máximo e fica um ponto à frente do GPT-6.1 Sol. A distância face ao historial recente da Google é maior: o Argon está 23 pontos acima do Gemini 3.1 Pro Preview com 30 e 12 pontos acima do Gemini 3.8 Flash.

O relatório independente retira daí uma conclusão. A Google regressa como um dos três melhores laboratórios em inteligência medida. O Argon é ainda o primeiro modelo proprietário da Google acima da classe Flash em mais de sete meses, o que encaixa no intervalo de dez meses na cronologia de topo da Google.

Os números deste artigo vêm do anúncio da Google sobre o Gemini 4 Argon de 30 de setembro de 2026 e da Artificial Analysis, que publicou os seus próprios resultados de avaliação no mesmo dia.

Dois gráficos da Artificial Analysis. O gráfico de barras superior ordena os modelos no Intelligence Index v4.3, com o Gemini 4 Argon em 53, igual ao GPT-6 Astra em 53 e um ponto acima do GPT-6.1 Sol em 52. O diagrama de dispersão inferior cruza o Intelligence Index com o custo por tarefa, com o Gemini 4 Argon marcado em 53 e 1,99 dólares dentro do quadrante sombreado mais atrativo
O Intelligence Index da Artificial Analysis e a mesma pontuação face ao custo por tarefa. Fonte: Artificial Analysis, 30 de setembro de 2026.

Porque é que uma execução independente era o que havia para esperar

Três semanas antes do lançamento, um modelo anónimo etiquetado como gemini-3.8-flash apareceu em batalhas cegas numa arena pública e superou claramente o verdadeiro Gemini 3.8 Flash em prompts de programação, diagramas e tarefas agênticas. Os programadores assumiram amplamente que era um Gemini 4 inicial, mas o nome mostrado nunca mudou e a Google nunca o reclamou.

Um gráfico de testes que circulou a 18 de setembro de 2026 colocava o modelo não confirmado à frente do GPT-6 Astra e do Claude Fable 5.1 em programação de longo curso e utilização de computador, com um preço alegadamente associado. Os números passaram por vários órgãos antes de alguém conseguir ligá-los a um modelo que a Google tivesse realmente nomeado.

Nada disso torna o gráfico divulgado errado. Torna-o não verificável. O que chegou a 30 de setembro é de outra natureza, porque traz uma estrutura publicada, uma definição de raciocínio declarada e um valor de custo que pode ser confrontado com a lista pública de preços por token.

  • O alias da arena era apresentado como gemini-3.8-flash e nunca foi confirmado pela Google.
  • O gráfico que circulava estava datado de 18 de setembro de 2026, doze dias antes do lançamento.
  • A Artificial Analysis corre as suas próprias avaliações em vez de reimprimir números do fabricante.

1,99 dólares por tarefa, e a poupança vem da lista de preços

O custo por tarefa é o número que um orçamento nota. Com o desconto de lançamento atual de 50 por cento, o Gemini 4 Argon custa 1,99 dólares por tarefa do Intelligence Index contra 3,26 dólares do GPT-6 Astra com raciocínio máximo, ou 60 por cento do preço por um nível comparável de inteligência medida.

A comparação inverte-se face ao modelo mais barato da OpenAI. Na mesma avaliação, o GPT-6.1 Sol custa 2,7 vezes menos por tarefa do que o Argon. Quando os preços promocionais terminarem, o valor do Argon sobe para 3,98 dólares, cerca de 1,2 vezes o GPT-6 Astra em vez de um desconto face a ele.

A causa não é eficiência. O Argon gasta em média cerca de 62.000 tokens de saída por tarefa, enquanto o GPT-6 Astra gasta 27.000, pelo que gasta mais tokens para chegar à mesma pontuação e ganha no preço unitário. A entrada em cache também ficou mais barata, passando de um desconto de 90 por cento no Gemini 3.8 Flash para 95 por cento no Argon.

OpçãoEntrada / saída por milhão de tokensCusto por tarefa do Intelligence Index
Gemini 4 Argon (high), promocional2 / 10 USD1,99 USD
Gemini 4 Argon (high), padrão4 / 20 USD3,98 USD
GPT-6 Astra (max)10 / 50 USD3,26 USD
GPT-6.1 Sol (max)Não publicado na mesma unidadeCerca de 0,74 USD, derivado

O valor do Sol não é publicado como custo por tarefa. É derivado da relação declarada de 2,7 vezes aplicada ao resultado de 1,99 dólares do Argon, e é incluído para mostrar uma direção, não como orçamento.

15 por cento de alucinação, a mais baixa da sua classe

O resultado mais incisivo do relatório independente não é uma pontuação de capacidade. No AA-Omniscience, que mistura exatidão factual com a disposição para recusar quando o modelo não sabe, o Gemini 4 Argon regista 15 por cento de alucinação. É a mais baixa de qualquer modelo com 45 pontos ou mais no Intelligence Index, contra 51 por cento do GPT-6 Astra em max e 54 por cento do GPT-6.1 Sol.

Lido ao lado da exatidão, o quadro torna-se mais subtil. O Argon responde corretamente em 50 por cento dos casos, cinco pontos abaixo do Gemini 3.1 Pro Preview e treze pontos abaixo do GPT-6 Astra com 63 por cento. Na pontuação combinada do AA-Omniscience, os três modelos ficam a menos de um ponto uns dos outros, com o Argon e o Sol em 42 e o Astra em 43.

A divisão descreve um modelo que recusa em vez de adivinhar. Em trabalho que corre sem supervisão ao longo de cadeias longas, uma resposta errada custa mais do que uma ausente, o que torna a troca que o índice registra mais valiosa do que o ganho de capacidade do título.

Dois gráficos de barras da Artificial Analysis lado a lado. O AA-Omniscience Accuracy pontua a exatidão do conhecimento de 67 por cento no topo até 16 por cento, e o AA-Omniscience Non-Hallucination Rate, descrito como um menos a taxa de alucinação, lidera com o Gemini 4 Argon em 85 por cento
As duas metades do AA-Omniscience. O Gemini 4 Argon lidera em não inventar e fica a meio da tabela em saber a resposta. Fonte: Artificial Analysis.

O trabalho agêntico melhorou muito e continua a não liderar

A capacidade agêntica era o ponto fraco da geração anterior do Gemini, e a execução independente mostra um salto grande. O Gemini 4 Argon lidera o AutomationBench-AA com 78 por cento, sete pontos à frente do Claude Sonnet 5.5 em raciocínio máximo, num teste construído a partir de processos de negócio reais de ponta a ponta.

O trabalho de terminal conta a outra metade. No Terminal Bench 4, o Argon obtém 57 por cento, 53 pontos acima do Gemini 3.1 Pro Preview e ainda assim atrás de três modelos ao mesmo tempo: Claude Sonnet 5.5 com 64 por cento, Claude Opus 5.5 com 60 por cento e GPT-6 Astra com 59 por cento.

No AA-Briefcase, uma avaliação de trabalho de conhecimento, o Argon alcança 1.494 Elo com base numa taxa de aprovação de rubrica de 65 por cento, a mais alta que a Artificial Analysis registou. As pontuações parciais são menos lisonjeiras, com qualidade analítica em 1.576 Elo e qualidade de apresentação em 1.308 Elo.

Dois gráficos de barras da Artificial Analysis. O AutomationBench-AA coloca o Gemini 4 Argon em primeiro com 77,5 por cento, à frente do Claude Sonnet 5.5 com 71,3 por cento, do Claude Opus 5.5 com 69,5 por cento e do DeepSWE com 68,9 por cento. O Terminal-Bench 4.0 coloca o Claude Sonnet 5.5 em primeiro com 63,6 por cento, à frente do Claude Opus 5.5 com 59,6 por cento e do GPT-6 Astra com 59,1 por cento, com o Gemini 4 Argon em 57,1 por cento
AutomationBench-AA e Terminal-Bench 4.0, ambos medidos de forma independente pela Artificial Analysis.

O mesmo teste, dois títulos diferentes

O Terminal-bench 4.0 aparece nas duas tabelas e as duas não concordam sobre quem lidera. A tabela da Google coloca o Argon em 57,4 por cento, nove pontos atrás do Claude Opus 5.5. A execução independente coloca o Argon em 57 por cento, atrás do Claude Sonnet 5.5 com 64 por cento, com o Opus 5.5 em 60 por cento e o GPT-6 Astra em 59 por cento. A pontuação do Argon é quase idêntica e a história à sua volta não.

A tabela do fabricante é também o único sítio onde alguns resultados existem. O Harvey's Legal Agent Benchmark aparece lá com o Argon em 19,6 por cento contra o GPT-6 Astra com 5,4 por cento e o Claude Opus 5.5 com 3,8 por cento, e a avaliação de contexto longo GraphWalks mostra uma vantagem superior a dez pontos na janela de 256k a 1M. Nenhuma das duas foi replicada de forma independente.

As duas tabelas respondem a perguntas diferentes. Uma tabela de fabricante mostra o que um modelo consegue fazer quando o fabricante escolhe a estrutura e as definições. Uma tabela independente mostra o que ele faz quando é outra pessoa a escolher. Para um modelo ainda limitado a parceiros verificados, sem acesso de consumidor e sem sessão que alguém possa repetir, só o segundo tipo pode ser verificado por quem está fora da sala.

Terminal-bench 4.0Tabela publicada pela GoogleExecução da Artificial Analysis
Gemini 4 Argon57,4 %57 %
Claude Opus 5.566,4 %, o líder dessa tabela60 %
Claude Sonnet 5.5Não incluído64 %, o líder desta execução
GPT-6 AstraNão é o ponto líder da linha59 %

Nenhuma das tabelas está errada. Foram produzidas com estruturas, prompts e definições de raciocínio diferentes, e é exatamente por isso que um único número de classificação nunca deve ser lido sozinho.

O que fazer com a segunda opinião

Mais um detalhe independente explica porque as cadeias longas se tornaram práticas. A Artificial Analysis testou uma função da API Gemini chamada Long Decode Continuation, que pausa uma resposta longa e retoma-a em chamadas seguintes. O raciocínio pode assim ir até 1.000.000 de tokens de saída sem que o pedido esgote o tempo, contra um teto de saída de 64.000 na geração anterior. A janela de contexto é de 1 M de tokens, com entrada de texto, imagem, vídeo e voz e saída de texto.

O acesso não mudou com nada disto. O Argon continua limitado a parceiros Fairwind verificados, com os clientes pagos da API e os subscritores do Google AI Ultra nomeados como grupos seguintes e sem data. Nenhum dos resultados acima pode ser reproduzido numa conta comum, o que é o argumento mais forte para tratar as duas tabelas como direcionais.

O movimento prático durante a espera é o que os números independentes recompensam. Construa um conjunto fixo de prompts com os modelos que consegue invocar hoje, guarde as saídas e volte a correr exatamente o mesmo conjunto quando o Argon abrir. Um modelo novo medido contra a sua própria referência diz mais do que esse mesmo modelo medido contra a tabela de qualquer outra pessoa, incluindo esta.

  • Hoje só se chega ao Argon através do programa Fairwind.
  • O teto de saída passa de 64.000 para 1.000.000 de tokens.
  • Um conjunto fixo de prompts criado agora é a forma mais barata de testar o Argon mais tarde.

Perguntas frequentes

Que pontuação obtém o Gemini 4 Argon em testes independentes?

A Artificial Analysis atribui-lhe 53 no seu Intelligence Index com a definição de raciocínio alta, igual ao GPT-6 Astra com 53 e um ponto à frente do GPT-6.1 Sol com 52. São 23 pontos acima do Gemini 3.1 Pro Preview e 12 acima do Gemini 3.8 Flash.

Porque é que os números independentes diferem dos da Google?

Medem coisas diferentes. Uma tabela de fornecedor relata o desempenho de um modelo em avaliações que o fornecedor correu com as suas próprias definições. A Artificial Analysis usa a sua própria estrutura, os seus próprios prompts e a sua própria classificação, pelo que o esforço de raciocínio e o andaime podem diferir mesmo quando o teste tem o mesmo nome.

Quanto custa o Gemini 4 Argon por tarefa?

Com o desconto atual de 50 por cento, a Artificial Analysis mede 1,99 dólares por tarefa do Intelligence Index, contra 3,26 dólares do GPT-6 Astra com raciocínio máximo. Ao preço padrão essa mesma tarefa sobe para 3,98 dólares, cerca de 1,2 vezes o GPT-6 Astra.

Porque é que o Argon é mais barato se gasta mais tokens?

Porque o desconto incide no preço de um token, não em quantos são usados. O Gemini 4 Argon gasta em média cerca de 62.000 tokens de saída por tarefa, enquanto o GPT-6 Astra gasta 27.000, pelo que a poupança vem de um preço unitário mais baixo e não de fazer menos trabalho.

Quão baixa é a taxa de alucinação?

15 por cento no AA-Omniscience, a mais baixa de qualquer modelo com 45 pontos ou mais no Intelligence Index. O GPT-6 Astra está em 51 por cento e o GPT-6.1 Sol em 54 por cento. O Argon responde corretamente em 50 por cento dos casos, abaixo do GPT-6 Astra com 63 por cento.

O Gemini 4 Argon é o melhor modelo para trabalho agêntico?

Ainda não. Lidera o AutomationBench-AA com 78 por cento, sete pontos à frente do Claude Sonnet 5.5. No Terminal Bench 4 obtém 57 por cento, atrás do Claude Sonnet 5.5 com 64 por cento, do Claude Opus 5.5 com 60 por cento e do GPT-6 Astra com 59 por cento.

O que torna prático um limite de saída de 1 M de tokens?

Uma função da API Gemini chamada Long Decode Continuation pausa uma resposta longa e retoma-a em chamadas seguintes, pelo que o raciocínio pode ir até 1.000.000 de tokens de saída sem que o pedido esgote o tempo. A geração anterior limitava a saída a 64.000 tokens.

Posso invocar o Gemini 4 Argon aqui?

Não. O Argon está limitado a parceiros Fairwind verificados, com os clientes pagos da API e os subscritores do Google AI Ultra nomeados como grupos seguintes e sem data. O espaço de chat deste site corre o Gemini 3.8 Flash, o modelo que consegue invocar hoje.

Meça-o contra a sua própria referência

O espaço de chat lista os modelos que a sua conta consegue invocar, com um orçamento do servidor antes de cada pedido.

Abrir o espaço de chat