// BENCHMARKS

A verdade sobre os modelos, medida.

Desempenho, custo e capacidade. Todo número tem fonte primária e data de verificação — e o que não pôde ser verificado aparece como “—”, não como estimativa disfarçada.

Janelas de contexto

Quantos tokens de entrada cada modelo processa de uma vez.

Gemini 3 Pro 1000K
Llama 4 Maverick 1000K
GPT-5 400K
Grok 4 256K
Claude Opus 4.5 200K
Claude Sonnet 4.5 200K

Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção

Preços de API

USD por 1 milhão de tokens. Preço de lista, sem desconto de volume ou batch.

ModeloEntradaSaídaCache
Claude Opus 4.5$5$25$0.5
Claude Sonnet 4.5$3$15$0.3
GPT-5$1.25$10$0.125
Gemini 3 Pro$2$12
Grok 4$3$15
Llama 4 Maverick

Modelos de pesos abertos não têm preço de lista: o custo depende de quem hospeda.

Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção

Código · SWE-bench Verified

Percentual de tarefas reais de engenharia resolvidas de ponta a ponta.

Claude Opus 4.5 80.9%
Claude Sonnet 4.5 77.2%
GPT-5 74.9%
Gemini 3 Pro 76.2%

Modelos sem resultado confirmado em fonte primária não aparecem neste gráfico. Ausência aqui não significa desempenho baixo — significa dado não verificado.

Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção

Comparar modelos

Os modelos de fronteira rastreados, lado a lado.

Comparativo de modelos: desenvolvedor, contexto, multimodalidade e ponto forte
ModeloDesenvolvedorContextoMultimodalPonto forte
Claude Opus 4.5Anthropic200KSimCódigo, uso de ferramentas e tarefas longas
Claude Sonnet 4.5Anthropic200KSimEquilíbrio entre custo e capacidade
GPT-5OpenAI400KSimRaciocínio geral e roteamento automático
Gemini 3 ProGoogle1000KSimContexto longo e multimodalidade nativa
Grok 4xAI256KSimDados em tempo real da plataforma X
Llama 4 MaverickMeta1000KSimPesos abertos e execução on-premise

Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção

Hardware de inferência

Os aceleradores que sustentam a fronteira.

AceleradorFabricanteUnidadeMemóriaUso típico
GB200 NVL72NVIDIArack de 72 GPUs13.400 GBTreino de fronteira
TPU v7 (Ironwood)Googlechip192 GBTreino e inferência
Trainium 2AWSchip96 GBInferência em escala
Instinct MI355XAMDchip288 GBInferência de longo contexto
LPUGroqchip230 MBInferência de baixa latência

A coluna “unidade” existe porque estes números não são comparáveis entre si: um rack de 72 GPUs e um chip único medem coisas diferentes.

Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção

Linha do tempo de lançamentos

Marcos confirmados por anúncio oficial.

  1. Claude Opus 4.5

    Anthropic publica o modelo com melhor resultado em SWE-bench Verified até então.

  2. Gemini 3 Pro

    Google entrega janela de 1M tokens com multimodalidade nativa.

  3. Claude Sonnet 4.5

    Camada intermediária com foco em agentes de longa duração.

  4. GPT-5

    OpenAI unifica os modelos de raciocínio sob roteamento automático.

  5. Grok 4

    xAI integra dados em tempo real da plataforma X.

  6. Llama 4

    Meta publica a família com arquitetura de mistura de especialistas.

Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção

Privacidade

Escolha as categorias que deseja permitir. Você pode alterar isso quando quiser.