// BENCHMARKS
A verdade sobre os modelos, medida.
Desempenho, custo e capacidade. Todo número tem fonte primária e data de verificação — e o que não pôde ser verificado aparece como “—”, não como estimativa disfarçada.
Janelas de contexto
Quantos tokens de entrada cada modelo processa de uma vez.
Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção
Preços de API
USD por 1 milhão de tokens. Preço de lista, sem desconto de volume ou batch.
| Modelo | Entrada | Saída | Cache |
|---|---|---|---|
| Claude Opus 4.5 | $5 | $25 | $0.5 |
| Claude Sonnet 4.5 | $3 | $15 | $0.3 |
| GPT-5 | $1.25 | $10 | $0.125 |
| Gemini 3 Pro | $2 | $12 | — |
| Grok 4 | $3 | $15 | — |
| Llama 4 Maverick | — | — | — |
Modelos de pesos abertos não têm preço de lista: o custo depende de quem hospeda.
Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção
Código · SWE-bench Verified
Percentual de tarefas reais de engenharia resolvidas de ponta a ponta.
Modelos sem resultado confirmado em fonte primária não aparecem neste gráfico. Ausência aqui não significa desempenho baixo — significa dado não verificado.
Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção
Comparar modelos
Os modelos de fronteira rastreados, lado a lado.
| Modelo | Desenvolvedor | Contexto | Multimodal | Ponto forte |
|---|---|---|---|---|
| Claude Opus 4.5 | Anthropic | 200K | Sim | Código, uso de ferramentas e tarefas longas |
| Claude Sonnet 4.5 | Anthropic | 200K | Sim | Equilíbrio entre custo e capacidade |
| GPT-5 | OpenAI | 400K | Sim | Raciocínio geral e roteamento automático |
| Gemini 3 Pro | 1000K | Sim | Contexto longo e multimodalidade nativa | |
| Grok 4 | xAI | 256K | Sim | Dados em tempo real da plataforma X |
| Llama 4 Maverick | Meta | 1000K | Sim | Pesos abertos e execução on-premise |
Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção
Hardware de inferência
Os aceleradores que sustentam a fronteira.
| Acelerador | Fabricante | Unidade | Memória | Uso típico |
|---|---|---|---|---|
| GB200 NVL72 | NVIDIA | rack de 72 GPUs | 13.400 GB | Treino de fronteira |
| TPU v7 (Ironwood) | chip | 192 GB | Treino e inferência | |
| Trainium 2 | AWS | chip | 96 GB | Inferência em escala |
| Instinct MI355X | AMD | chip | 288 GB | Inferência de longo contexto |
| LPU | Groq | chip | 230 MB | Inferência de baixa latência |
A coluna “unidade” existe porque estes números não são comparáveis entre si: um rack de 72 GPUs e um chip único medem coisas diferentes.
Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção
Linha do tempo de lançamentos
Marcos confirmados por anúncio oficial.
-
Claude Opus 4.5
Anthropic publica o modelo com melhor resultado em SWE-bench Verified até então.
-
Gemini 3 Pro
Google entrega janela de 1M tokens com multimodalidade nativa.
-
Claude Sonnet 4.5
Camada intermediária com foco em agentes de longa duração.
-
GPT-5
OpenAI unifica os modelos de raciocínio sob roteamento automático.
-
Grok 4
xAI integra dados em tempo real da plataforma X.
-
Llama 4
Meta publica a família com arquitetura de mistura de especialistas.
Verificado em 24/07/2026. Fontes: documentação e anúncios oficiais dos fabricantes. Reportar correção