Todo artigo principal sobre o lançamento do Claude Opus 5 em 24 de julho de 2026 destacou a mesma funcionalidade: uma forma de alternar entre custo e capacidade. Mas poucos explicaram o que ela controla, quais níveis existem, como afeta a requisição ou o impacto na conta.

Experimente o Apidog hoje

Essa funcionalidade é o parâmetro effort. No Opus 5, ele tem cinco níveis e o padrão é high. A Anthropic recalibrou esses níveis para o modelo, então configurações ajustadas no Opus 4.8 não devem ser reutilizadas sem avaliação. Além disso, uma combinação específica de parâmetros gera erro 400 durante migrações.

💡 Para comparar os cinco níveis contra um endpoint real, envie a mesma requisição com valores diferentes de effort e registre custo, latência e qualidade da resposta.

O que o parâmetro effort realmente faz

O effort fica dentro de output_config em uma requisição para a API de Mensagens:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": {
    "effort": "high"
  },
  "messages": [
    {
      "role": "user",
      "content": "Refatorar este módulo e explicar os trade-offs."
    }
  ]
}

Enter fullscreen mode Exit fullscreen mode

Ele controla quanto raciocínio interno o modelo executa antes de responder.

No Opus 5, o pensamento adaptativo está ativado por padrão. O valor de effort define o orçamento usado nesse raciocínio:

  • effort mais alto: mais tokens de raciocínio, maior custo e maior latência.
  • effort mais baixo: menos tokens de raciocínio, menor custo e menor latência.

Nas interfaces de consumidor, a mesma opção pode aparecer como um seletor entre custo e capacidade. Na API, o controle efetivo é o campo output_config.effort.

Consulte o formato completo da requisição no guia da API do Opus 5 e a documentação da Anthropic na visão geral de modelos.

effort não controla verbosidade

effort não é um controle de tamanho da resposta.

Segundo o guia de prompting da Anthropic para o Opus 5, reduzir o effort diminui o raciocínio interno, não o comprimento do texto visível.

Se você precisa de respostas curtas, inclua essa restrição no prompt:

Responda em no máximo 5 bullets. Não inclua introdução, justificativas longas ou exemplos adicionais.

Enter fullscreen mode Exit fullscreen mode

Não espere que usar low reduza automaticamente a saída textual.

Os cinco níveis de effort

Nível O que faz Aplicação típica
low Raciocínio mínimo antes de responder Classificação de alto volume, extração, roteamento e resumos curtos
medium Raciocínio moderado Perguntas e respostas sobre contexto recuperado, edições de arquivo único e transformações estruturadas
high Padrão. Raciocínio substancial Trabalho de propósito geral quando você ainda não mediu resultados
xhigh Raciocínio estendido Codificação e loops agênticos; ponto de partida recomendado pela Anthropic
max Orçamento máximo de raciocínio Problemas difíceis de uma única tentativa, quando errar custa mais que os tokens

Dois detalhes são especialmente importantes:

  1. O padrão é high.

    Se você não enviar output_config, a requisição usa high. Isso afeta previsões de custo: uma requisição sem configuração explícita no Opus 5 realiza trabalho de raciocínio e cobra por ele.

  2. Para código e agentes, comece em xhigh, não em max.

    A Anthropic posiciona xhigh como ponto de partida para essas cargas. Use max apenas quando suas avaliações mostrarem ganho mensurável que justifique o custo adicional.

A mudança do comportamento padrão é uma das alterações relevantes na migração do Opus 4.8 para o Opus 5.

Por que você precisa recalibrar suas configurações

O rótulo de cada nível não representa necessariamente o mesmo orçamento entre modelos.

No Opus 5, medium não corresponde à mesma quantidade de raciocínio que medium no Opus 4.8. A recomendação da Anthropic é executar uma nova varredura de effort em vez de migrar a configuração anterior diretamente.

Na prática, isso pode abrir espaço para redução de custo:

  • Em modelos Opus anteriores, low e medium frequentemente apresentavam queda perceptível de qualidade em tarefas complexas.
  • No Opus 5, os níveis inferiores são mais fortes do que eram anteriormente.
  • Isso torna low e medium opções viáveis para tarefas de produção que não precisam de raciocínio extenso.

O Opus 5 custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída, os mesmos valores do Opus 4.8. Tokens de raciocínio entram na cobrança de saída.

Por isso, usar high em um pipeline de classificação onde low já atende aos critérios pode aumentar significativamente o gasto sem melhorar a precisão.

Veja a tabela completa de preços no detalhamento de preços do Opus 5, incluindo desconto de 50% para lote e o mínimo de cache de 512 tokens.

Para otimizações adicionais, consulte como cortar sua conta da API Claude.

Como xhigh e max interagem com max_tokens

max_tokens limita os tokens de raciocínio e os tokens da resposta visível.

Em outras palavras, ele é um teto para toda a saída gerada pela requisição:

tokens de raciocínio + tokens de resposta <= max_tokens

Enter fullscreen mode Exit fullscreen mode

Ao aumentar o effort, o modelo pode gastar mais do orçamento em raciocínio antes de começar a gerar a resposta. Se max_tokens estiver dimensionado para um modelo sem esse comportamento, a resposta pode ser truncada.

Exemplo recomendado para xhigh:

{
  "model": "claude-opus-5",
  "max_tokens": 64000,
  "output_config": {
    "effort": "xhigh"
  },
  "messages": [
    {
      "role": "user",
      "content": "Corrigir o teste de integração com falha e explicar a causa raiz."
    }
  ]
}

Enter fullscreen mode Exit fullscreen mode

A orientação da Anthropic é começar com max_tokens: 64000 ao usar xhigh ou max.

Um valor alto de max_tokens é um teto, não uma compra antecipada. Você é cobrado pelos tokens realmente produzidos. Portanto, definir 64000 não significa pagar por 64000; significa evitar que o modelo interrompa o raciocínio ou a resposta cedo demais.

O erro 400 ao combinar thinking desativado com xhigh ou max

Há uma combinação inválida que deve ser verificada durante a migração.

Desabilitar o pensamento e solicitar um effort alto são instruções contraditórias. Esta requisição falha:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "thinking": {
    "type": "disabled"
  },
  "output_config": {
    "effort": "xhigh"
  }
}

Enter fullscreen mode Exit fullscreen mode

O Opus 5 retorna 400 quando thinking: { "type": "disabled" } é usado com effort: "xhigh" ou effort: "max".

As combinações válidas são:

  • Pensamento ativado, que é o padrão, com qualquer um dos cinco níveis.
  • Pensamento desativado com low, medium ou high.

Um caminho comum para esse erro é:

  1. Migrar thinking: { "type": "disabled" } de uma configuração do Opus 4.8.
  2. Alterar o effort para xhigh, seguindo a recomendação para codificação.
  3. Receber um 400 porque os dois ajustes são incompatíveis.

A recomendação da Anthropic é não desabilitar o pensamento no Opus 5. Com ele desativado, dois problemas podem aparecer:

  • chamadas de ferramentas podem ser emitidas como texto simples em vez de serem executadas;
  • tags XML internas podem vazar na saída visível.

Em loops agênticos, esse texto vazado pode contaminar interações posteriores. Para controlar custo, prefira reduzir effort em vez de desabilitar o pensamento.

Veja mais detalhes no guia de prompt do Opus 5.

Como executar uma varredura de effort nas suas avaliações

A forma prática de escolher um nível é avaliar sua carga de trabalho real.

1. Monte um conjunto de tarefas reais

Separe de 30 a 50 prompts dos logs de produção. Evite exemplos exclusivamente sintéticos.

Inclua casos difíceis, falhas conhecidas e tarefas com impacto real. Diferenças entre níveis de effort tendem a desaparecer em tarefas simples.

2. Defina o critério de aprovação antes de avaliar

Defina métricas objetivas antes de ler as saídas. Por exemplo:

  • testes automatizados aprovados;
  • JSON válido contra um schema;
  • campo extraído igual ao valor esperado;
  • resposta aprovada ou reprovada por avaliador humano.

Evite critérios vagos como “parece melhor”.

3. Execute cada prompt em cada nível

Com 40 prompts e 5 níveis, você terá 200 chamadas:

40 prompts × 5 níveis = 200 execuções

Enter fullscreen mode Exit fullscreen mode

Como essa avaliação não é sensível à latência, você pode usar a API Batch para reduzir o custo.

4. Registre qualidade, custo e latência

Para cada execução, capture pelo menos:

  • aprovação ou reprovação;
  • usage.output_tokens;
  • latência total.

O campo usage é importante porque mostra o consumo real de tokens de saída, incluindo os tokens de raciocínio.

Um registro simples pode ter este formato:

{
  "prompt_id": "integration-test-17",
  "effort": "medium",
  "passed": true,
  "output_tokens": 1842,
  "latency_ms": 3280
}

Enter fullscreen mode Exit fullscreen mode

5. Escolha o nível mais barato que atende ao critério

Compare a taxa de aprovação com custo e latência. Escolha o nível mais barato que atinge seus requisitos e valide a decisão em um conjunto separado, que não foi usado para ajustar a configuração.

6. Repita a avaliação ao trocar de modelo

A razão para executar essa varredura é justamente a recalibração entre Opus 4.8 e Opus 5. Não assuma que os rótulos terão o mesmo comportamento no próximo modelo.

Comparando níveis lado a lado no Apidog

A parte mecânica da varredura consiste em enviar o mesmo corpo de requisição cinco vezes, alterando apenas output_config.effort.

Uma configuração prática no Apidog:

  1. Crie uma requisição para o endpoint Anthropic Messages.
  2. Armazene a chave da API em uma variável de ambiente, sem colocá-la diretamente no body.
  3. Salve a requisição em uma coleção.
  4. Duplique-a cinco vezes.
  5. Altere apenas o valor de output_config.effort em cada cópia.
  6. Compare usage.output_tokens, latência e resultado funcional.
  7. Verifique cache_read_input_tokens quando estiver validando o cache.
  8. Ative streaming e inspecione eventos SSE para observar a diferença de latência entre low e xhigh.
  9. Adicione uma asserção para garantir que stop_reason exista e não seja max_tokens.

A última verificação evita que uma resposta truncada pareça uma resposta curta válida.

Exemplo de condição que sua coleção deve verificar:

stop_reason existe AND stop_reason != "max_tokens"

Enter fullscreen mode Exit fullscreen mode

Se a requisição terminar com stop_reason: "max_tokens", aumente max_tokens antes de concluir que aquele nível de effort teve desempenho ruim.

Você pode baixar o Apidog para montar essa coleção. Não é obrigatório: o mesmo processo pode ser automatizado com scripts, mas uma coleção facilita comparar as cinco variações.

O limite de capacidade do Opus 5

effort pode tornar o Opus 5 mais eficiente para rodar bem, mas não altera a posição do modelo na linha Claude.

Os números de lançamento divulgados pela Anthropic para o Opus 5 incluem:

  • mais que o dobro da pontuação do Opus 4.8 no Frontier-Bench v0.1;
  • aproximadamente 3x o próximo melhor modelo no ARC-AGI 3;
  • distância de 0,5% do Fable 5 no CursorBench 3.2 pela metade do preço.

Esses números foram publicados pela Anthropic e não haviam sido reproduzidos independentemente até 25 de julho de 2026. Trate-os como afirmações do fornecedor, não como medições neutras.

Consulte o detalhamento de benchmarks do Opus 5 para as ressalvas de cada benchmark.

Acima do Opus 5, o Fable 5 continua sendo o modelo mais capaz amplamente lançado da Anthropic, a US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída.

O Opus 5 também fica atrás do Mythos 5 em exploração de segurança cibernética e pesquisa biológica autônoma, conforme declarado pela Anthropic.

Usar effort: "max" não elimina essas diferenças de capacidade. O ganho prático está em encontrar o menor nível que atende às exigências da sua carga de trabalho.

Para comparar custo e capacidade entre os modelos, veja Opus 5 vs Fable 5.

FAQ

Qual é o nível de effort padrão no Claude Opus 5?

high.

Uma requisição sem output_config usa effort: "high" com pensamento adaptativo ativado.

Quais são os cinco níveis de effort?

low, medium, high, xhigh e max.

A Anthropic recomenda começar em xhigh para codificação e trabalho agêntico e, então, avaliar níveis menores com sua própria suíte de testes.

Por que minha requisição retorna erro 400 com effort: "xhigh"?

Provavelmente porque você também enviou:

{
  "thinking": {
    "type": "disabled"
  }
}

Enter fullscreen mode Exit fullscreen mode

Com pensamento desativado, o effort fica limitado a high. Remova a desativação do pensamento ou reduza o nível para high, medium ou low.

Posso reutilizar minhas configurações de effort do Opus 4.8 no Opus 5?

Não.

Os níveis foram recalibrados, então o mesmo rótulo representa uma quantidade diferente de raciocínio. Execute uma nova varredura de avaliação antes de definir a configuração de produção.

Consulte o guia de migração para a lista completa de mudanças.

Diminuir o effort deixa as respostas mais curtas?

Não.

effort controla o raciocínio interno, não o tamanho visível da resposta. Se você precisa de uma resposta curta, solicite explicitamente concisão no prompt.

Qual valor de max_tokens devo usar com xhigh ou max?

Comece com 64000.

max_tokens limita o raciocínio e a resposta juntos. Um teto baixo pode truncar a saída. Você só paga pelos tokens realmente produzidos, então um teto alto não gera custo por si só.

Para especificações, disponibilidade e preços, comece por o que é o Claude Opus 5.