Cerca de cinquenta tarefas de codificação de tamanho médio por mês. É isso que os créditos de IA e o faturamento por uso comprariam a um assinante Claude Pro com o pool de $20 em créditos que a Anthropic propôs para o trabalho programático — cinquenta tarefas, nas taxas aproximadas do Sonnet, antes do medidor zerar. Se você usa Claude Code como ferramenta principal, cinquenta é uma manhã de trabalho.
Passei anos no lado de pesquisa desta indústria e quero ser cuidadoso sobre que tipo de evento este é. Não é um aumento de preços fantasiado. É o momento em que um subsídio deixou de ser invisível, e muitos de nós finalmente vimos o que custa de fato produzir um dia de trabalho de um agente autônomo. O mecanismo é mais interessante do que a indignação, então deixa eu explicar.
O que mudou em meados de 2026
Duas mudanças de preços chegaram com semanas de diferença, e apontam na mesma direção.
O GitHub Copilot foi primeiro. Em 1º de junho, o Copilot migrou para os "Créditos de IA". O Pro a $10 por mês, que significava uso ilimitado de agentes, virou uma cota mensal de 1.500 créditos. Um novo nível Max de $100 surgiu para pessoas que rodam agentes o dia todo. A tarifa fixa, eliminada.
O movimento da Anthropic foi mais cirúrgico. Em 14 de maio, a empresa anunciou que, a partir de 15 de junho, o uso headless do Claude Agent SDK e claude -p não contaria mais para os limites do seu plano. O trabalho programático passaria a ser descontado de um pool separado denominado em dólares — $20 no Pro, $100 no Max 5x, $200 no Max 20x — cobrado a preços de tabela padrão da API, sem transferência de saldo. O Claude Code interativo no terminal continuou na assinatura. A linha foi traçada entre você digitando e seus scripts rodando.
A reação foi intensa. O aumento efetivo de custos foi de 5 a 10 vezes para usuários pesados do Agent SDK. Antes da data efetiva chegar, a Anthropic pausou a mudança — "não está entrando em vigor", nas palavras da empresa — e disse que reestruturaria o modelo. Atenção à palavra. Pausado, não revertido.
O subsídio que você não sabia que estava recebendo
Aqui está o número que importa mais do que qualquer preço de tabela. Pela própria contabilidade da Anthropic, o Agent SDK estava operando com um subsídio de 15 a 30 vezes em relação ao preço direto da API. Quando você apontava o SDK para sua assinatura, estava pagando entre um quinze avos e um trinta avos do que esses mesmos tokens custavam pela API medida. Essa é a história toda, comprimida em um número.
Assinaturas são precificadas em médias. O provedor assume que a maioria das pessoas usa pouco e algumas usam muito, e os usuários leves financiam silenciosamente os pesados. Esse arranjo funciona enquanto um humano estiver no loop, porque uma pessoa tem um teto. Você só consegue ler tantos diffs, aprovar tantas mudanças, digitar tantos prompts antes de precisar almoçar. Sua própria atenção limita seus gastos.
Os agentes removeram esse limite. Um loop autônomo não tem orçamento de atenção a esgotar. Alguns desses sistemas rodam por horas sem supervisão, e os rankings agora acompanham modelos abertos de 397 bilhões de parâmetros com janelas de contexto de 262k tokens fazendo trabalho agêntico sério. Quando o que consome tokens é software em vez de uma pessoa, a suposição de que "a maioria dos usuários consome pouco" simplesmente falha. Então um plano fixo combinado com um agente virou arbitragem: o provedor precificou para o apetite humano, e o cliente alimentou uma máquina. "Ilimitado" nunca foi uma afirmação sobre o infinito. Foi uma aposta nos limites humanos, e os agentes tornaram essa aposta impossível de ganhar.
Por que o token está se tornando a unidade de precificação
O que estamos vendo é a unidade de precificação migrar do assento para o token. Um assento é um proxy. Representa um humano com throughput limitado e custo aproximadamente previsível. Um token é a coisa em si. A migração para créditos de IA e faturamento por uso é os provedores precificando a unidade real, porque o proxy parou de prever qualquer coisa no momento em que o humano deixou de ser o gargalo.
Isso é desconfortável, mas tem uma virtude genuína: o custo do seu agente se torna legível. Cada loop carrega um medidor agora, e isso deve mudar como você constrói. Uma tentativa de retry que dispara três vezes a mais não é mais gratuita. Um agente que relê o repositório inteiro a cada passo porque você nunca lhe deu memória vira uma linha de item que você pode ver. Prompts de sistema verbosos, chamadas de ferramentas redundantes, uma etapa de juiz LLM que você conectou e esqueceu — sob a tarifa fixa, tudo isso se dissolvia num número mensal fixo. Medido, aparece. A eficiência de tokens vira uma disciplina de engenharia, da mesma forma que a otimização de consultas se tornou uma quando bancos de dados na nuvem começaram a cobrar por varredura.
Há também uma corrente estrutural sob tudo isso. O MCP sem estado está entrando no padrão, de modo que um servidor remoto que antes precisava de sessões fixas e um armazenamento de sessão compartilhado pode rodar atrás de um balanceador de carga simples round-robin. Uma infraestrutura mais barata e elástica para agentes produz mais chamadas de agentes, não menos. A infraestrutura está se preparando para tráfego de alto volume e medido, e o preço está alcançando a infraestrutura.
O que eu faria de fato
Então você está rodando Claude Code ou Cursor como ferramenta principal. A pausa te dá uma janela. Qual é a jogada?
Primeiro, pare de tratar "ilimitado" como algo em torno do qual você pode projetar. Foi um subsídio temporário, e está sendo reprecificado enquanto assistimos. A adoção é a razão pela qual não pode se sustentar — quando uma coorte inteira de engenheiros passa a depender do Claude Code para o trabalho diário, o custo de subsidiá-los sobe mais rápido do que qualquer plano fixo pode absorver. Dependência e subsídio não podem ambos continuar crescendo.
Segundo, meça seu consumo de tokens por tarefa agora, enquanto aprender ainda é barato. Instrumente seus loops antes que o medidor imponha a lição. E mantenha um modelo mais barato em rotação para o trabalho mecânico — os rankings já listam alternativas open-weight capazes a uma fração do custo do modelo principal. Você não precisa do modelo topo da lista para renomear variáveis.
A próxima versão desse preço será mais gentil? Talvez. Mas não será pausada duas vezes. Meça agora, enquanto o medidor ainda está desligado.
