Cinco novos modelos em trinta dias. Contei numa sexta-feira, sentada na frente de um painel do Stripe que me esforço muito para manter pequeno, porque sou uma pessoa só enviando um produto e "equipe de avaliação de modelos" não é uma linha de orçamento que eu tenha.
Aqui está a armadilha que ninguém avisa quando todo seu setor muda de ferramentas toda semana. Correr atrás de cada lançamento e você para de construir. Você vira um avaliador de ferramentas em tempo integral que por acaso tem um GitHub. Ignorar a agitação e uma manhã sua fatura dobra porque um fornecedor mudou os termos de faturamento enquanto você dormia. Fiz as duas coisas. Então é sobre isso que eu realmente quero falar: como mantenho meu fluxo de trabalho de programação com IA atualizado quase toda semana sem perder a semana com isso.
O mês que quebrou meus velhos hábitos
Deixa eu só percorrer junho de 2026, porque é quase engraçado.
OpenCode ultrapassou o Cursor para o posto de número 1 no ranking de ferramentas de desenvolvimento, uma ferramenta que mal aparecia um ano atrás, agora sentada em uma contagem de estrelas no GitHub de seis dígitos. Um novo modelo de peso aberto apareceu barato no WebDev Arena e derrubou o preço dos titulares pelos quais eu já pagava. GitHub Copilot mudou toda a sua base para AI Credits baseados em uso, e o preço fixo simplesmente sumiu. E Anthropic anunciou uma divisão de faturamento que teria tirado o Agent SDK e claude -p dos limites de assinatura, mandou os e-mails de reivindicação, e depois voltou atrás em tudo cerca de duas semanas depois após a reação.
Leia o da Anthropic de novo. Eles publicaram o anúncio, abriram o processo de reivindicações, rodaram por aproximadamente duas semanas, depois pausaram e reformularam após a reação.
Esse é o trabalho agora. O chão continua se movendo sob seus pés, e a única questão real é quais partes você toca e quais partes você deixa completamente em paz.
O que realmente verifico no meu fluxo de trabalho de programação com IA toda semana
Tenho um ritual. Sexta à tarde, quarenta minutos, um temporizador para não extrapolar. Mexo em três coisas e nada mais.
Roteamento de modelos. Qual modelo faz qual trabalho e quanto cada um me custa. Quando o modelo de peso aberto barato chegou, não derrubei minha stack toda. Apontei para uma tarefa chata e de alto volume, limpeza em massa de metadados, a coisa que rodo milhares de vezes por semana. A conta que justifica uma troca é mais ou menos assim — os números são uma ilustração da mecânica, não uma fatura medida: um modelo em uso custando uns 180 dólares por mês nesse trabalho contra uns 95 pelo mesmo volume com uma qualidade com a qual dá para viver. Isso lhe garante uma vaga para essa tarefa específica. Não chegou perto do meu código de produto, e não vai até que prove em algum lugar de baixo risco por um mês.
Termos de faturamento. Esse é o que a maioria dos desenvolvedores pula, e é o que realmente morde. A mudança do Copilot não foi uma atualização de funcionalidade, foi um golpe na minha margem. Quando as completions ficaram gratuitas mas o chat, os agentes e o CLI começaram a consumir créditos, exatamente as coisas nas quais me apoio o dia todo de repente ganharam um medidor. Você tem que ler changelogs de faturamento da mesma forma que lê notas de versão, porque para a sua carteira é exatamente isso que eles são.
O topo dos rankings. Não para trocar por capricho, apenas para ler o clima. OpenCode no topo dos gráficos enquanto continua agnóstico quanto ao modelo entre dezenas de provedores me diz que o lock-in está perdendo e a portabilidade está ganhando. Bom saber. Anoto. Não migro nada numa sexta porque um gráfico se moveu.
Esses três são baratos de verificar e caros de ignorar. Números, termos e rankings. Você consegue examinar tudo em menos tempo que um intervalo para café.
O que mantenho deliberadamente entediante
Aqui está minha real vantagem, e é quase embaraçosamente monótona. A maior parte da minha stack não se mexe.
Meu loop principal mal mudou em meses: Claude Code no terminal, meus próprios scripts, meu conjunto de testes, meu caminho de deploy. Os modelos dentro desse loop entram e saem constantemente. O loop em si mantém sua forma. Meus prompts vivem no git. Meus scripts de avaliação são meus, não o painel de algum fornecedor ao qual eu perderia acesso. Quando um modelo cai, aponto meu harness existente nele e obtenho um número em cerca de vinte minutos. O harness é o que me protege, muito mais do que qualquer modelo individual.
É exatamente por isso que a instabilidade de faturamento da Anthropic nunca me tocou. Meu fluxo de trabalho não pressupõe nenhuma estrutura de faturamento específica. Pressupõe que vou pagar por tokens de um jeito ou de outro e rastreia os gastos por conta própria. Então quando a mudança foi pausada e reformulada, não tive nada a desfazer. As pessoas que se queimaram foram as que tinham conectado seu pipeline a um modelo de faturamento que durou duas semanas.
O que fica congelado, concretamente? Meus schemas de dados. As interfaces do meu MCP server. Meus scripts de deploy, e minha definição de "pronto." Esses são estruturais, então os mudo devagar, com deliberação, e apenas com uma razão que posso dizer em voz alta. Mesmo quando o padrão por baixo muda, como as recentes adições à spec do MCP, eu leio as notas, arquivo e adoto apenas a parte que resolve um problema que tenho hoje.
Se você tratar sua fundação como se ela também estivesse disponível para reavaliação semanal, você realmente não tem fundação. Reescreva seu conjunto de testes cada vez que um benchmark oscile e a certa altura você não tem mais um conjunto de testes, só tem um histórico de commits cheio de ansiedade.
A regra que rabisquei num post-it
Reavalie as entradas semanalmente. Mantenha as interfaces estáveis.
Modelos, preços, rankings: esses são as entradas. Eles entram e saem e são intercambiáveis por design, baratos de testar e baratos de largar. As interfaces entre suas peças são o edifício: prompts como código, o harness de avaliação, seus schemas, o caminho de deploy. Você renova um edifício. Você não o derruba porque a loja do outro lado da rua ganhou uma nova pintura.
Quando Claude Fable 5 entrou em disponibilidade geral no mês passado, foi um avanço genuíno, e o adotei em uma semana. Levou uma tarde, porque apontei meu harness existente no claude-fable-5, vi os números voltar melhores nas minhas próprias avaliações e publiquei. Isso é adaptação rápida. Só pareceu rápido porque tudo ao redor da troca era entediante, estável e já construído anos antes de Fable existir.
Então quando o próximo cinco-modelos-em-um-mês chegar, e vai chegar, provavelmente este mês, não estou me preparando para o impacto. Tenho meu temporizador de sexta e minha espinha dorsal entediante. Os quarenta minutos da próxima sexta já estão bloqueados no meu calendário. A agitação é só a entrada. Construa o harness primeiro, mantenha-o estável, e deixe os modelos se enfileirarem atrás dele.
