← Blog

Setembro de 2026: 47 modelos novos e uma régua diferente

24 set 2026

⏱️ Tempo de leitura: ~5 minutos

Introdução

Quarenta e sete modelos em trinta dias. Esse é o número catalogado de lançamentos em setembro de 2026 — e ele já diz algo sobre o estado do mercado: parou de fazer sentido acompanhar lançamento por lançamento.

Mas o dado mais interessante do mês não está na contagem. Está no argumento de venda. Pela primeira vez em um ciclo recente, o lançamento mais comentado não chegou prometendo ser mais inteligente. Chegou prometendo ser mais barato por tarefa concluída. A régua mudou de lugar.

O topo da fronteira

GPT-6 Astra (OpenAI, 3 de setembro). O lançamento de maior peso do mês. Janela de contexto de cerca de 1,05 milhão de tokens, saída de 128 mil, preço de US$ 10 por milhão na entrada e US$ 50 na saída. A OpenAI o posiciona como estado da arte em uso de computador, navegação, engenharia de software, cibersegurança, ciência e trabalho profissional. Detalhe relevante para quem cuida de risco: foi o primeiro modelo da casa a cruzar um limiar crítico em cibersegurança, e por isso essas capacidades saíram com liberação controlada. Em 22 de setembro a família ganhou mais dois membros, GPT-6 Sol e GPT-6 Luna.

Claude Opus 5.5 (Anthropic, 22 de setembro). O movimento que mexeu com a conta. Primeiro modelo da família 5.5, a US$ 4 na entrada e US$ 20 na saída por milhão de tokens — 20% abaixo do Opus 5. A empresa afirma, porém, que o custo típico de carga de trabalho cai cerca de 40%, porque o modelo consome menos tokens para terminar a mesma tarefa. O cache acompanhou: escrita de US$ 6,25 para US$ 5, leitura de US$ 0,50 para US$ 0,20. A saída ficou mais de 30% mais rápida.

Vale separar o que é aferido do que é alegação da fabricante. O preço de tabela é fato; a economia de 40% é afirmação da Anthropic, que depende do perfil da carga. O exemplo divulgado é concreto: portar um HAProxy legado de C para Rust levou 9,5 horas, contra 12 horas do Fable 5.1 — modelo consideravelmente mais caro por token.

Claude Fable 5.1 e Mythos 5.1 (1º de setembro). Atualizações da linha anterior que duraram três semanas no centro das atenções antes de serem ofuscadas pelo próprio fornecedor.

Grok 4.7 (xAI, 21 de setembro). Upgrade sobre o 4.6 mantendo o mesmo preço, com ganhos espalhados por benchmarks.

Gemini 3.8 Flash e Flash Cyber (2 de setembro) e Gemini 3.8 Live (15 de setembro), do Google.

O que, de novo, não saiu

Duas ausências merecem registro, porque contradizem o que foi anunciado com estardalhaço meses atrás.

Gemini 4 continua em pré-treino. Não existe página de modelo, identificador de API, preço nem tabela de benchmark. As estimativas apontam para novembro ou dezembro, e o rumor de lançamento em setembro não se confirmou. O carro-chefe segue sendo o Gemini 3.8 Flash.

Grok 5 também não apareceu. A linha estável continua sendo a 4.6/4.7 — o que soma mais um trimestre à lista de prazos perdidos.

O dilúvio do outro lado

Se o topo se movimentou por preço, a base se movimentou por volume — e a maior parte dele é aberta.

A K2 Horizon chegou em 3 de setembro como família inteira, de uma vez: 0,9B, 3,7B, 7B, 32B, uma 375B A23B e uma variante MoVA de 36B A4B, todas com reasoning e pesos abertos. A DeepSeek lançou o V4.1 Flash em 10 de setembro, aberto, com reasoning e visão. A Alibaba manteve cadência quase semanal com Qwen3.8-Max, Omni-Flash, LiveTranslate e Qwen-Image 2.1. A Xiaomi entregou MiMo V2.6 em versões Pro e Flash. Somam-se ainda MiniMax H3 Max, a família Nex-N2.5, as variantes setoriais do Ling 3.0 Flash — uma para finanças, outra para saúde — e a linha LLaDA.

Chama atenção o padrão: não são modelos soltos, são famílias completas, cobrindo de sub-1B a centenas de bilhões de parâmetros, liberadas no mesmo dia.

Conclusão

Para quem opera infraestrutura, a leitura prática de setembro é direta. A competição no topo deixou de ser travada em pontos percentuais de benchmark e passou a ser travada em custo total para concluir o trabalho — que envolve preço por token, quantidade de tokens gastos, velocidade de saída e eficiência de cache. É uma métrica bem mais próxima da planilha do que do leaderboard.

E enquanto isso, o volume de modelos abertos torna cada vez mais defensável desenhar arquiteturas híbridas: modelo aberto onde a tarefa é previsível e barata, modelo de fronteira onde o custo do erro é alto.

Quarenta e sete lançamentos em um mês não é sinal de maturidade. Mas a mudança do argumento — de "sou mais inteligente" para "custo menos para entregar" — é. Mercado que começa a competir por preço é mercado que está deixando de ser novidade e passando a ser infraestrutura.

Get the latest posts

New articles on AI, Vibe Code and Builder Code — by email or Telegram.

or
Get it on Telegram

By subscribing, you agree to receive emails/messages and to the Privacy Policy. You can unsubscribe anytime. No spam.