**A OpenAI (OpenAI)** reconheceu as reclamações de usuários por uma semana de que o novo modelo GPT-6 Astra ficou “mais burro após o lançamento” e disse ter corrigido três falhas que teriam causado isso. Ao mesmo tempo, também redefiniu o limite de uso para assinantes do Codex.

Conteúdo principal

  • Usuários da Astra da OpenAI vêm fazendo, logo após o lançamento, testes comparativos lado a lado entre a versão recém-lançada e a versão atual, alegando que o modelo recebeu um “downgrade” silencioso (redução de desempenho).

  • O diretor geral do Codex da OpenAI, Tibo Sottiaux, revelou três causas, sendo uma delas um experimento de contexto com cerca de 4 mil a 5 mil participantes.

  • O modelo carro-chefe anterior, o GPT-5.6 Sol, também havia sido alvo das mesmas suspeitas em julho.

OpenAI, patch emergencial para falhas de qualidade da Astra

O diretor geral do produto Codex, Tibo Sotiao, explicou, por meio de uma atualização divulgada no sábado (horário local), que a equipe rastreou os defeitos junto com os usuários, fez o deploy de um patch corretivo e, antes da meia-noite, zerou totalmente os limites de uso.

Ele disse que “habilidades (skills)” projetadas para modelos de gerações anteriores eram acionadas em excesso também na Astra, o que às vezes impedia que o modelo revalidasse os próprios resultados.

O “experimento de gerenciamento de contexto”, que era uma opção selecionável, também foi um problema. Com esse recurso de experimento ativado, o modelo encerrava a conversa cedo demais ou repetia casos em que respondia a mensagens já antigas. A OpenAI estimou que cerca de 4 mil a 5 mil usuários foram expostos a esse experimento e desativou completamente a função de testes.

Além disso, alguns ajustes do motor estavam configurados incorretamente, e descobriu-se que a qualidade das respostas de ‘tail traffic’ roteado por aquele motor caía de forma estatisticamente significativa. A empresa removeu esses motores e fez uma série de pequenas correções em paralelo. Depois, Sotiao afirmou em um post que “agora a Astra rastreia com mais precisão a ‘última mensagem’ do usuário”.

Para ver também: Mesmo com entrada de US$ 2160 milhões em recursos de ETF, peso de um “muro” de oferta de US$ 2800

“Retrocesso na capacidade de codar” por parte dos desenvolvedores… movimentos para evitar a Astra

A controvérsia se espalhou no X (antigo Twitter) durante toda a semana. Os desenvolvedores aplicaram, no dia do lançamento da Astra e na versão atual, o mesmo prompt e as mesmas configurações para gerar o código e, então, compararam os resultados lado a lado.

Até há poucos dias, o desenvolvedor **Pranjal Paliwal** havia elogiado a Astra. Porém, depois de revisar novamente o código que o modelo escreveu para ele, reverteu a avaliação e concluiu: “não é avanço, é retrocesso”.

O desenvolvedor **Dax Raad**, que cria a ferramenta de codificação “Opencode”, decidiu voltar a todo o time para o antigo GPT-5.6 Sol. Segundo ele, depois de migrar para a Astra, o custo dobrou, mas a percepção de desempenho piorou.

Um usuário da comunidade da OpenAI analisou, em uma postagem, que por meio de um relatório “a Astra de hoje está quase no mesmo nível de desempenho que o Sol nas mesmas tarefas, com as mesmas condições de reexecução”. Porém, nem todos concordam. Outro usuário, usando o pseudônimo “Antikythera”, rebateu: “A Astra já foi, desde o começo, preguiçosa e vivia jogando excesso de marcadores (bullets). Agora é que as ilusões dos usuários foram quebradas”.

GPT-6, capacidade e limites de cobrança sufocando a Astra

O problema de capacidade (capacity) começou a seguir a Astra como uma sombra a partir do momento em que entrou em um grande lançamento no início de setembro.

De acordo com relatos de usuários, a OpenAI reduziu bastante os limites de uso da Astra em algumas contas do ChatGPT classificadas como usuários pesados (heavy users) e suspendeu temporariamente a nova assinatura Pro, de US$ 200 por mês. Essa medida foi confirmada oficialmente por Sotiao em um post no blog datado de 10 de setembro.

Atualmente, a tarifa da Astra foi definida em US$ 10 por 1 milhão de tokens de entrada e US$ 50 por 1 milhão de tokens de saída. Isso equivale a cerca de 2,5 vezes o preço que o Sol recebia na época do lançamento. Mesmo considerando que é um modelo de alto desempenho, esse é o contexto em que o debate sobre a relação custo-benefício está aumentando.

Esta polêmica é também um caso em que o modelo carro-chefe da OpenAI recebeu a mesma crítica duas vezes consecutivas em menos de dois meses. Em julho, surgiu a observação de que o modo de raciocínio de maior dificuldade do Sol “mudou superficialmente da noite para o dia”. Na época, Sotiao negou que houvesse queda de desempenho de propósito, reconhecendo apenas que “experimentos sobre o esforço de raciocínio (reasoning effort)” estavam em andamento.

Próxima leitura: Jenson Huang, da Nvidia: “Pânico com segurança de IA, vantagem para empresas de cibersegurança”