O cache de prompts do GPT-6 recebeu uma atualização na terça-feira: a OpenAI adicionou diagnósticos e pontos de quebra explícitos, com o objetivo de reduzir latência e custo em consultas repetidas.

Principais conclusões

  • A OpenAI adicionou pontos de quebra explícitos no cache de prompts e diagnósticos para o GPT-6 na terça-feira

  • O cache de prompts reaproveita o processamento dos primeiros tokens quando as requisições compartilham um prefixo longo, como instruções do sistema ou documentos extensos

  • Os diagnósticos mostram quais partes de uma requisição acertam ou falham no cache

  • A OpenAI introduziu o GPT-6 Sol e Luna no mesmo dia, em diferentes faixas de custo

A empresa detalhou as mudanças em uma postagem de 22 de setembro como resposta ao custo de executar prompts longos e repetitivos em modelos de fronteira. O cache de prompts armazena a representação interna computada dos primeiros tokens de um prompt, para que um servidor de modelos não precise reprocessá-la a cada chamada.

Quando as requisições compartilham um prefixo longo, como instruções do sistema ou um documento extenso, o servidor pode reutilizar esse processamento.

A OpenAI disse que a atualização adiciona pontos de quebra explícitos, permitindo que os desenvolvedores definam onde o cache de prompts deve ser dividido, além de diagnósticos que mostram quais partes de uma requisição acertam ou falham no cache. O anúncio chegou junto com o GPT-6 Sol e Luna, dois novos modelos que a empresa lançou no mesmo dia, separando a capacidade de fronteira em diferentes faixas de custo.

Por que os controles de cache importam para cargas de trabalho do GPT-6

O custo da inferência escala com os tokens processados, e falhas no cache forçam o reprocessamento completo de cada token do prompt.

Para um aplicativo que envia milhares de vezes ao dia o mesmo prompt de sistema com 5.000 tokens, mesmo uma taxa modesta de falha vira uma linha no orçamento.

Nos últimos dois anos, o cache de prompts surgiu no setor todo como uma ferramenta automática e pouco visível para desenvolvedores. A mudança da OpenAI para pontos de quebra definidos pelo desenvolvedor acompanha uma tendência mais ampla do setor: dar controle aos criadores sobre a economia da inferência, em vez de deixar a otimização para os provedores de modelos. Enquanto isso, laboratórios concorrentes fazem movimentos semelhantes, já que cargas de trabalho agentic chamam modelos repetidamente com contexto compartilhado.

Também em: OpenAI começa o lançamento do GPT-6 SOL e Luna com novas regras de segurança

A Parallel, uma empresa de automação de pesquisa em IA, disse que o GPT-6 Astra permitiu que seus agentes pesquisassem e sintetizassem dados do mercado de trabalho em metade do tempo e a metade do custo em comparação com modelos anteriores, segundo um estudo de caso da própria OpenAI. A promessa é que melhores taxas de acerto no cache se generalizem para usos de alto volume e repetitivos com prompts, incluindo bots de atendimento ao cliente e agentes de programação que chamam repetidamente as mesmas ferramentas.

Mas uma demonstração de lançamento não é uma economia de um dia comum; os resultados dependem de taxas reais de acerto no cache e de se ferramentas de terceiros exibem esses diagnósticos.

Ainda não está claro quanto dessa economia chega a desenvolvedores menores versus acordos com empresas negociados diretamente com a companhia, nem se provedores concorrentes vão expor controles comparáveis para implantações hospedadas do GPT-6.

Próxima leitura: Modelo rival é superado por Claude Opus 5.5 com custo no trimestre no lançamento