O cache de prompts do GPT-6 recebeu uma atualização na terça-feira: a OpenAI adicionou diagnósticos e pontos de quebra explícitos, com o objetivo de reduzir latência e custo em consultas repetidas.
Principais conclusões
A OpenAI adicionou pontos de quebra explícitos no cache de prompts e diagnósticos para o GPT-6 na terça-feira
O cache de prompts reaproveita o processamento dos primeiros tokens quando as requisições compartilham um prefixo longo, como instruções do sistema ou documentos extensos
Os diagnósticos mostram quais partes de uma requisição acertam ou falham no cache
A OpenAI introduziu o GPT-6 Sol e Luna no mesmo dia, em diferentes faixas de custo
A empresa detalhou as mudanças em uma postagem de 22 de setembro como resposta ao custo de executar prompts longos e repetitivos em modelos de fronteira. O cache de prompts armazena a representação interna computada dos primeiros tokens de um prompt, para que um servidor de modelos não precise reprocessá-la a cada chamada.
Quando as requisições compartilham um prefixo longo, como instruções do sistema ou um documento extenso, o servidor pode reutilizar esse processamento.
A OpenAI disse que a atualização adiciona pontos de quebra explícitos, permitindo que os desenvolvedores definam onde o cache de prompts deve ser dividido, além de diagnósticos que mostram quais partes de uma requisição acertam ou falham no cache. O anúncio chegou junto com o GPT-6 Sol e Luna, dois novos modelos que a empresa lançou no mesmo dia, separando a capacidade de fronteira em diferentes faixas de custo.
Por que os controles de cache importam para cargas de trabalho do GPT-6
O custo da inferência escala com os tokens processados, e falhas no cache forçam o reprocessamento completo de cada token do prompt.
Para um aplicativo que envia milhares de vezes ao dia o mesmo prompt de sistema com 5.000 tokens, mesmo uma taxa modesta de falha vira uma linha no orçamento.
Nos últimos dois anos, o cache de prompts surgiu no setor todo como uma ferramenta automática e pouco visível para desenvolvedores. A mudança da OpenAI para pontos de quebra definidos pelo desenvolvedor acompanha uma tendência mais ampla do setor: dar controle aos criadores sobre a economia da inferência, em vez de deixar a otimização para os provedores de modelos. Enquanto isso, laboratórios concorrentes fazem movimentos semelhantes, já que cargas de trabalho agentic chamam modelos repetidamente com contexto compartilhado.
Também em: OpenAI começa o lançamento do GPT-6 SOL e Luna com novas regras de segurança
A Parallel, uma empresa de automação de pesquisa em IA, disse que o GPT-6 Astra permitiu que seus agentes pesquisassem e sintetizassem dados do mercado de trabalho em metade do tempo e a metade do custo em comparação com modelos anteriores, segundo um estudo de caso da própria OpenAI. A promessa é que melhores taxas de acerto no cache se generalizem para usos de alto volume e repetitivos com prompts, incluindo bots de atendimento ao cliente e agentes de programação que chamam repetidamente as mesmas ferramentas.
Mas uma demonstração de lançamento não é uma economia de um dia comum; os resultados dependem de taxas reais de acerto no cache e de se ferramentas de terceiros exibem esses diagnósticos.
Ainda não está claro quanto dessa economia chega a desenvolvedores menores versus acordos com empresas negociados diretamente com a companhia, nem se provedores concorrentes vão expor controles comparáveis para implantações hospedadas do GPT-6.
Próxima leitura: Modelo rival é superado por Claude Opus 5.5 com custo no trimestre no lançamento