O Claude Opus 5.5 entrou no ar dentro do Perplexity Computer na terça-feira como o novo nível de esforço Standard da plataforma, com a própria conta da Perplexity publicando números de benchmarks minutos depois da mudança.

Principais conclusões

  • O Claude Opus 5.5 se tornou o novo nível padrão de esforço do Perplexity Computer na terça-feira

  • O modelo obteve 0,610 no benchmark WANDR da Perplexity, a um custo de US$ 4,13 por tarefa

  • Arav Srinivas disse que o Opus 5.5 se tornaria a opção padrão para todos os usuários do Perplexity Computer

  • O Perplexity Computer é um produto de agente de IA baseado no navegador que executa tarefas de várias etapas, incluindo pesquisa e compras

O modelo obteve 0,610 no benchmark interno WANDR da Perplexity, uma avaliação de pesquisa ampla e profunda, ao custo de US$ 4,13 por tarefa, registrando que o resultado “superou ligeiramente” o modelo rival Fable 5.1. A Perplexity Computer é o produto de agente de IA baseado no navegador da empresa, que executa tarefas de múltiplas etapas como pesquisas e compras em nome do usuário, em vez de apenas responder a consultas de chat.

O CEO da Perplexity, Arav Srinivas, seguiu com sua própria postagem confirmando o rollout para todos os usuários da Perplexity Computer, enquadrando a vitória pela eficiência de custos em vez da pontuação bruta.

Ele disse que o Opus 5.5 “se compara favoravelmente” ao Fable 5.1 “por uma fração do custo” e se tornaria a opção padrão daqui para frente.

Uma terceira conta, a plataforma de rastreamento de IA TestingCatalog, marcou independentemente o lançamento como um novo resultado de ponta em tarefas de codificação com agentes e de uso de computador, descrevendo-o como um momento de “desaceleração exponencial”, uma referência ao estreitamento dos ganhos entre lançamentos consecutivos na fronteira.

Por que o Custo por Tarefa Está se Tornando o Novo Painel de Classificação

Os lançamentos de modelos costumavam competir apenas com base na pontuação dos benchmarks. O lançamento do Claude Opus 5.5 marca uma mudança para comparações normalizadas por custo, em que o valor do modelo em dólares por tarefa importa tanto quanto a precisão bruta para empresas que operam agentes em escala.

O benchmark WANDR da Perplexity mede o quão bem um modelo lida com tarefas abertas de pesquisa que exigem múltiplas etapas de busca e raciocínio, e não respostas pontuais para perguntas únicas.

Um custo de US$ 4,13 por tarefa só importa em escala, e é exatamente o patamar que as implantações de agentes de IA empresariais começaram a atingir.

De Assistente de Chat a Plataforma de Agentes Pagos

A Anthropic construiu sua reputação com o chatbot Claude antes de avançar para fluxos de trabalho de agentes empresariais até 2026, incluindo integrações de segurança com empresas como a divisão Unit 42 da Palo Alto Networks, que começou a combinar modelos Claude com ferramentas contínuas de defesa contra ameaças.

O lançamento Opus 5.5 amplia essa investida para um produto de consumo de terceiros, em vez da interface própria da Anthropic — um movimento de distribuição que espelha como a OpenAI colocou o GPT-6 Astra dentro de ferramentas de parceiros como a geradora de vídeos da Higgsfield AI.

Também é interessante: O Claude da Anthropic para Consultores Financeiros passa pelo primeiro teste real com Schwab e BlackRock Data

O que acontece quando as vantagens da fronteira começam a diminuir

O enquadramento da TestingCatalog aponta para um debate em andamento entre laboratórios de IA sobre se gerações sucessivas de modelos entregam avanços menores, mesmo com custos caindo mais rápido. Se a vantagem do Opus 5.5 sobre o Fable 5.1 for marginal em pontuação, mas decisiva em preço, compradores podem começar a escolher modelos com base em curvas de custo — em vez da posição no ranking.

Isso mudaria a forma como os laboratórios comercializam lançamentos e a rapidez com que concorrentes respondem com cortes de preço próprios.

Leia a seguir: O avanço da IA corporativa recebe acordo oficial da Anthropic na Societe Generale