A Sonnet 5.5 foi lançada — este modelo é simplesmente incrível: na avaliação de testes de Agentic coding, ele obteve uma pontuação 4 pontos maior do que a Opus 5.5.
Em termos de preço, também é bem barato. O custo por um milhão de tokens de entrada e saída é de US$ 2 e US$ 10, respectivamente, igual ao GPT-6 Sol. Além disso, em velocidade de execução, ele é 30% mais rápido do que o Sonnet 5; e, segundo a própria Claude, os custos também foram reduzidos em 30%.
Quanto ao motivo de o desempenho dele em Agentic coding ser parecido com o da Opus 5.5 (ou até maior), vale a pena dar uma olhada nos testes de preço.
Com o Sonnet 5.5 no nível máximo de esforço (max), o custo para a mesma tarefa é muito mais alto do que o da Opus 5.5 — quase empatando ou até superando. Provavelmente é essa a razão de ele ter uma pontuação tão alta.
Então, quando estiver usando a Opus 5.5 ou a Sonnet 5.5, não deixe de desativar o max: em algumas tarefas complexas, ele pode acabar gerando um preço muito caro, quase chegando ao nível do Claude Fable 5.1.
Muse, esta classe de Agent com máquina virtual: há um mundo de possibilidades
Pessoal, dizem que o DeepSeek Harness é bastante completo e preciso ao buscar conteúdo no mercado doméstico.
A propósito, eu também tenho usado o Muse ultimamente; então pedi para ele instalar o DeepSeek Harness na máquina virtual do Muse Cloud.
Sempre que houver qualquer busca ou consulta de informações relacionadas ao mercado doméstico, é só chamar diretamente o DeepSeek Harness na máquina virtual para consultar.
Usar o Opus 5.5 para fazer animações de finalização de jogo também é bem legal!
No começo, ele gerava ícones SVG 2D; depois, fizemos ele mudar para esse efeito 3D, que fica mais rico, além de otimizar um pouco a iluminação e outros aspectos.
Esta é a primeira versão do baú; depois ainda tem uma versão com emblema.
Vou tentar fazer um vídeo com uma expressão artística para o Festival do Meio Outono usando ela, desejando a todos um Feliz Festival do Meio Outono!
A música foi criada a partir de uma variação eletrônica das partituras de 《Moon River (O luar representa o meu coração)》.
Ele não só consegue criar de forma original, como também consegue fazer mixagens, fazer alterações e ainda encaixar tudo no timing certo—tá demais, muito incrível!
Finalmente usei o Muse, que está super em alta ultimamente!
O controle de risco da Anthropic diante da Meta é brincadeira de criança. O produto do Zuckerberg diz que não permite que você use, então você nem consegue usar—nem dá pra registrar uma conta.
Sinto que agora só dá para ir por dois extremos quando lançamos modelos:
Ou você faz o modelo mais poderoso possível no mais barato, ou então você simplesmente cria o modelo de ponta; caso contrário, simplesmente não há tanto “buzz” nem uso.
Os dois lançamentos da noite passada: Grok 4.7 e Mimo V2.6. As capacidades de ambos são bem parecidas nos vários testes e avaliações de terceiros, mas a diferença de preço é enorme.
O Mimo V2.6 Pro, quando há acerto de cache, cobra ¥0,025 pela entrada e ¥6 pela saída. Já o Grok 4.7, quando convertido de dólares para ienes, cobra ¥3,35 pela entrada, e a saída chega a incríveis ¥40.
Ao ver alguns comentários e avaliações sobre o Grok4.7 nesta manhã no Twitter, a crítica principal é que ele é caro, e outra é que o desempenho talvez não seja tão bom — além de ser mais lento e pior.
O preço do Mimo é mais barato do que o preço “vale” atual do DeepSeek V4 (seja Flash ou Pro) em pelo menos o dobro.
Por exemplo, no Mimo V2.6 Flash, o preço de saída é ¥2, enquanto no DeepSeek V4.1 Flash o preço de saída é ¥4.
Além disso, pelo que parece, o Mimo V2.6 está em uma espécie de “limitado/grátis por tempo” no OpenCode a partir da semana que vem.
O Mimo também lançou seu próprio app de desktop. Parece que existe um preço de assinatura separado — vale a pena testar. No app de desktop vem um modelo de geração de imagens, que pode ser usado junto para desenhar algumas interfaces e coisas assim.
Acho que as duas empresas estão pensando que a OpenAI provavelmente vai lançar um novo modelo ainda hoje à tarde (talvez GPT-6 Sol e GPT-6 Luna, que parecem ser bem baratos). Elas queriam lançar antes da OpenAI, e acabou coincidindo.
A evolução no mundo da IA (o “AI圈”) talvez ninguém tivesse previsto: depois do lançamento do GPT-Astra e do Fable, ainda apareceu um novo tipo de modelo tão quente, e que realmente ficou em alta.
O JEV ter feito tanto sucesso tem dois motivos principais. Por um lado, ele de fato resolve alguns problemas. Por outro, a razão central é que sua vantagem em velocidade é extremamente fácil de divulgar.
Ele consegue tanto velocidade quanto volume. Você vai perceber que, nos exemplos em páginas que demonstram o JEV, eles sempre mostram a velocidade e a quantidade de processamento. Isso dá um estímulo imediato e mostra que todo mundo leva muito a sério esses dois pontos; por isso, vários demos e cases acabam sendo compartilhados de forma frenética.
Claro que esse modelo não é perfeito para tudo. Se você quiser fazer com que ele trabalhe sozinho, apenas como um LLM, os cenários de aplicação são relativamente limitados; mas, se você adicionar ajuda de um modelo grande ou outras ferramentas, o resultado fica muito bom.
Além disso, ele ainda está faltando uma parte multimodal. Se ele tiver multimodal, especialmente em organização e classificação de materiais ou na produção de conteúdos longos, a experiência fica simplesmente muito mais agradável.
Por coincidência, ontem eles anunciaram que estão liberando para todo mundo, sem necessidade de waitlist. Cada usuário tem 5 dólares de crédito gratuito.
Esse modelo é bem econômico: a entrada custa apenas 0,042 dólar; a saída é gratuita. Então, com 5 dólares, dá para usar por muito, muito tempo.
Aliás, na semana passada atualizamos o nosso Next Token, e o principal assunto foi:
O modelo JEV e questões relacionadas: por exemplo, muita gente consegue treinar modelos parecidos em apenas um dia. Modelos como GPT-6 e Fable, que já são bem profissionais em treinamento de modelos, abrem bastante espaço para arbitragem/otimização com treinamento de modelos menores. Problemas de colaboração entre modelos pequenos e grandes.
A evolução da interface de interação: agora chat, navegador e lista de tarefas estão no mesmo software. Inclusive, o Codex recentemente atualizou plugins de navegador e também já suporta várias contas (por exemplo, o MCP do Notion pode entrar em múltiplas contas e puxar informações). Muitas vezes, ele já está substituindo nossa interface de sistema. Essa nova forma de interação pode acabar educando os usuários, de modo quase imperceptível.
Ontem também usei o JEV para fazer um exemplo de geração de uma cena 3D em tempo real. Gostei bastante — e muita gente também. No programa, discutimos basicamente isso e outras notícias; também falamos sobre a minha opinião, a do Qiaomu, a do Yang Pan e a do pessoal do Juzi. Bem-vindos para ouvir!
Eu usei modelos JEV da @typesafeai para criar um gerador de cenas 3D em tempo real。
A velocidade é simplesmente absurda!
A partir de dezenas a centenas de modelos 3D pré-prontos, faço centenas de verificações em paralelo com base no texto de entrada。
Ao mesmo tempo, trato a coloração, a iluminação, a posição e o estado desses materiais — e em um segundo eu monto uma cena interna que atende aos requisitos.
Usei um modelo JEV para criar um gerador de cenas 3D em tempo real。
A velocidade é simplesmente absurda!
A partir de dezenas ou até centenas de modelos 3D pré-fabricados, faço, com base no texto de entrada, centenas de avaliações em paralelo.
Ao mesmo tempo, trato a coloração, a iluminação, a posição e o estado desses materiais para montar, em um segundo, uma cena interna que atenda aos requisitos.