Сонет 5.5 выпустили — и это удивительная модель: её результат в тестах на агентное программирование на 4 балла выше, чем у Opus 5.5.
По цене тоже очень доступно: стоимость ввода и вывода за миллион токенов составляет $2 и $10 соответственно — как у GPT-6 Sol. Кроме того, по скорости работы она быстрее, чем Sonnet 5, на 30%, а в официальном заявлении Claude говорится, что и стоимость снизилась на 30%.
Что касается того, почему её результаты в агентном программировании примерно такие же, как у Opus 5.5, а местами даже выше — посмотрите на ценовые тесты.
При максимальном уровне усилий Sonnet 5.5 на те же задачи стоит намного дороже, чем Opus 5.5: почти сравнялось по цене, а кое-где даже обогнало. Возможно, именно поэтому её баллы такие высокие.
Так что, когда вы используете Opus 5.5 или Sonnet 5.5, ни в коем случае не включайте max: в некоторых сложных задачах она может выдать крайне дорогие расходы — почти как у Claude Fable 5.1
Codex обновили — навигация в интерфейсе сильно изменилась. Слева добавили новую панель: теперь плагины, запланированные задачи, сайты, проекты, карты и PR вынесены в левую боковую навигацию.
Появились две новые страницы: «Библиотека ресурсов» и «Изображения».
В «Библиотеке ресурсов» собраны все ваши изображения, картинки, файлы, папки и избранное. Здесь также хранятся все документы, которые вы создаёте, и даже документы с изображениями, созданными с помощью AI.
На стороне «Изображения» — это те шаблоны и подсказки, которые раньше были на исходной странице картинок ChatGPT, где использовалась модель GPT-Image.
Вообще, так стало даже лучше.
Иначе раньше всё было наверху: по мере того как проектов и чатов становилось всё больше, каждый раз, чтобы найти те несколько входов вверху, приходилось прокручивать назад — это реально раздражало.
К тому же на этот раз «Наставник» (CodePilot) опередил Codex на одну версию: несколько месяцев назад он уже добавил «Библиотеку ресурсов», где сводятся все результаты вашего контента, сгенерированного AI, например изображения, видео, веб-страницы, аудио и другие материалы.
Вы также можете прямо из результатов в библиотеке переходить обратно в чат, чтобы посмотреть, как именно это было сделано — очень удобно для управления и чтобы другим моделям было проще вызывать и переиспользовать эти материалы.
Но, конечно, есть и те, кому это неудобно: говорят, что не привычно смотреть так. При таких больших изменениях, очевидно, это тоже будет
С анимацией для игровых расчётов от Opus 5.5 тоже очень круто!
Изначально он генерировал 2D-иконки в формате SVG, а потом попросили сделать вот такой 3D-эффект — стало богаче, плюс он немного оптимизировал, например, световые эффекты
Это первый вариант сундука, дальше будет ещё версия с эмблемой
Попробовал(а) сделать с его помощью видео с художественным выражением к Празднику середины осени (Середина осени), чтобы поздравить всех с Праздником середины осени!
Музыка была собрана как электронные вариации по нотам «Луна — это то, что представляет моё сердце».
Он умеет не только создавать оригиналы, но и сводить, и переделывать, а ещё — идеально поймал(а) момент, это просто невероятно!
Muse действительно “горит” — прямо заняла первое место в App Store в США. В день официального подключения Shopify сразу вырос на 13%.
Как раз мой друг, который делает Today AI, тоже запустили в Китае.
Muse популяризовала концепцию Personal Agent — хотя раньше признаки были и у Grok bot.
Жаль только, что пользоваться Muse у нас довольно сложно и энергозатратно (ведь у Meta десятилетия накопленного опыта в контроле рисков, и требования строже, чем у Anthropic).
Today AI, похоже, тоже является одним из первых в Китае Personal AI, сделанным настолько полноценно.
Мне кажется, этот вид Agent наконец-то нащупал черновик AI-приложения, которое не требует входного порога. Впервые я осознал: конечным пользователям на самом деле не так важно, на какой модели работает твой Agent. Даже если нельзя переключать модель — людям всё равно нравится пользоваться.
На мой взгляд, у Personal AI есть три ключевых потребности:
— Понимает ли он тебя? — Может ли он сам находить тебя? — Когда находит, может ли, опираясь на контекст, давать действительно полезные рекомендации?
Например, Today AI состоит в основном из трёх частей:
Облачный компьютер: у прежних виртуальных машин была проблема — они могут выключаться. А я думаю, что “облачный компьютер без выключения” — очень важная составляющая Personal AI. Всё твое остаётся на этой машине: это реально облачный компьютер. Подход Today согласуется с Muse: всё происходит “незаметно”, пользователю вообще не нужно ощущать наличие облачного компьютера.
Коннектор: может ли он очень быстро и в один клик доставать контекст из других каналов? Самое сложное — получить контекст. За рубежом большие компании вроде Google сразу дают MCP, а в Китае, возможно, с этим сложнее.
И ещё — контекст и способность, опираясь на него, генерировать множество активных действий и уместных советов, это тоже довольно важно.
Вообще для большинства людей сценарии “тяжёлой” продуктивности — скорее меньшинство. Часто нужно лишь, чтобы AI помог напомнить информацию, разложить по полочкам и что-то организовать.
В жизни же есть множество ситуаций, где AI реально нужен: он может подключаться к Apple Health, каждый день — в зависимости от твоего состояния — давать рекомендации. Имея эти контексты, рекомендации по здоровью получаются куда точнее и полнее.
Учёба, финансовое положение, дети и семейные бытовые хлопоты — всё это тоже требует долгого отслеживания.
Конечно, скажу честно: для продуктов такого типа точность растёт всё больше по мере того, как настроен “коннектор контекста”. Поэтому если поначалу кажется, что он тебя не очень понимает — можно понаблюдать несколько дней и пообщаться больше.
Это также показывает: как дать пользователю “незаметно” подключиться — очень важная тема.
Я думаю, вот в чём два ключевых качества Personal Agent:
Первое: тебе не нужно заботиться о тонких технических деталях на уровне AI — просто пользуйся;
Второе: ты можешь очень быстро синхронизировать свою информацию. Во многих случаях, когда накопленных данных становится достаточно, тебе даже не нужно начинать говорить — он уже знает, что ты хочешь сделать, и уже помогает тебе это подготовить.
Наконец-то пользуюсь нашумевшей в последнее время Muse!
Система контроля рисков Anthropic перед Meta — просто детский сад. Если Цукерберг говорит, что вам нельзя это использовать, то вы и правда не сможете: даже аккаунт зарегистрировать не дадут.
Вам вообще не дают даже шанса, чтобы вас забанили.
Похоже, сейчас запуски моделей идут только по двум крайностям:
либо сделать самую мощную модель на самом дешёвом варианте, либо сразу выпустить передовую модель — иначе вообще нет ни обсуждений, ни реального использования.
Два релиза прошлой ночи: Grok 4.7 и Mimo V2.6. По возможностям в разных сторонних тестах они примерно одинаковые, но по цене разница слишком большая.
Mimo V2.6 Pro при попадании в кэш: цена ввода ¥0.025, вывода ¥6. А Grok 4.7, если пересчитать из долларов, — ввод уже ¥3.35, а вывод и вовсе достигает ¥40.
Посмотрел отзывы и обзоры людей в Twitter утром про Grok 4.7: в основном одно — что он дорогой, а другое — что эффект, возможно, не такой уж хороший: и медленный, и не очень.
Цены Mimo сейчас как минимум вдвое дешевле, чем «минимальная точка» у текущего DeepSeek V4 (неважно Flash или Pro).
Например, у Mimo V2.6 Flash цена вывода ¥2, а у DeepSeek V4.1 Flash цена вывода ¥4.
К тому же, у Mimo V2.6 сейчас, похоже, с предстоящей недели в OpenCode начинается раздача со скидкой/бесплатно (limit-free).
Mimo ещё выпустила собственный десктоп-клиент: похоже, у него отдельная подписка по цене, можно попробовать. В приложении есть модели генерации изображений — их можно использовать, чтобы вместе с ними рисовать интерфейсы и подобные вещи.
Похоже, обе стороны думают, что OpenAI сегодня во второй половине дня выпустит новую модель (возможно GPT-6 Sol и GPT-6 Luna — судя по слухам, очень дёшево), и они хотели успеть выпустить до OpenAI… но в итоге вышло, что они синхронизировались и «сошлись» по времени.
Ожидаемо, что в кругу любителей ИИ никто не предвидел, что после выхода GPT-Astra и Fable сможет так стремительно набрать популярность новый тип моделей.
JEV смог так “выстрелить” отчасти потому, что он действительно решает некоторые проблемы; но ещё одна ключевая причина в том, что его преимущество в скорости очень легко распространять.
Он выигрывает и по скорости, и по объёму. Ты увидишь, что в демонстрациях JEV на разных веб-страницах почти всегда показывают и скорость, и количество обработанных запросов — именно это сильнее всего вызывает первоначальный интерес. И это также говорит о том, что людям действительно очень важны обе эти вещи, поэтому всевозможные демо и кейсы буквально разлетаются и активно тиражируются.
Конечно, у этой модели есть и ограничения. Если попытаться заставить её работать “в одиночку”, без больших языковых моделей, то сценарии использования довольно ограничены; но если подключить большую модель для помощи или другие инструменты, эффект будет очень хорошим.
При этом сейчас ей не хватает мультимодальности. Если добавить мультимодальность — особенно для систематизации и сортировки материалов или генерации длинного контента — пользовательский опыт будет просто великолепным.
Кстати, вчера они объявили, что открывают доступ всем: больше не нужна waitlist, у каждого пользователя есть бесплатный лимит в 5 долларов.
Эта модель очень экономичная: вход стоит всего 0.042 доллара, а выход — бесплатно, поэтому 5 долларов можно использовать очень-очень долго.
Как раз на прошлой неделе мы обновили Next Token — основное обсуждение было таким:
Модель JEV и сопутствующие вопросы: например, многие уже за один день могут обучить модель, похожую по возможностям; такие как GPT-6 и Fable — там в обучении моделей всё уже на очень профессиональном уровне, поэтому тут есть большое поле для арбитража на обучении небольших моделей. Проблема кооперации между малыми и большими моделями.
Эволюция интерфейса взаимодействия: сейчас чат, браузер и список задач находятся в одном приложении. Включая то, что Codex недавно обновил браузерные плагины — сам по себе он также поддерживает много аккаунтов (например, Notion’s MCP может войти в несколько аккаунтов и подтягивать информацию). Во многих случаях он уже начинает заменять наш системный интерфейс. И такая новая модель взаимодействия может незаметно — но очень эффективно — “обучать” пользователя.
Вчера я тоже сделал пример с JEV: генерацию реалистичной 3D-сцены в реальном времени — людей, которым это понравилось, оказалось довольно много. В программе мы обсудили эти и другие новости, а также поговорили о том, что думаем я, Цзяомуш и Ян Пань, и ещё несколько человек. Добро пожаловать послушать.
Я использовал модели JEV из @typesafeai, чтобы сделать генератор реального времени для 3D-сцен.
Это настолько быстро, что просто невероятно!
Из десятков и сотен подготовленных 3D-моделей по входному тексту выполняется параллельная проверка сотни раз.
При этом обрабатываются материалы: окраска, освещение, положение и состояние — и за одну секунду собирается интерьерная сцена, соответствующая требованиям.
Я сделал генератор сцен в реальном времени в 3D с помощью модели JEV.
Скорость просто невероятная!
Из десятков или сотен готовых 3D-моделей, на основе входного текста, выполняется параллельная проверка сотнями раз.
Одновременно обрабатываются материалы, раскраска, освещение, положение и состояние этих объектов; за одну секунду собирается внутреннее помещение, соответствующее требованиям.