Velvet Flash 0.1 проводит линию, которая имеет значение: модель, которая может говорить о крипто, — это еще не модель, которая умеет управлять крипто.

@velvet_capital оценивает, может ли человеческое намерение стать точным, зависящим от платформы финансовым действием.

Тест дает модели документ со знанием о навыках платформы плюс запрос на естественном языке. Она должна выбрать правильную команду, извлечь точную сумму, токен, сеть и адрес, отметить рискованные запросы и подтвердить, прежде чем средства сдвинутся. Это совсем другая работа — не просто давать умные ответы.

Flash — модель на 4B. На внутреннем бенчмарке крипто-навыков Velvet она набрала 50 по сравнению с 23 у базовой модели, при этом безопасность выросла с 28 до 61. Важное тут — не лидерборд. Важнее то, что бенчмарк «наказывает»: неверные параметры, небезопасное движение средств, плохую маршрутизацию и неспособность остановиться, когда запрос не должен продолжаться.

Базовый набор охватывает Minara, Binance Spot, OKX DEX, Uniswap, GMX и MetaMask, а более широкая оценка проводится по 31 платформе. У каждой платформы своя операционная «грамматика». Поэтому глубинная проблема в том, что интероперабельность: выдержит ли один человеческий запрос перевод через разные команды, параметры и правила безопасности, не потеряв смысла?

Flash 0.1 — это все еще первая версия, и это собственный бенчмарк Velvet. Он не доказывает отсутствие ошибок, прибыльность или поддержку в продакшене на всех 31 платформах. Но направление важнее, чем релиз одной модели: финансовый ИИ становится полезным тогда, когда я надежно понимаю, что именно вы имеете в виду — превращается в то, что я точно знаю, какую операцию вы имеете в виду, и когда мне не стоит ее выполнять.