• Харви берет $1 200–$1 500 или больше за место в месяц по годовым контрактам.
• Задачи в режиме агентa потребляют в десятки и сотни раз больше токенов, чем простые запросы.
• Harvey Tenet запущен 20 августа на модели Kimi K3 с открытыми весами Moonshot AI.
-50% валовая маржа
Харви — юридический AI-стартап, оцененный в $15,6 млрд — наблюдал, как его валовая маржа колебалась: с примерно +50% в начале года до -50% к июню. Обвал был вызван неконтролируемым ростом использования клиентами и затратами на инференс после обновления мартовского агента. Экономика этого разворота выглядит сурово: Харви берет с юридических фирм и корпоративных клиентов плату за места от $1 200 до $1 500 или больше за пользователя в месяц, при этом клиенты закреплены за отраслевым стандартом — годовым контрактом «всё включено». На бумаге такая цена должна обеспечивать маржинальность выше 80%, как у ПО. Но раскрытые цифры показывают, что компания фактически теряла деньги на каждом тяжелом клиенте, которого обслуживала.
Механизм — агентная рабочая нагрузка. Раннее использование юридического ИИ предполагало одноразовые вопросы, быстрые переводы или краткие резюме — вычислений почти не требовалось. Когда режим автономных агентов стал реальностью, юристы начали загружать целые досье из сотен страниц и договоры о трансграничных слияниях, тянущиеся более чем на тысячу страниц. Чтобы выполнить глубокую due diligence или полный кросс-ревью контракта, система запускает многораундное рассуждение по цепочкам шагов, многократно вызывает внешние инструменты извлечения, согласует противоречия и по несколько раз переписывает собственный результат. Одна задача может сжечь в десятки, а то и в сотни раз больше токенов, чем простой запрос — нагрузка, которая в итоге ложится на GPU-кластеры NVIDIA и гипермасштабные облака, которые предоставляют провайдеры вроде Amazon. И зависимость становится липкой: как только юрист за считанные минуты проверил контракт на тысячу страниц, ручной пересмотр уже не считается приемлемым. Фиксированная посадочная цена просто не может поглощать такую кривую.
Харви Тенет о Кими K3
Ответ Харви пришёл 20 августа вместе с Харви Тенет — проприетарной моделью, созданной на основе открыто-весовой Kimi K3 от Moonshot AI и совместно разработанной с Fireworks Research; для задач предусмотрена постобработка, рассчитанная на длинные многошаговые агентные сессии. Материалы компании по исследованиям утверждают, что подход с открытыми весами снижает не только цену за токен, но и количество токенов, которое потребляет каждая задача: за счёт сокращения избыточных вызовов инструментов и этапов рассуждений при сохранении качества вывода. В собственной оценочной среде Харви Тенет выполнил больше юридических задач, чем базовая Kimi K3 — хотя фирма не публиковала цифр, доказывающих восстановление маржи в реальном бизнесе, и бенчмарк был разработан самой компанией. На уровне эксплуатации Харви также внедрила маршрутизацию моделей под задачу: облегчённые модели обрабатывают рутинное черновое составление, а модели с высокой производительностью резервируются для сложного анализа; администраторы заранее назначают модели в зависимости от рабочего процесса. В стратегических деталях — и это привлекает внимание: лидер американских legal-tech, поддержанный венчурным подразделением OpenAI, обратился к китайской открыто-весовой модели, чтобы пережить ценовой кризис, — свидетельство того, что конкуренция в ИИ сдвинулась от риторики к сырой экономике инференса, независимо от того, чипы от NVIDIA или AMD.
Тезис о дефиците вычислений
Смысл прочтения COINOTAG таков: агентный ИИ разрушил математику фиксированной подписки по месту, подтолкнув профессиональное ПО к биллингу исходя из фактического объёма работ, а не из числа пользователей. То есть в корне это история о дефиците вычислений — то же давление спроса, которое подпитывает децентрализованные нарративы про вычисления в крипто, где такие сети, как Internet Computer, предлагают on-chain вычисления как публичную альтернативу концентрированным гипермасштаберам. Ничто в раскрытиях Харви не меняет фундамент токенов; это лишь подтверждает, что потребность в инференсе у профессиональных пользователей растёт быстрее, чем любая ценовая модель, на которую рассчитывали.
