Мой брат, который занимается переводом романов, вчера пришёл и спросил меня, как выбрать между OpenGradient Chat и созданием локального Llama для инференса. Полгода назад он вцепился в ту идею из поста на Reddit о том, что «абсолютная конфиденциальность возможна только на локальном уровне», и стиснув зубы потратил 42 тысячи юаней на сборку рабочего места с двумя RTX 5090 для запуска Llama 3.1 70B. В итоге, ежемесячные расходы на электричество составили 380 юаней, вентилятор видеокарты разбудил его жену в три часа ночи, а когда пришло время обновить до Llama 4, видеопамяти не хватило, и система зависла. Теперь он хочет подключить такие закрытые модели, как Claude Fable 5, и выяснил, что локально это просто невозможно.$ESPORTS
Я подсчитал его расходы. Для Llama 3.1 70B 4bit квантование минимум требуется 48GB видеопамяти, а 32GB одной RTX 5090 не хватает, нужно либо два GPU, либо опускаться до 8B, что является довольно слабой версией. Аппаратное обеспечение для рабочего места, способного запускать 70B, начинается от 40 тысяч, и при расчёте электричества на 8 часов работы в день выходит 1400 в год, с учётом амортизации на три года, реальная месячная стоимость составляет 1500 юаней. При этом он всегда будет зависать на открытых моделях, а передовые закрытые разработки ему недоступны. В OpenGradient Chat порог входа равен нулю: публичный ключ enclave на его телефоне шифрует prompt в зашифрованный blob, который отправляется на Inference Nodes. В TEE enclave используются общие ресурсы GPU от команды проекта для инференса, и результаты шифруются и возвращаются, а attestation hash на блокчейне x402 доказывает, что узлы не подглядывают за процессом. Уровень защиты конфиденциальности сопоставим с локальным запуском, а стоимость одного вызова составляет от 0.3 до 0.5 $OPG , что в юанях выходит меньше 1 юаня. В Model Hub более 4500 моделей, включая Llama 4, Hermes 4 и Claude Fable 5, и ему нужно просто выбрать в выпадающем списке и не надо заново развертывать.$SYN
@OpenGradient Эта схема тоже не совсем безубыточная. LLM Proxy, маршрутизирующий к выходу enclave Claude Fable 5, всё равно передаёт данные в открытом виде на бэкенд Anthropic, так что, если речь идёт о крайних сценариях конфиденциальности, этот путь закрыт. Задержки в очереди на Inference Nodes могут достигать 12 секунд в часы пик, тогда как скорость получения токенов на самодельной рабочей станции, наоборот, стабильна. Цены на OPG колеблются, что делает долгосрочные расходы непредсказуемыми, и когда наступит тринадцатый месяц, может возникнуть давление на продажу из-за 25% разблокировки.
После того как он всё услышал, он подсчитал и выставил свою рабочую станцию на Xiaohongshu, а OpenGradient Chat закрепил в доках, и пошёл спать.
#opg
opg 好用方便
75%
llama 成本稳定
25%
4 проголосовали • Голосование закрыто