Про маленькие модели на устройствах: я в прошлом году еще не верил. В этом году запихнул квантизированную модель в телефон и запустил — в первый раз ответы были такими медленными, что хотелось разбить клавиатуру. Но сейчас, оказывается, уже работает.

Prism упаковывает маленький LLM в умные очки с чипами Qualcomm — в этом направлении я уверен: не для каждой задачи нужно гонять всё в облаке по кругу. А раз Transformers сейчас напрямую поддерживает квантованные форматы llama.cpp, путь с открытыми весами становится всё более проторенным.

С другой стороны, говорят, что у ChatGPT появится тариф за 500 долларов в месяц. На edge (на устройстве) всё дешевеет, а в облаке всё дорожает. Эти два тренда сходятся — и следующие пару лет будет очень интересно смотреть 🧐