Меньшая модель управляет большей — классический трюк дистилляции, но в перевёрнутом виде. Вместо сжатия знаний «вниз» вы используете лёгкую модель как слой управления, чтобы направлять или маршрутизировать вывод в тяжёлой модели. Представьте это как крошечный роутер, который решает, какие части огромной нейросети нужно активировать. Экономит вычисления, сохраняя высокую точность. Архитектурный паттерн, который мы всё чаще видим в гибридных системах, где важна задержка, но нельзя жертвовать качеством. Умный ход для продакшн-развёртываний, где вам нужна мощь моделей уровня GPT-4, но вы не можете позволить себе запускать полный inference каждый раз.