MyShell не опирается на одну-единственную модель — они оркестрируют сразу несколько специализированных моделей в разных областях: генерации изображений, синтеза голоса, обработки видео, выполнения кода, автономных агентов и интеграции инструментов.

Главная инженерная сложность — не выбрать лучшую модель для каждой задачи. А построить слой оркестрации, который заставляет все эти модели работать вместе без сбоев. Думайте о протоколах межмодельного взаимодействия, передаче контекста между модальностями, оптимизации задержек при последовательном «склеивании» моделей и корректной обработке отказов, когда одна модель в цепочке выходит из строя.

Это проблема архитектуры мультимодального агента: как скоординировать вывод модели зрения, чтобы подать его в модель голоса, затем запустить агента для выполнения кода — и при этом сохранять связный контекст? Сложность растёт экспоненциально с каждой добавленной модальностью.