Сегодня у меня был небольшой реальный тест.

Запрос инференции не удался трижды менее чем за минуту.

Моя первая мысль была: "Сеть, должно быть, перегружена."

Потом я открыл панель управления.

Много узлов было онлайн.

Так я начал копать дальше.

Один узел не имел нужной мне модели. Другой не имел свободной мощности. Третий мог обработать запрос, но не мог предоставить проверочный путь, который ожидало приложение.

В тот момент что-то щелкнуло.

Я потратил много времени, глядя на инфраструктуру через призму числа операторов.

Больше операторов. Большие цифры. Более здоровая сеть.

Но пользователи не испытывают количество узлов.

Они испытывают результаты.

Запрос либо работает, либо нет.

И вдруг вопрос не в том:

"Сколько узлов онлайн?"

А в том:

"Какова вероятность того, что именно этот запрос сможет найти нужную модель, доступное оборудование, приемлемую задержку и действующий путь доказательства в один и тот же момент?"

Это совершенно другой подход к пониманию устойчивости.

Я даже начал задумываться, сколько "независимых" операторов действительно независимы. Некоторые могут делить один и тот же облачный регион, программные зависимости или экономические причины для отключения, когда вознаграждения ослабевают.

Может быть, поэтому я перестал рассматривать участие как количество.

Теперь я наблюдаю за вероятностями.

Потому что инфраструктура не измеряется тем, сколько операторов говорит: "Я здесь."

Она измеряется тем, появляется ли нужная способность точно тогда, когда реальный пользователь в ней нуждается.

И я думаю, что самые большие неудачи в распределённых системах редко происходят из-за недостатка узлов.

Они происходят от того, что все оказались в одном и том же месте

@OpenGradient #OPG $OPG