Hôm nay tôi đã có một cú “kiểm tra thực tế” nhỏ.

Một yêu cầu suy luận đã thất bại ba lần trong chưa đầy một phút.

Ý nghĩ đầu tiên của tôi là: Hẳn mạng đang bị quá tải.

Rồi tôi mở bảng điều khiển.

Có rất nhiều node đang online.

Vậy là tôi bắt đầu lần mò.

Một node không có mô hình tôi cần. Một node khác thì không có dung lượng trống. Node thứ ba có thể xử lý yêu cầu nhưng không thể cung cấp “đường dẫn xác thực” mà ứng dụng mong đợi.

Đó là khoảnh khắc mọi thứ “khớp lại”.

Tôi đã dành rất nhiều thời gian để nhìn cơ sở hạ tầng thông qua số lượng nhân sự.

Nhiều người vận hành hơn. Số lượng lớn hơn. Mạng khỏe hơn.

Nhưng người dùng không cảm nhận số lượng node.

Họ cảm nhận kết quả.

Một yêu cầu hoặc là hoạt động, hoặc là không.

Và đột nhiên, câu hỏi không còn là:

“Có bao nhiêu node đang online?”

Mà là:

“Xác suất để đúng yêu cầu này có thể tìm được đúng mô hình, có phần cứng phù hợp, độ trễ chấp nhận được và tuyến đường xác thực hợp lệ—tất cả cùng xảy ra vào đúng thời điểm đó—là bao nhiêu?”

Đó là một cách nghĩ hoàn toàn khác về khả năng chịu lỗi.

Tôi thậm chí bắt đầu tự hỏi rằng bao nhiêu “nhà vận hành” “độc lập” thực sự là độc lập. Có thể họ cùng chia sẻ một vùng cloud, các phụ thuộc phần mềm, hoặc những lý do kinh tế để tắt đi khi phần thưởng suy yếu.

Có lẽ vì vậy mà tôi đã dừng việc xem việc tham gia như một con số nhân đầu.

Giờ tôi đang theo dõi xác suất.

Bởi cơ sở hạ tầng không được đo bằng số lượng nhà vận hành nói rằng: “Tôi ở đây.”

Nó được đo bằng việc liệu đúng năng lực có xuất hiện đúng lúc khi người dùng thực sự cần hay không.

Và tôi nghĩ những thất bại lớn nhất trong các hệ thống phân tán hiếm khi xảy ra chỉ vì có quá ít node.

Chúng xảy ra khi nhận ra rằng

tất cả mọi người đều đang đứng ở cùng một chỗ

@OpenGradient #OPG $OPG