Saya perhatikan satu hal tentang cara “reliability” pada policy engine sering kali diukur dengan salah.

Hampir semua proyek công bố uptime — hệ thống chạy được bao nhiêu % thời gian. Nhưng uptime chỉ nói engine có đang chạy hay không, không nói nó có chạy đúng hay không. Một policy engine có thể uptime 99,9% và vẫn approve sai hàng nghìn request, nếu chính policy đó có lỗ hổng. Reliability thực sự không nằm ở việc hệ thống sống, mà ở việc nó quyết định đúng.

@NewtonProtocol mengumumkan metrik seperti jumlah request yang dievaluasi, kecepatan pemrosesan — angka-angka tentang kinerja sistem. Tapi belum ada metrik yang membahas akurasi keputusan: berapa banyak attestation berikutnya yang ternyata benar, berapa banyak policy yang harus diperbaiki karena ternyata meloloskan perilaku berisiko secara keliru.

Bantah diri: mengukur “keputusan yang benar” jauh lebih sulit dibanding mengukur uptime — butuh waktu, butuh sistem pelacakan pasca-penilaian yang terpisah, dan mungkin bahkan Newton pun belum membangun mekanisme itu. $NEWT saat ini mencerminkan nilai berdasarkan volume evaluasi, belum mencerminkan kualitas dari evaluasi-evaluasi tersebut.

Volume evaluasi yang tinggi biasanya memprediksi popularitas. Tapi tidak memprediksi akurasi.

Saya sedang menunggu Newton mengumumkan metrik tentang akurasi sebenarnya dari policy — bukan hanya jumlah request yang telah diproses.

#newt $BEE $LAB