He estado revisando esta semana la cuestión de la fiabilidad de la red de operadores porque el whitepaper explica lo que Newton hace bien en condiciones normales, pero es menos específico sobre lo que las aplicaciones deberían esperar cuando las condiciones no son normales.
La arquitectura tiene tolerancia a fallos real incorporada. La puerta de enlace gestiona el enrutamiento del operador, el almacenamiento en caché y la deduplicación de solicitudes. Los mecanismos de inclusión forzada permiten que las aplicaciones envíen tareas directamente a la red de operadores, omitiendo por completo la puerta de enlace si se detecta censura.
El diseño de consenso en dos fases significa que un único operador lento no bloquea toda la evaluación. El Agregador sale tan pronto como se haya firmado suficiente participación. Estas son propiedades reales de resiliencia.
Lo que el whitepaper no especifica es el umbral de falla. ¿Cuántos operadores necesitan desconectarse antes de que el mecanismo de consenso de Newton ya no pueda alcanzar el quórum? ¿Qué experiencia tiene una aplicación cuando no se puede alcanzar el quórum: caduca la cola de tareas con un error o se bloquea indefinidamente? ¿Cuál es el tiempo de recuperación esperado si una parte significativa del conjunto de operadores experimenta una indisponibilidad coordinada?
Estas preguntas importan de manera diferente según la aplicación. Un protocolo DeFi que requiera la atestación de Newton para cada transferencia no tiene tolerancia a caídas sostenidas si las atestaciones dejan de producirse: las transferencias dejan de ejecutarse. Un caso de uso de menor frecuencia, como el acceso controlado a un fondo tokenizado, podría tolerar minutos de degradación sin un daño significativo. El whitepaper no parece distinguir estos casos ni proporcionar expectativas de disponibilidad diferentes para distintas categorías de casos de uso.
El mecanismo de inclusión por fuerza aborda la censura en un caso específico en el que la Puerta de enlace rechaza deshonestamente enrutar tareas. No aborda de forma clara el escenario en el que los operadores mismos están fuera de línea, degradados o simplemente fallan al alcanzar el consenso dentro de ventanas de latencia normales.
De hecho, creo que esta brecha importa más ahora mismo en la etapa de beta de mainnet que más adelante. Los protocolos de adopción temprana están asumiendo un riesgo de confiabilidad de red que no está documentado completamente. Entender cómo se ven los modos de falla y qué se espera que hagan las aplicaciones cuando ocurren parece ser información esencial para cualquier equipo que despliegue Newton en un contexto de producción.
#newt #Newt #ShareYourThoughts
Lo que aún no he resuelto es si el requisito de distribución geográfica de los conjuntos de operadores está diseñado específicamente para reducir el riesgo de fallas correlacionadas o si se trata principalmente de resistencia a la censura, y si esos dos objetivos requieren composiciones diferentes del conjunto de operadores.
