El hermano de abajo, que hace traducciones de novelas, vino anoche a preguntarme cómo elegir entre OpenGradient Chat y construir su propio Llama para inferencia. Hace medio año, se tragó la idea de un post en Reddit que decía "la privacidad absoluta solo se puede lograr corriendo localmente". Se decidió a gastar 42,000 yuanes en una estación de trabajo con dos RTX 5090 para correr Llama 3.1 70B. Al final, la factura de electricidad le salió 380 yuanes al mes, el ventilador de la tarjeta gráfica lo despertó a su esposa a las tres de la mañana, y cuando quiso actualizar al Llama 4, se quedó sin VRAM y se le cayó todo. Recientemente, intentó acceder a modelos de vanguardia como Claude Fable 5 y descubrió que no podía ajustar nada localmente. $ESPORTS
Le hice unos cálculos. Llama 3.1 70B en cuantificación 4bit necesita al menos 48GB de VRAM, con una 5090 de 32GB no es suficiente, necesita dos tarjetas o bajar a una versión de 8B que es muy limitada. Una estación de trabajo capaz de correr 70B empieza en 40,000, y si calculamos el costo de electricidad considerando 8 horas de inferencia al día, al año son 1,400. Si contamos la depreciación a tres años, el costo real mensual es de 1,500 yuanes. Además, siempre va a estar atrapado con modelos de código abierto, y no puede acceder a los modelos cerrados de vanguardia. En OpenGradient Chat, la barrera de hardware es cero, ya que la clave pública del enclave en su móvil cifra el prompt en un blob encriptado que se envía a los Inference Nodes. En el enclave TEE, se utilizan recursos compartidos de GPU para correr la inferencia y luego se vuelve a encriptar y se devuelve. La hash de atestación en la cadena de protocolo x402 prueba que el nodo no estuvo espiando, y la protección de privacidad es tan fuerte como correr localmente. Cada llamada cuesta entre 0.3 y 0.5, $OPG , menos de 1 yuan. En el Model Hub, hay más de 4,500 modelos, incluyendo Llama 4, Hermes 4 y Claude Fable 5, por lo que puede cambiar a modelos avanzados directamente desde el menú sin tener que redeplegar. $SYN
@OpenGradient Esta opción tampoco es solo ganancia. La ruta LLM Proxy que va a Claude Fable 5 todavía entra como texto plano en el backend de Anthropic, así que si realmente se quiere un escenario de privacidad extremo, esta opción se bloquea. La latencia de los nodos de inferencia puede llegar a 12 segundos en horas pico, mientras que la velocidad de token de su estación de trabajo es más estable. La volatilidad del precio de OPG hace que los costos a largo plazo no se puedan fijar, y si llega al 13° mes con un 25% de desbloqueo, podría haber presión de venta.
Después de escuchar todo esto, hizo sus cuentas, puso su estación de trabajo en venta en Xianyu, y fijó OpenGradient Chat en el dock, y se fue a casa a dormir.
#opg
opg 好用方便
75%
llama 成本稳定
25%
4 Votos • Votación cerrada