Der Bruder, der im Erdgeschoss an einer Romanübersetzung arbeitet, kam letzte Nacht vorbei und fragte mich, wie er sich zwischen OpenGradient Chat und seiner eigenen lokalen Llama-Inferenz entscheiden soll. Vor einem halben Jahr hat er auf einen Reddit-Post gehört, der sagte: "Absolute Privatsphäre kann nur lokal gewährleistet werden". Also hat er sich mit 42.000 RMB eine Doppel-RTX 5090 Workstation geholt, um Llama 3.1 70B zu betreiben. Das Ergebnis: Stromkosten von 380 RMB pro Monat, die Grafikkartenlüfter haben seine Frau um drei Uhr morgens geweckt und als das Modell auf Llama 4 aktualisiert wurde, war der VRAM nicht genug und es hat einfach abgestürzt. Jetzt wollte er Claude Fable 5, so ein proprietäres Spitzenmodell, ansteuern und merkt, dass er lokal einfach nicht rankommt. $ESPORTS
Ich habe ihm die Kosten ausgerechnet. Llama 3.1 70B benötigt mindestens 48 GB VRAM für 4-Bit Quantisierung. Mit einer 5090, die nur 32 GB hat, reicht das nicht aus; er braucht entweder zwei Karten oder muss auf die schwache 8B-Version downgraden. Ein Arbeitsplatz, der 70B verarbeiten kann, kostet ab 40.000 RMB, und die Stromkosten, basierend auf 8 Stunden Inferenz pro Tag, belaufen sich auf 1.400 RMB pro Jahr. Bei einer Abschreibung über drei Jahre kommen wir auf monatliche Gesamtkosten von 1.500 RMB, und er wird immer an den Open-Source-Modellen hängen bleiben, während er die neuesten proprietären Modelle nicht lokal erreichen kann. Bei OpenGradient Chat gibt es hingegen keine Hardware-Barriere; der Enclave-Öffentlichkeitsschlüssel auf seinem Handy verschlüsselt die Eingabe in ein Cipher-Blob und sendet es an die Inferenzknoten. Im TEE-Umfeld werden die GPU-Ressourcengruppen des Projekts zur Inferenz genutzt und dann wieder verschlüsselt zurückgesendet. Der Attestation-Hash auf der x402-Protokollkette beweist, dass die Knoten nicht dazwischen geschaut haben. Der Datenschutz ist gleichwertig mit der lokalen Ausführung, und die Kosten für einen einzelnen Aufruf liegen zwischen 0,3 und 0,5. $OPG Für weniger als 1 RMB. Im Model Hub gibt es über 4.500 Modelle, darunter Llama 4, Hermes 4 und Claude Fable 5. Er kann die neuesten Modelle direkt im Dropdown-Menü auswählen, ohne neu deployen zu müssen. $SYN
@OpenGradient Diese Lösung ist auch nicht rein profitabel. Der LLM Proxy, der zu Claude Fable 5 führt, hat immer noch einen Klartextausgang zu Anthropic, was die Möglichkeit extremer Privatsphäre blockiert. Die Wartezeiten an den Inferenzknoten können laut Dune-Board zu Spitzenzeiten bis zu 12 Sekunden betragen, während die Token-Generierung auf seiner selbstgebauten Workstation stabiler ist. Die Preisschwankungen von OPG machen langfristige Kosten schwer kalkulierbar, besonders beim 13. Monat, wenn eine 25%ige Freigabe zu Verkaufsdruck führt, was die monatliche Rechnung kurzfristig in die Höhe treiben könnte.
Nachdem er das alles gehört hatte, hat er die Rechnung aufgemacht, die Workstation auf Xianyu verkauft, OpenGradient Chat fixiert und ist nach Hause gegangen, um zu schlafen.
#opg
Ich habe ihm die Kosten ausgerechnet. Llama 3.1 70B benötigt mindestens 48 GB VRAM für 4-Bit Quantisierung. Mit einer 5090, die nur 32 GB hat, reicht das nicht aus; er braucht entweder zwei Karten oder muss auf die schwache 8B-Version downgraden. Ein Arbeitsplatz, der 70B verarbeiten kann, kostet ab 40.000 RMB, und die Stromkosten, basierend auf 8 Stunden Inferenz pro Tag, belaufen sich auf 1.400 RMB pro Jahr. Bei einer Abschreibung über drei Jahre kommen wir auf monatliche Gesamtkosten von 1.500 RMB, und er wird immer an den Open-Source-Modellen hängen bleiben, während er die neuesten proprietären Modelle nicht lokal erreichen kann. Bei OpenGradient Chat gibt es hingegen keine Hardware-Barriere; der Enclave-Öffentlichkeitsschlüssel auf seinem Handy verschlüsselt die Eingabe in ein Cipher-Blob und sendet es an die Inferenzknoten. Im TEE-Umfeld werden die GPU-Ressourcengruppen des Projekts zur Inferenz genutzt und dann wieder verschlüsselt zurückgesendet. Der Attestation-Hash auf der x402-Protokollkette beweist, dass die Knoten nicht dazwischen geschaut haben. Der Datenschutz ist gleichwertig mit der lokalen Ausführung, und die Kosten für einen einzelnen Aufruf liegen zwischen 0,3 und 0,5. $OPG Für weniger als 1 RMB. Im Model Hub gibt es über 4.500 Modelle, darunter Llama 4, Hermes 4 und Claude Fable 5. Er kann die neuesten Modelle direkt im Dropdown-Menü auswählen, ohne neu deployen zu müssen. $SYN
@OpenGradient Diese Lösung ist auch nicht rein profitabel. Der LLM Proxy, der zu Claude Fable 5 führt, hat immer noch einen Klartextausgang zu Anthropic, was die Möglichkeit extremer Privatsphäre blockiert. Die Wartezeiten an den Inferenzknoten können laut Dune-Board zu Spitzenzeiten bis zu 12 Sekunden betragen, während die Token-Generierung auf seiner selbstgebauten Workstation stabiler ist. Die Preisschwankungen von OPG machen langfristige Kosten schwer kalkulierbar, besonders beim 13. Monat, wenn eine 25%ige Freigabe zu Verkaufsdruck führt, was die monatliche Rechnung kurzfristig in die Höhe treiben könnte.
Nachdem er das alles gehört hatte, hat er die Rechnung aufgemacht, die Workstation auf Xianyu verkauft, OpenGradient Chat fixiert und ist nach Hause gegangen, um zu schlafen.
#opg
opg 好用方便
75%
llama 成本稳定
25%
4 Stimmen • Abstimmung beendet