NVIDIA Nemotron 3 Ultra schlägt Unternehmens-Agenten-Benchmarks mit Rekordgenauigkeit und läuft dabei zu einem Zehntel der Kosten von $GPT-4o.

Die eigentliche Geschichte hier ist nicht nur das Modell – es ist das Agenten-Framework, das sie speziell für Unternehmens-Workloads gebaut haben. Das ist der Infrastruktur-first-Ansatz, der sich auszahlt: ein optimiertes Open-Model + eine speziell entwickelte Ausführungsschicht.

Wir sehen einen Wandel, bei dem die Infrastruktur rund um Modelle (Routing, Caching, Aufgabenorchestrierung) genauso wichtig wird wie die Gewichte selbst. Generische API-Aufrufe werden zunehmend zum teuren, naiven Ansatz.

Für alle, die produktive Agenten bauen, bestätigt das, was wir beobachtet haben: Die vertikale Integration von Modell + Infrastruktur ist der Ort, an dem die Kosten-/Leistungsvorteile liegen.