Die neuesten Quartalszahlen von Microsoft und Amazon Web Services senden dasselbe Signal: CPUs auf Basis der Arm-Architektur sind zur zentralen Infrastruktur für Agenten-KI geworden.

Zwei Telefonkonferenzen zu den Quartalszahlen von Microsoft und Amazon haben jüngst einen Trend gemeinsam bestätigt: Maßgeschneiderte Chips auf Basis der Arm-Architektur sind von früheren technischen Versuchen zu einer tragenden Säule für riesige Cloud-Infrastrukturen im Maßstab von hyperscale-Umgebungen geworden.

Microsofts CEO Satya Nadella hat die Architekturveränderung mit einem Satz auf den Punkt gebracht: „Bei der Ausführung agentenbasierter Workloads sind CPU und GPU gleichermaßen wichtig.“ Anschließend lieferte er überzeugende Belege: Microsoft geht davon aus, dass bis zum Monatsende Juli die Racks mit dem Azure Cobalt 200 weltweit in über 25 Rechenzentren eingesetzt werden.

Einen Tag später: Amazon hat bekannt gegeben, dass das annualisierte Umsatzvolumen seines Chipgeschäfts (einschließlich Graviton, Trainium und Nitro) die Marke von 25 Milliarden US-Dollar überschritten hat. Im Jahresvergleich entspricht das einem Wachstum im dreistelligen Bereich. Die Kundenabrufverpflichtungen für Graviton liegen im Monatsvergleich bei nahezu einer Verdreifachung, und die Akzeptanzgeschwindigkeit von Graviton5 liegt ebenfalls bei nahezu dem Doppelten der von Graviton4.

Obwohl die Produkte unterschiedlich sind und die Cloud-Plattformen variieren, laufen die Richtungen zusammen: Globale führende Hyperscale-Cloud-Provider bauen Arm-basierte CPUs zu einem Kernstück der KI-Infrastruktur aus und optimieren sie entsprechend den Anforderungen ihrer jeweiligen Workloads sowie den Zielen für wirtschaftliche Effizienz.

Agenten brauchen mehr als nur Modell-Rechenleistung

Die erste Welle von generativer KI lässt sich vor allem anhand der Modellgröße, der Bereitstellungskapazität für KI-Beschleuniger und der Token-Generationsfähigkeit messen. Die Art und Weise, wie Agenten-KI läuft, ist jedoch deutlich komplexer: Agenten müssen Daten abrufen, Tools aufrufen, Code ausführen, Strategien umsetzen und die Ergebnisse verifizieren. Dabei handelt es sich um ein breiteres Spektrum an Aufgaben.

Die GPU übernimmt weiterhin den überwiegenden Teil der Modelltrainings- und Inferenz-Token-Generierungsarbeit, während die CPU die Aufgaben rund um das Modell ausführt: unter anderem Request-Routing, Datenvorverarbeitung, Tool-Orchestrierung, Speicher- und Speicher-Management. Zudem stellt sie sicher, dass tausende parallele Interaktionsaufgaben dauerhaft stabil laufen.

Nadella sagte in der Telefonkonferenz zu den Quartalszahlen, dass die VM-Produktpalette auf Basis von Azure Cobalt derzeit die Workloads von Microsoft-eigenen Diensten sowie von Kunden wie Adobe, Arm, Elastic, OpenAI, Sprinklr und TomTom abdeckt. Das zeigt, dass es bereits in echten Produktionsumgebungen eingesetzt wird.

AWS bestätigt denselben Trend aus einer anderen Perspektive. Graviton5 ist speziell für Agenten-AI-Workloads entwickelt und auf Szenarien wie Echtzeit-Inferenz, Code-Generierung und mehrstufige Orchestrierung optimiert. Die M9g-Instanzen auf Basis von Graviton5 bieten im Vergleich zu M8g-Instanzen mit Graviton4 eine bis zu 25% höhere Rechenleistung und eine bis zu 35% schnellere Machine-Learning-Inferenz.

Zwei Hyperscaler – unterschiedliche Wege zur Skalierung

Der Erfolg von Cobalt und Graviton zeigt, dass Arm es Hyperscalern ermöglicht, Chips maßgeschneidert an die eigenen Anforderungen an großskalige Infrastruktur anzupassen und dabei zugleich dieselbe Architektur und Software zu teilen. Das hilft, die Kommerzialisierung zu beschleunigen und eine kommerzielle Rendite zu erzielen. Microsoft veröffentlichte im November 2025 Cobalt 200; im Juni 2026 wurde die Vorschau der Virtual-Machine-Produkte für Kunden geöffnet. Weniger als zwei Monate später waren Rack-Lösungen mit diesem Chip bereits in mehr als 25 Rechenzentren weltweit im Einsatz – die Entwicklung verläuft sehr schnell.

Cobalt 200 basiert auf Arm Neoverse CSS V3 und ist der zweite Cloud-CPU-Arm-Architektur-Entwurf von Microsoft. Gegenüber dem Vorgängermodell liegt die Performance je nach Bedarf bis zu 50% höher, es ist auf 128 vCPUs skalierbar und für Cloud-native-, datenintensive- sowie Agenten-Workloads ausgelegt.

AWS hat die fünfte Generation von Graviton auf den Markt gebracht. Die M9g- und M9gd-Instanzen mit Graviton5 sind in diesem Jahr im Juni offiziell in den kommerziellen Betrieb gegangen und bieten eine bis zu 25% höhere Rechenleistung im Vergleich zu Graviton4. AWS erklärt, dass die Preis-Leistungs-Effizienz der gesamten Graviton-Produktlinie bei vergleichbaren Instanzen um 30% bis 40% über der Konkurrenz liegt.

Wirklich bemerkenswert ist die Kundenakzeptanz der Graviton-Produkte: Unter den Top-1000-EC2-Kunden von AWS nutzen 98% Graviton, und mehr als 120.000 Kunden bauen auf Graviton auf, um Services zu erbringen. Zum dritten Jahr in Folge nutzt mehr als die Hälfte der neu hinzugefügten CPU-Kapazität bei AWS Graviton.

Rechenleistung freisetzen – Rechenleistung schafft Umsätze

Microsoft verknüpft die Effizienz der Infrastruktur direkt mit dem Wachstum der Geschäftsergebnisse. Im Quartal stieg der Azure-Umsatz im Jahresvergleich um 43%, während die Marktnachfrage weiterhin über die vorhandene Fähigkeit zur Kapazitätsbereitstellung hinausgeht. Der CFO von Microsoft, Amy Hood, sagte, dass die kontinuierlich steigende Betriebsleistung der CPU- und GPU-Infrastruktur sowie die schnellere Kapazitätserweiterung und Aktivierung mehr verfügbare Rechenleistungsressourcen freisetzen. Diese zusätzlichen Ressourcen würden nahezu sofort nach dem Go-Live von der Marktnachfrage schnell aufgenommen und in Umsätze umgewandelt.

Für riesige Rechenzentren bedeutet eine Effizienzsteigerung bei der CPU viel mehr als nur geringere Stromkosten. Wenn die Marktnachfrage das Angebot übersteigt, kann eine effizientere Infrastruktur bei gleicher Rack-Größe und gleichem Strombudget mehr verfügbare Rechenleistung freisetzen – und diese Rechenleistung wird am Ende zu Umsätzen.

Microsoft hat nicht offengelegt, zu welchem konkreten Anteil Cobalt 200 die Effizienz verbessert. Die zugrunde liegende Logik ist jedoch sehr klar: Performance, Ressourcenausnutzung und Energieeffizienz sind sowohl Hebel, um mehr Rechenleistung freizusetzen, als auch Hebel, um das Unternehmenswachstum voranzutreiben.

AWS liefert außerdem einen weiteren Beleg. Die annualisierte Umsatzsumme von 25 Milliarden US-Dollar deckt das gesamte Chipgeschäft ab – nicht nur Graviton. Doch das schnelle Wachstum der Einkaufszusagen sowie die beschleunigte Einführung von Graviton5 zeigen, dass die maßgeschneiderte CPU-Produktlinie zu einer wichtigen Säule dieses riesigen und schnell wachsenden Chipgeschäfts geworden ist. Gleichzeitig bieten die deutlichen Vorteile bei Preis und Leistung Kunden einen stichhaltigen Grund, mehr Workloads auf die Graviton-Plattform zu migrieren.

Der Druck auf die Branche steigt kontinuierlich. Daten der Internationalen Energieagentur (IEA) zeigen, dass der Stromverbrauch von Rechenzentren für KI im Jahr 2025 um 50% gewachsen ist. Eine Auswertung der Research-Organisation Dell'Oro Group ergibt, dass im ersten Quartal 2026 die Kapitalausgaben der Rechenzentren von Amazon, Google, Meta und Microsoft im Jahresvergleich um 78% gestiegen sind. Im Vergleich zum Vorjahr ist jede Wattstunde Strom und jedes Rack mittlerweile noch wertvoller. Die Energieeffizienz von CPUs ist nicht mehr nur ein nachgeordnetes technisches Detail, sondern ein entscheidendes Mittel, mit dem Hyperscaler eingeschränkte Rechenleistung freisetzen, die Auslastung bestehender Infrastruktur verbessern und höhere Renditen erzielen.

Gleichzeitig durchbricht die Marktnachfrage den Rahmen des einzelnen GPU-Bereichs. Das IDC prognostiziert, dass die weltweiten Ausgaben für KI-Infrastruktur 2026 497 Milliarden US-Dollar erreichen werden – ein Wachstum von etwa 56%. Die Nachfrage beschränkt sich dabei nicht mehr nur auf GPU-Systeme, sondern umfasst auch Orchestrierungsplattformen, Daten-Pipelines sowie CPU-basierte Inferenz-Cluster.

Der Hyperscale-Cloud-Markt sendet weitere positive Signale für Arm

Microsoft und AWS sind die am stärksten beachteten Beispiele – doch sie sind nur Teil dieser breiteren architektonischen Migrationswelle.

Axion, das von Google Cloud eingeführte Produkt, ist eine CPU-Produktlinie, die auf einer maßgeschneiderten Arm-Architektur basiert. Axion dient nicht nur als General-Purpose-CPU zur Unterstützung der Cloud-Infrastruktur, sondern übernimmt in der neuesten Generation der TPU-Systeme auch die Rolle der AI-Head-Node-CPU. Sie liefert die Orchestrierung, Netzwerk- und Infrastruktur-Services und ermöglicht so den stabilen Betrieb extrem großer KI-Systeme.

NVIDIA hat in seinem AI-Factory-Ansatz ebenfalls dieselbe architektonische Entscheidung getroffen. Vera ist die neueste von NVIDIA veröffentlichte Arm-basierte CPU und wird die Rechenbasis für kommende KI-Systeme wie Rubin bilden. In diesen Rack-Level-Deployments koordiniert die CPU Speicher-, Netzwerk- und Accelerator-Ressourcen.

Alles zusammen betrachtet zeigen Microsoft Cobalt, Amazon Graviton, Google Axion und NVIDIA Vera alle auf dieselbe Schlussfolgerung: Während KI-Infrastrukturen vom Modell-Reasoning hin zur Ausführung autonomer Agenten übergehen, werden CPUs auf Basis der Arm-Architektur zunehmend zur universellen Rechenbasis moderner KI-Rechenzentren – mit zentralen Aufgaben wie Ressourcen-Orchestrierung und Systemkoordination.