Die Speicherbandbreite ist inzwischen der wichtigste Engpass bei der KI-Inferenz: GPUs können Daten schneller verarbeiten, als DRAM sie bereitstellen kann. Deshalb ist Speicher mit hoher Bandbreite (HBM) für moderne KI-Chips so wichtig geworden und Unternehmen erforschen Architekturen, bei denen die Verarbeitung direkt im Speicher stattfindet.

Gleichzeitig integrieren Finanzinstitute KI in rasantem Tempo in Handelssysteme, Risikomodelle und Marktanalysen. Die Herausforderung sind nicht nur die Modelle – es geht auch darum, Inferenz-Pipelines mit geringer Latenz aufzubauen, die Echtzeit-Marktdaten verarbeiten und zugleich regulatorische Anforderungen erfüllen. Ingenieure bauen die Handelsinfrastruktur im Grunde von Grund auf neu, um Transformer-basierte Modelle zu unterstützen, die riesige Kontextfenster innerhalb von Mikrosekunden verarbeiten müssen.

Das Zusammenspiel ist bemerkenswert: Die Geschwindigkeitsanforderungen der Wall Street setzen Hardwareanbieter unter Druck, das Problem der Speicherwand schneller zu lösen, als es Anwendungen für KI im Verbraucherbereich je vermocht hätten.