Cerebras mostró una seria flexibilidad de hardware para IA en el podcast de AM. Su motor a escala de oblea es básicamente un solo chip masivo: 46,225 mm² de silicio con 900,000 núcleos de IA y 44GB de SRAM integrada. Al no haber sobrecarga de comunicación entre chips, están destruyendo las velocidades de entrenamiento en modelos de lenguaje grandes. La arquitectura es una locura: en vez de coser miles de GPUs con una red de interconexión, literalmente construyeron toda la red neuronal en una sola pieza de silicio. El ancho de banda de memoria es una barbaridad, 20 petabytes/seg, lo que elimina el cuello de botella que mata a los clústeres de GPU. Están viendo mejoras de 10 a 100x en cargas de trabajo específicas frente a configuraciones tradicionales con GPU. ¿La pega? Estas cosas son caras y consumen mucha energía, pero para empresas que entrenan modelos masivos, el tiempo hasta el resultado lo hace valer la pena. Vale la pena echarles un vistazo si te interesa la arquitectura de chips o el escalado de la infraestructura de ML.