L’entraînement du modèle Whisper par OpenAI utilise 680 000 heures de données audio multilingues : dont 438 000 heures pour l’anglais, 126 000 heures pour des langues non anglaises, couvrant 68 langues, ainsi qu’environ 125 000 heures de données de traduction. Le réseau Filecoin fonctionne à l’échelle de l’exaoctet : pour lui, ce volume de données est un fonctionnement « normal ».

Si l’on convertit les données vocales de 680 000 heures en volume réel de stockage de fichiers, on constate que cette comparaison devient encore plus frappante :

“容量”有多“小”:

En calculant à partir d’un format WAV sans perte 16 bits 16 kHz mono, typique : une heure d’audio représente environ 115 Mo. Si l’on utilise un format de compression adapté à l’entraînement vocal (comme Opus/MP3), une heure ne nécessitera peut-être qu’environ 30 Mo.

L’ampleur de Filecoin :

En général, la puissance totale effective de stockage du réseau Filecoin se situe au niveau de l’EB (exaoctet) (1 \text{ EB} = 1,000,000 \text{ TB}).

Cela signifie que, pour des ensembles de données de formation aussi volumineux que Whisper (20 To ~ 80 To), ils ne représentent même pas 0,01% de l’espace sur le réseau Filecoin ; en théorie, un nœud de stockage de taille moyenne (Miner / Storage Provider) peut les contenir sans difficulté.

La différence essentielle ici : capacité vs débit

Bien que les réseaux de stockage décentralisés aient largement de quoi supporter les jeux de données de formation en termes de capacité (Capacity), dans les scénarios réels d’entraînement IA, le vrai défi pour Filecoin n’est pas « est-ce qu’on peut le stocker ? », mais plutôt « est-ce qu’on peut le lire assez vite ? »

Concurrence élevée et faible latence : les clusters de GPU d’entraînement (comme H100/A100) exigent un IOPS extrêmement exigeant et une bande passante locale au niveau du gigabit voire du multigigabit. Si la vitesse de récupération depuis le réseau décentralisé ne suit pas, les GPU se retrouvent en attente (Compute Starvation).

Stockage à froid vs données chaudes : Filecoin excelle énormément dans l’archivage de données pour l’IA, la sauvegarde décentralisée en open source et le stockage vérifiable (pour empêcher la modification des jeux de données ou la défaillance d’un point unique). En revanche, pendant la phase d’entraînement réelle, on a généralement besoin de nœuds IPFS pour mettre en cache les données chaudes, ou de combiner des réseaux de calcul en périphérie (par ex. Bacalhau / Lilypad) afin d’obtenir une collaboration efficace.

C’est d’ailleurs l’une des directions les plus en vogue pour combiner la DePIN (infrastructure physique décentralisée) et l’IA :

Utiliser Filecoin/Arweave pour garantir la mise à disposition ouverte et durable ainsi que la crédibilité des actifs de données, et fournir aux GPU l’entraînement via une couche de cache hautes performances.

Les sources des contenus proviennent de médias officiels / actualités en ligne. Le contenu est fourni à titre indicatif, pour l’apprentissage et l’échange ; veuillez strictement respecter les lois et réglementations en vigueur dans votre lieu. Cet article ne constitue pas une recommandation en matière d’investissement.