#openledger $OPEN Die Ära von Common Crawl neigt sich dem Ende zu, OpenLedger setzt auf eine Welt, in der die Daten "verbraucht" sind.
In den letzten zehn Jahren basierte das Training großer Modelle im Wesentlichen auf Common Crawl – einem Crawling-Korpus, das das gesamte öffentliche Internet abdeckt.
Aber ab 2024 wird dieser Weg nicht mehr funktionieren.
Die hochwertigen Texte im öffentlichen Internet sind größtenteils aufgebraucht, ein erheblicher Teil der neuen Inhalte ist KI-generiert (was die nächste Trainingsgeneration kontaminieren wird), wertvolle Fachdaten sind in Unternehmen und Institutionen eingesperrt und können nicht gecrawlt werden, und führende Verlage und Medien verklagen kollektiv KI-Unternehmen, um das Training zu verbieten.
Die Vorstellung, "Daten können unbegrenzt kostenlos gecrawlt werden", verliert in rasantem Tempo an Gültigkeit.
OpenLedger setzt auf die Welt, in der die Daten nach dieser Phase "verbraucht" sind.
Es wird nicht versuchen, mit gewöhnlichem Crawling in der Quantität zu konkurrieren. Was es tut, ist etwas anderes – ein Golden Dataset.
Die Daten im Netz sind nicht gecrawlt, sondern aktiv von der Community beigetragen + ausgewählt + bereinigt + versioniert, um Vermögenswerte zu formen. Jede Datenzeile hat eine On-Chain-Zugehörigkeit, ihre Auswirkungen sind nachverfolgbar, und die Beitragszahler werden basierend auf ihrer Nutzung und den kontinuierlichen Beiträgen abgerechnet.
Diese Mechanik zieht nicht die Menschen an, die bereit sind, ihre Inhalte kostenlos an KI zu "verschenken", sondern die, die bereit sind, ihr Fachwissen als Vermögenswert kontinuierlich zu betreiben.
Ärzte, die Organisationen mit typischen Beiträgen beisteuern, Anwälte, die Vertragsvorlagen beisteuern, Ingenieure, die Code-Modelle beitragen, Forscher, die Fachwissen beisteuern – diese zuvor verstreuten, wertvollen Daten der Fachleute, die nie in große Trainingssets für Modelle gelangen konnten, haben nun zum ersten Mal einen Weg gefunden, zusammenzukommen.
Das ist ein Muss:
Die Ära des gewöhnlichen Crawlings war "je mehr, desto besser". Die Ära des Golden Datasets ist "je tiefer die Qualität, desto wertvoller".
Risiken müssen ebenfalls angesprochen werden. Die Voraussetzung für die Etablierung dieser sechs Sätze ist, dass die PoA-Zugehörigkeitsverfolgung unter enormen Datenmengen stabil funktioniert, dass das Datenökosystem in der Lage ist, wirklich rare Fachbeiträge anzuziehen und dass die Anreizmechanismen des OPEN-Tokens nachhaltig sind. Diese drei Dinge befinden sich noch in einem frühen Stadium.
Aber die Richtung ist klar – die nächste Generation KI wird nicht mehr darauf angewiesen sein, das gesamte Internet kostenlos zu nutzen.
Sie wird sich auf einen Teil der ernsthaft organisierten, korrekt on-chain rechten und kontinuierlich bezahlten Golden Datasets stützen.
@OpenLedger #OpenLedger $OPEN