#openledger $OPEN La era de Common Crawl está llegando a su fin, OpenLedger apuesta por un mundo donde los datos estén "agotados".
En la última década, el entrenamiento de grandes modelos se ha basado en Common Crawl, un corpus que abarca todo el internet público.
Pero a partir de 2024, este camino comenzará a cerrarse.
Los textos de alta calidad en internet público están prácticamente agotados, y una parte significativa del contenido nuevo es generado por IA (lo que contaminará el próximo entrenamiento), los datos profesionales de alto valor están bloqueados en empresas e instituciones, y los editores y medios de comunicación han demandado colectivamente a las empresas de IA por prohibir su entrenamiento.
La idea de que "los datos se pueden raspar gratis indefinidamente" está perdiendo validez a una velocidad visible.
Lo que OpenLedger está apostando es que los datos en ese mundo serán "agotados".
No competirá en cantidad con el rastreo común. Lo que hace es otra cosa: el conjunto de datos dorado.
Los datos en la red no son raspados, son contribuciones activas de la comunidad + seleccionados + limpiados + versionados, formando un activo. Cada dato tiene una pertenencia en la cadena, influencia rastreable, y los contribuyentes reciben compensaciones según el uso razonado de la cantidad.
Este mecanismo atrae no a los que están "dispuestos a dar su contenido gratis a la IA", sino a los que están "dispuestos a operar su conocimiento profesional como un activo de manera continua".
Médicos contribuyendo ejemplos de organizaciones, abogados contribuyendo modelos de contratos, ingenieros contribuyendo patrones de código, investigadores contribuyendo conocimientos de campo: estos datos escasos, que anteriormente estaban dispersos en los trabajos individuales de profesionales y nunca entrarían en conjuntos de entrenamiento de grandes modelos, han encontrado por primera vez un canal para ser agrupados.
Esto es una necesidad:
La era de la captura común era "cuanto más se raspa, mejor". La era del conjunto de datos dorado es "cuanto más profundo es la calidad, más valioso".
También hay que hablar de riesgos. La premisa de estas seis configuraciones es que la capacidad de rastreo de pertenencia de PoA funcione de manera estable bajo volúmenes de datos masivos, que el ecosistema de la red de datos pueda atraer a verdaderos contribuyentes profesionales escasos, y que la capacidad de incentivos sostenibles del token OPEN esté garantizada. Estas tres cosas aún están en una etapa temprana.
Pero la dirección es clara: la próxima generación de IA no crecerá más a expensas de raspar todo internet.
Se acercará a un conjunto de datos dorado que esté correctamente organizado, con derechos correctos en la cadena y pagado de manera continua.
@OpenLedger #OpenLedger $OPEN
En la última década, el entrenamiento de grandes modelos se ha basado en Common Crawl, un corpus que abarca todo el internet público.
Pero a partir de 2024, este camino comenzará a cerrarse.
Los textos de alta calidad en internet público están prácticamente agotados, y una parte significativa del contenido nuevo es generado por IA (lo que contaminará el próximo entrenamiento), los datos profesionales de alto valor están bloqueados en empresas e instituciones, y los editores y medios de comunicación han demandado colectivamente a las empresas de IA por prohibir su entrenamiento.
La idea de que "los datos se pueden raspar gratis indefinidamente" está perdiendo validez a una velocidad visible.
Lo que OpenLedger está apostando es que los datos en ese mundo serán "agotados".
No competirá en cantidad con el rastreo común. Lo que hace es otra cosa: el conjunto de datos dorado.
Los datos en la red no son raspados, son contribuciones activas de la comunidad + seleccionados + limpiados + versionados, formando un activo. Cada dato tiene una pertenencia en la cadena, influencia rastreable, y los contribuyentes reciben compensaciones según el uso razonado de la cantidad.
Este mecanismo atrae no a los que están "dispuestos a dar su contenido gratis a la IA", sino a los que están "dispuestos a operar su conocimiento profesional como un activo de manera continua".
Médicos contribuyendo ejemplos de organizaciones, abogados contribuyendo modelos de contratos, ingenieros contribuyendo patrones de código, investigadores contribuyendo conocimientos de campo: estos datos escasos, que anteriormente estaban dispersos en los trabajos individuales de profesionales y nunca entrarían en conjuntos de entrenamiento de grandes modelos, han encontrado por primera vez un canal para ser agrupados.
Esto es una necesidad:
La era de la captura común era "cuanto más se raspa, mejor". La era del conjunto de datos dorado es "cuanto más profundo es la calidad, más valioso".
También hay que hablar de riesgos. La premisa de estas seis configuraciones es que la capacidad de rastreo de pertenencia de PoA funcione de manera estable bajo volúmenes de datos masivos, que el ecosistema de la red de datos pueda atraer a verdaderos contribuyentes profesionales escasos, y que la capacidad de incentivos sostenibles del token OPEN esté garantizada. Estas tres cosas aún están en una etapa temprana.
Pero la dirección es clara: la próxima generación de IA no crecerá más a expensas de raspar todo internet.
Se acercará a un conjunto de datos dorado que esté correctamente organizado, con derechos correctos en la cadena y pagado de manera continua.
@OpenLedger #OpenLedger $OPEN
