#openledger $OPEN A era do Common Crawl está prestes a acabar, a OpenLedger aposta em um mundo onde os dados foram "alimentados" até o fim.
Nos últimos dez anos, o treinamento de grandes modelos basicamente se baseou no Common Crawl—um conjunto de dados que cobre toda a internet pública.
Mas a partir de 2024, esse caminho começará a se esgotar.
Os textos de alta qualidade da internet pública estão basicamente esgotados, e uma parte significativa do novo conteúdo é gerado por IA (o que irá poluir a próxima geração de treinamentos), dados profissionais de alto valor estão trancados em empresas e instituições e não podem ser acessados, editores e veículos de comunicação estão processando coletivamente as empresas de IA para proibir o treinamento.
A ideia de que "dados podem ser capturados gratuitamente sem limites" está se tornando obsoleta a uma velocidade visível.
A OpenLedger aposta que os dados nesse mundo, após serem "alimentados", estarão esgotados.
Ela não vai competir em quantidade com os crawlers comuns. O que ela está fazendo é outra coisa—um conjunto de dados de ouro.
Os dados na rede não são capturados, mas são uma contribuição ativa da comunidade + seleção + limpeza + versão como um ativo. Cada dado tem uma atribuição na blockchain, impacto rastreável, e os contribuintes recebem uma parte do uso contínuo com base em raciocínios.
O que torna esse mecanismo atraente não são as pessoas "dispostas a dar seu conteúdo de graça para a IA se aproveitar", mas sim aquelas "dispostas a tratar seu conhecimento profissional como um ativo que pode ser operacionalizado continuamente".
Contribuições típicas de médicos, contratos de advogados, modelos de códigos de engenheiros, conhecimentos de campo de pesquisadores—esses dados raros, que antes estavam dispersos no trabalho individual de profissionais e nunca poderiam entrar em grandes conjuntos de treinamento de modelos, agora têm um canal organizado pela primeira vez.
Isso é uma necessidade:
Na era da captura comum, a ideia era "quanto mais, melhor". Na era do conjunto de dados de ouro, o lema é "quanto mais profundo, mais valioso".
Mas também é preciso falar sobre os riscos. O pré-requisito para a criação dessas seis estruturas é que a capacidade de rastreamento de propriedade do PoA funcione de forma estável sob um volume massivo de dados, que o ecossistema da rede de dados consiga atrair contribuintes profissionais verdadeiramente raros, e que a capacidade de incentivo sustentável do token OPEN seja adequada. Essas três coisas ainda estão em estágio inicial.
Mas a direção é clara—A próxima geração de IA não vai mais crescer se aproveitando de toda a internet.
Ela vai se basear em uma parte dos dados de ouro que foram organizados de forma séria, têm direitos corretos na blockchain, e são pagos continuamente.
@OpenLedger #OpenLedger $OPEN
Nos últimos dez anos, o treinamento de grandes modelos basicamente se baseou no Common Crawl—um conjunto de dados que cobre toda a internet pública.
Mas a partir de 2024, esse caminho começará a se esgotar.
Os textos de alta qualidade da internet pública estão basicamente esgotados, e uma parte significativa do novo conteúdo é gerado por IA (o que irá poluir a próxima geração de treinamentos), dados profissionais de alto valor estão trancados em empresas e instituições e não podem ser acessados, editores e veículos de comunicação estão processando coletivamente as empresas de IA para proibir o treinamento.
A ideia de que "dados podem ser capturados gratuitamente sem limites" está se tornando obsoleta a uma velocidade visível.
A OpenLedger aposta que os dados nesse mundo, após serem "alimentados", estarão esgotados.
Ela não vai competir em quantidade com os crawlers comuns. O que ela está fazendo é outra coisa—um conjunto de dados de ouro.
Os dados na rede não são capturados, mas são uma contribuição ativa da comunidade + seleção + limpeza + versão como um ativo. Cada dado tem uma atribuição na blockchain, impacto rastreável, e os contribuintes recebem uma parte do uso contínuo com base em raciocínios.
O que torna esse mecanismo atraente não são as pessoas "dispostas a dar seu conteúdo de graça para a IA se aproveitar", mas sim aquelas "dispostas a tratar seu conhecimento profissional como um ativo que pode ser operacionalizado continuamente".
Contribuições típicas de médicos, contratos de advogados, modelos de códigos de engenheiros, conhecimentos de campo de pesquisadores—esses dados raros, que antes estavam dispersos no trabalho individual de profissionais e nunca poderiam entrar em grandes conjuntos de treinamento de modelos, agora têm um canal organizado pela primeira vez.
Isso é uma necessidade:
Na era da captura comum, a ideia era "quanto mais, melhor". Na era do conjunto de dados de ouro, o lema é "quanto mais profundo, mais valioso".
Mas também é preciso falar sobre os riscos. O pré-requisito para a criação dessas seis estruturas é que a capacidade de rastreamento de propriedade do PoA funcione de forma estável sob um volume massivo de dados, que o ecossistema da rede de dados consiga atrair contribuintes profissionais verdadeiramente raros, e que a capacidade de incentivo sustentável do token OPEN seja adequada. Essas três coisas ainda estão em estágio inicial.
Mas a direção é clara—A próxima geração de IA não vai mais crescer se aproveitando de toda a internet.
Ela vai se basear em uma parte dos dados de ouro que foram organizados de forma séria, têm direitos corretos na blockchain, e são pagos continuamente.
@OpenLedger #OpenLedger $OPEN
