Меня зовут Ламия. Когда я думаю о том, как искусственный интеллект учится на контенте, созданном людьми, что-то кажется неправильным. Люди тратят часы на написание, создание, проектирование, исследование и обмен своим трудом в сети.... Затем большие AI-системы используют эту информацию, но почти никто никогда не получает признание за то, что они сделали. Это кажется несправедливым, потому что эти создатели должны быть признаны и вознаграждены, когда их идеи помогают мощным инструментам становиться умнее. Вот почему вся идея атрибуции данных имеет для меня такое значение.

OpenLedger — одно из тех начинаний, которые пытаются исправить эту большую проблему справедливости в ИИ. Вместо того чтобы позволять ИИ-системам вытягивать информацию из мира без записи о том, кто ее создал, OpenLedger хочет построить систему, где у каждого фрагмента данных, используемых ИИ, есть понятная история… Это означает, что когда модель ИИ использует чьи-то знания, вы можете проследить, откуда они, и точно увидеть, кто поделился этим фрагментом информации. Надежда в том, что это сделает ИИ более справедливым и прозрачным: создатели будут не невидимыми, а признанными — и вознагражденными.
В основе идеи OpenLedger лежит то, что они называют отслеживанием атрибуции. Представьте огромную библиотеку данных, где в каждой книге указано имя автора, доказательство того, что он это написал, и запись о том, для чего использовалась эта книга… Это в целом и есть то, что OpenLedger пытается построить для данных ИИ. Любой может вносить данные в такие структурированные коллекции, и каждый вклад фиксируется так, чтобы его больше нельзя было изменить. Когда модель ИИ учится на этих данных или использует их для получения результата, система может точно сказать, какие точки данных помогли сформировать этот ответ — и кто их создал.
Реальный пример может помочь сделать это понятным. Допустим, вы написали подробное руководство о традиционных кулинарных техниках вашей культуры и поделились им в интернете. В сегодняшнем мире ИИ большая модель могла бы прочитать ваше руководство, извлечь из него факты и включить эти знания в ответы на вопросы другого человека, но никто никогда не узнает, что это пришло именно от вас… С OpenLedger ваше руководство станет частью набора данных, который фиксирует ваш вклад. Позже, каждый раз, когда ИИ использует факт из вашего руководства в своих ответах, система будет записывать, что в этом участвовала ваша работа. Со временем вы могли бы получить признание или вознаграждение за свой вклад — не какое-то расплывчатое упоминание где-то в стороне, а реальный, поддающийся проверке след, связывающий ваше имя с этим влиянием.
Эта идея также пытается помочь с другой проблемой, которую называют проблемой удержания. Это значит, что данные, использованные давным-давно, могут по-прежнему влиять на решения ИИ сейчас и в будущем, однако у традиционных систем нет надежного способа отслеживать эти старые связи… Как только информация впитывается в модель, исходный контекст и вкладчик теряются. OpenLedger хочет исправить это, ведя непрерывную запись каждого вклада и связывая его с поведением модели со временем… Если ваши данные повлияют на ответ ИИ спустя годы после того, как вы их добавили, запись атрибуции все равно сохранится, и вы по-прежнему заслужите признание.
Хотя эта картина звучит хорошо, она связана с множеством вызовов и рисков. Один из главных рисков — сложность.. Точно отслеживать, как каждый фрагмент данных влияет на выходные данные модели, — сложная техническая задача. Модели ИИ смешивают и переиспользуют информацию так, что это может быть запутанно и непредсказуемо. Если система атрибуции будет неточной или небезопасной, люди могут получить признание, которого они не заслуживают, или, что еще хуже, попытаться присвоить себе чужую работу. Это сделает всю систему несправедливой — но уже по-новому.
Еще один риск — стоимость и производительность. Системы, которые фиксируют много данных и верифицируют каждый шаг, могут замедлять работу или требовать дорогую инфраструктуру. Если каждый малейший нюанс нужно будет хранить постоянно, это может привести к огромным объемам данных, которыми будет сложно управлять. Чтобы найти правильный баланс между прозрачностью и эффективностью, будет необходимо. Если система станет слишком медленной или дорогой, немногие разработчики или создатели захотят ее использовать.
Есть еще и опасность того, что люди будут пытаться «обмануть» систему. Когда в игре есть награды или признание, всегда найдутся попытки манипулировать правилами. Кто-то может загрузить данные низкого качества или скопированные просто ради получения наград, либо найти способы обмануть систему атрибуции, чтобы она считала, будто их вклад был важнее, чем это было на самом деле. Чтобы сократить мошенничество и убедиться, что система остается заслуживающей доверия, меры защиты должны быть очень сильными.
Несмотря на эти опасения, я думаю, что подход OpenLedger стоит изучить, потому что он смещает ИИ в сторону справедливости и ответственности. Сейчас большинство моделей ИИ ощущаются как невидимые машины, которые учатся на мире, но никогда не показывают, кто помог сделать их умнее… Если создатели получат понятный способ показать свой вклад и даже получить компенсацию, это будет поощрять больше людей делиться высококачественными данными. Результатом может стать более насыщенный и прозрачный ИИ, который приносит пользу не только нескольким крупным компаниям, но и множеству отдельных людей и сообществ, помогавших его создавать.
В будущем я представляю мир, где ответы ИИ могут показывать вам точно, какие создатели помогли сформировать их — так же, как цитаты в научной статье… Это не только будет уважать авторов контента, но и сделает результаты ИИ более надежными и объяснимыми. Вместо загадочного «черного ящика» ИИ станет сетью человеческих вкладов — каждый видимый и признанный. Это выглядит как гораздо более человечное и справедливое направление для развития этой технологии.

