كنت أراجع مستندات معمارية openledger وبعض المخططات، وكنت مركّز بشكل أساسي على كيف يحاولون جعل "بيانات الذكاء الاصطناعي" تتصرف كشيء يمكن التنسيق عليه على السلسلة دون تحويل كل شيء إلى وسيط بيانات مركزي مع ملصق توكن عليه. ما جذب انتباهي هو أنهم لا يتحدثون فقط عن تخزين البيانات، بل عن مسارات النسبة والدفع التي تتبع البيانات في استخدام النموذج. هذه هي النقطة الصعبة، إذا نجحت.
معظم الناس الذين تحدثت إليهم (وبصراحة، بعض المنشورات المجتمعية) يتعاملون مع openledger كأنه مجرد توكن آخر من الذكاء الاصطناعي + الكريبتو: يرفع المساهمون البيانات، يرتفع التوكن، الجميع يكسب. لكن إذا نزعت هذه السرد، فإن السؤال الأكثر إثارة هو ما إذا كان النظام يمكن أن ينتج إشارات أصل موثوقة وطلب مستدام من بناة النماذج. خلاف ذلك، فهي مجرد انبعاثات تدفع مقابل التحميلات.
تبرز بعض المكوّنات:
1) نظام مساهمة بيانات لامركزي
تعيش مقولة “لامركزية” أو تموت بناءً على ما يتم توزيعه فعلًا. هل هو التخزين والفهرسة فقط؟ أم أيضًا عملية التنقية/التنسيق (curation) وفرض الجودة؟ يبدو التصميم وكأنه يفترض أن العديد من المساهمين الصغار يمكنهم تقديم مجموعات بيانات مفيدة (نصوص، صور، سجلات تتبّع للأدوات، سجلات المجال)، وأن الشبكة يمكنها توجيهها إلى مسارات التدريب/الضبط الدقيق/التقييم. ما زلت غير متأكد من مدى كون النظام قابلًا بلا إذن (permissionless) أم أنه مُقيَّد بواسطة المنسقين أو القوائم البيضاء (whitelists)، وهذا مهم لأن ضغط السبام ليس افتراضًا نظريًا هنا.
2) آلية الإسناد + المكافأة
يميل openledger إلى اعتبار إسناد البيانات بدائيّة أساسية: تتبّع من أين جاءت البيانات، ثم ادفع عند استخدامها. وهذه هي الفقرة التي أواصل التفكير فيها… الإسناد في الذكاء الاصطناعي ليس مثل “إتاوات أغنية”. فبالنسبة للتدريب، أنت تتحدث عن تحديثات التدرّج (gradient updates) وباتشات مختلطة وعمليات ضبط لاحقة (fine-tunes) على المخرجات. لذلك يحتاج البروتوكول إلى تقريب: إيصالات الاستخدام، أوزان على مستوى مجموعة البيانات، تقييمات المساهمة، أو “برهان تأثير” تقدّمه بعض النماذج. كل نهج له سطح ثقة. إذا استطاع مشغّل النموذج أن يكذب بشأن ما استخدمه، فإن السلسلة لا تُوثّق إلا الكذب.
3) ديناميكيات السوق بين البيانات والنماذج
هناك سوق ضمني: يزوّد المساهمون مجموعات البيانات؛ يطلبها منشئو النماذج؛ تدفع الوكلاء/التطبيقات مقابل مكالمات النموذج؛ وتعود العائدات. يشبه هذا منصات الذكاء الاصطناعي المركزية من حيث الجوهر (رفع بيانات، تدريب نماذج، بيع إمكانية الوصول)، إلا أن openledger يريد البنية الاقتصادية وسجل الحقوق على السلسلة (on-chain). أنا فضولي لمعرفة هل ستكون نهايتهم في الغالب “بيانات لمزيد من الضبط الدقيق” أم “بيانات تقييم + حلقات تغذية راجعة”، لأن بيانات التقييم (مجموعات اختبار صعبة ومحددة للمجال) قد تكون أكثر قابلية للدفاع من مجملات تدريب عامة.
4) حوافز الرموز + طبقة تنسيق الشبكة/التحقق
الرمز يقوم بعدة أدوار: تحفيز المساهمات، والدفع مقابل الحوسبة/الخدمات، وتنسيق الحوكمة/المعلمات. هذا عدد كبير من المهام. أود أن أرى فصلًا واضحًا بين (أ) المحاسبة عن الاستخدام و(ب) دعم/تمويل التهيئة (bootstrapping). وإلا قد تخفي الانبعاثات (emissions) غياب المشترين الحقيقيين لفترة طويلة. ومن ناحية التحقق، أواصل البحث عن مكان وضعهم لـ “الحقيقة”. هل يعتمدون على إفادات من تنفيذ موثوق (trusted execution)؟ أو تدقيقات؟ أو سمعة؟ أو تسوية نزاعات؟ التحقق الكامل على السلسلة لتدريب الذكاء الاصطناعي غير واقعي؛ لا مفر من نوع من مرساة ثقة خارج السلسلة (off-chain trust anchor).
إن اختبار القيمة الحقيقي هو: من الذي يخلقها؟ يخلق المساهمون قيمة محتملة، لكن ذلك لا يتحقق إلا إذا قام منشئو النماذج فعلًا بجلب تلك البيانات لأن ذلك أرخص/أفضل مما يمكنهم استخراجه أو ترخيصه من مكان آخر. يخلق مشغّلو النماذج قيمة عبر تقديم نقاط نهاية للاستدلال، لكن الإسناد يعتمد على ألا يعبثوا بالإيصالات. وتخلق التطبيقات/المستخدمون قيمة عبر الدفع مقابل مخرجات مفيدة، وهذا يعتمد على تحسّن جودة النموذج بشكل ملحوظ بسبب هذه الشبكة.
قلقي يتمحور في الغالب حول الافتراضات: أن الطلب على مجموعات بيانات خارجية في مجال الذكاء الاصطناعي سيكون مفتوحًا ومستمرًا؛ وأن الإسناد يمكن أن يكون “كافيًا” لمنع سباق إرسال عشوائي (سبام)؛ وأن مكافآت الرموز لن تصبح السبب الرئيسي لظهور البيانات. تخيّل مثالًا واقعيًا: نموذج متخصص لتلخيص القضايا القانونية يريد بنود عقود جديدة ومُوسومة جيدًا مع بيانات إسناد الاختصاص القضائي (jurisdiction metadata). في إعداد مركزي، يبيع موردٌ مجموعة بيانات مُنقّاة مع عقد. في openledger، هل يستطيع جمهورٌ إنتاج مجموعة البيانات هذه بتوسيمات متسقة؟ وهل يمكن لمنشئ النموذج أن يثبت أنه استخدمها (ويدفع) دون أن يسرّب وصفات تدريبية خاصة؟ لست مقتنعًا بعد.
يتمّتتبع:
- نسبة المدفوعات القادمة من رسوم الاستخدام الفعلي مقابل انبعاثات/دعم الرموز
- إشارات الجودة: معدلات القبول، معدلات النزاع، أو تركّز أمور المنسق/السمعة
- دليل على المشترين المتكررين (نفس منشئي النماذج يشترون عدة تحديثات لمجموعة البيانات)
- زمن/تكلفة التحقق: إلى أي مدى تكون حلقة الإسناد + التسوية ثقيلة على نطاق واسع
لا يوجد استنتاج مثالي حتى الآن. أنا أحب الاتجاه نحو اعتبار الإسناد أمرًا ذا أولوية (first-class)، لكن يجب أن يصمد النظام في المرحلة المملة عندما يكون الطلب خفيفًا والحوافز سهلة الاستغلال. السؤال الذي أعود إليه دائمًا: ما هو الحد الأدنى من “حزمة الثقة” التي يحتاجها openledger كي يدفع منشئو النماذج أموالًا حقيقية مقابل البيانات، بدل التعامل مع الشبكة كصنبور بيانات مدعوم؟


