Heute Abend klettert diese Arbeit auf den ersten Platz der Rangliste der „Top-Performer“-Projekte (erste Kategorie). Es geht nicht darum, das Modell nur größer zu machen, sondern die globale wissenschaftliche Codebasis so umzubauen, dass sie direkt ausführbar, überprüfbar und trainierbar wird. Die Kernidee: Man gibt einem Agenten einen Arbeitsbereich mit ausführbaren Abnahmekriterien, damit er wie ein Ingenieur Code schreibt, Code anpasst und anschließend anhand wissenschaftlicher Kriterien prüft, ob das Ergebnis stimmt.
Entscheidend ist, dass das Umfeld auf der Trainingsseite drei Arten des Lernens bereitstellt—Supervised Fine-Tuning, Reinforcement Learning und Evaluation—und damit die bislang in den Anhängen von Paper verstreut vorhandenen einzelnen Skripte zu einem Aufgabenkatalog für die wiederholte Übung der nächsten Generation wissenschaftlicher Agenten vereinheitlicht. Der Agent lernt nicht einfach auswendig Antworten, sondern erhält in einer tatsächlich ausführbaren Umgebung Feedback. Und auch der dazugehörige Repository-Code wird veröffentlicht—damit lässt sich das Vorgehen direkt für Weiterentwicklungen nutzen.
Für die Krypto-Welt bedeutet diese Route: Sobald sie ausgereift ist, haben Projekte, die auf der Chain Agenten-Protokolle nutzen, einen verifizierbaren Trainingsplatz. $FET und Plattformen wie $TAO , die mit mehreren Agenten koordiniert vorankommen, liegt der langfristige Wert nicht primär im Modell selbst, sondern darin, ob der Agent genügend viele Umgebungen bekommt, in denen er Feedback erhält. Diese Arbeit schiebt den Engpass auf der Seite der Umgebung deutlich nach vorn.
#AI论文 #科学代理 #AI
Entscheidend ist, dass das Umfeld auf der Trainingsseite drei Arten des Lernens bereitstellt—Supervised Fine-Tuning, Reinforcement Learning und Evaluation—und damit die bislang in den Anhängen von Paper verstreut vorhandenen einzelnen Skripte zu einem Aufgabenkatalog für die wiederholte Übung der nächsten Generation wissenschaftlicher Agenten vereinheitlicht. Der Agent lernt nicht einfach auswendig Antworten, sondern erhält in einer tatsächlich ausführbaren Umgebung Feedback. Und auch der dazugehörige Repository-Code wird veröffentlicht—damit lässt sich das Vorgehen direkt für Weiterentwicklungen nutzen.
Für die Krypto-Welt bedeutet diese Route: Sobald sie ausgereift ist, haben Projekte, die auf der Chain Agenten-Protokolle nutzen, einen verifizierbaren Trainingsplatz. $FET und Plattformen wie $TAO , die mit mehreren Agenten koordiniert vorankommen, liegt der langfristige Wert nicht primär im Modell selbst, sondern darin, ob der Agent genügend viele Umgebungen bekommt, in denen er Feedback erhält. Diese Arbeit schiebt den Engpass auf der Seite der Umgebung deutlich nach vorn.
#AI论文 #科学代理 #AI

