Heute erzähle ich euch von einer misslungenen Erfahrung. Ich habe auf OpenLedger ein Modell für Inferenztests laufen lassen und mich dabei richtig reingelegt. Die Sache ist die: Ich wollte die Attribution von einem bestimmten Datensatz überprüfen und habe dafür eine Reihe von annotierten Finanznachrichten genutzt, um ein kleines Modell zu feintunen. Insgesamt waren es 800 Samples, jedes mit Zeitstempel und Quelle. Nachdem ich das Training abgeschlossen hatte, habe ich eine Testnachricht genutzt, um das Modell zu fragen: "Wie steht es um die neuesten Finanzberichte dieser Firma?" Das Modell hat eine Analyse zurückgegeben. Als ich die On-Chain-Attributionsaufzeichnungen überprüft habe, stellte ich fest, dass der größte Beitrag tatsächlich eine alte Nachricht von vor drei Jahren war, die 60% des Gewichts ausmachte. Das kann nicht stimmen! In einem Szenario, wo Aktualität gefordert ist, sollte alte Daten nicht so stark gewichtet werden.
Ich habe schnell die Trainingsparameter durchgesehen und festgestellt, dass ich vergessen hatte, den Zeitverfallfaktor beim Feintuning einzustellen. Das System behandelt standardmäßig alle Daten gleich. Das Gewicht einer Nachricht von vor drei Jahren war also gleichwertig mit dem einer von vor drei Tagen. Das Modell holt sich natürlich die am besten passenden Keywords, egal ob neu oder alt. Ich habe den Verfallfaktor neu konfiguriert und das Gewicht von Daten, die älter als einen Monat sind, halbiert. Dann habe ich das Training erneut durchgeführt und die gleiche Testnachricht gefragt. Diesmal zeigte das Attributionsresultat, dass der Hauptbeitrag von einem Bericht von vor zwei Wochen kam, mit einem Gewicht von nur über 40%, aber die anderen aktuellen Daten summierten sich auf über 70%. Endlich war es vernünftig.
Nach dieser ganzen Aktion habe ich fast 2 in Inferenzgebühren ausgegeben, aber ich habe eine Lektion gelernt: Beim Feintuning auf OpenLedger sollte man nicht nur die Datenmenge erhöhen. Zeitgewichtung und solche Details müssen richtig eingestellt werden, sonst könnte die Antwort des Modells veraltet sein. Der Vorteil dieses Attributionssystems ist, dass man sehen kann, wo das Problem lag. Im Gegensatz zu früher, als ich mit Bitcoin oder Ethereum gespielt habe und bei falschen Adressen nur mir selbst die Schuld geben konnte, gibt es bei einem fehlerhaften Modell keine Möglichkeit, das zu überprüfen. Jungs, wenn ihr zeitkritische Aufgaben angeht, vergesst nicht den Zeitverfall hinzuzufügen. Lernt nicht auf meine Kosten! @OpenLedger $OPEN #OpenLedger
Ich habe schnell die Trainingsparameter durchgesehen und festgestellt, dass ich vergessen hatte, den Zeitverfallfaktor beim Feintuning einzustellen. Das System behandelt standardmäßig alle Daten gleich. Das Gewicht einer Nachricht von vor drei Jahren war also gleichwertig mit dem einer von vor drei Tagen. Das Modell holt sich natürlich die am besten passenden Keywords, egal ob neu oder alt. Ich habe den Verfallfaktor neu konfiguriert und das Gewicht von Daten, die älter als einen Monat sind, halbiert. Dann habe ich das Training erneut durchgeführt und die gleiche Testnachricht gefragt. Diesmal zeigte das Attributionsresultat, dass der Hauptbeitrag von einem Bericht von vor zwei Wochen kam, mit einem Gewicht von nur über 40%, aber die anderen aktuellen Daten summierten sich auf über 70%. Endlich war es vernünftig.
Nach dieser ganzen Aktion habe ich fast 2 in Inferenzgebühren ausgegeben, aber ich habe eine Lektion gelernt: Beim Feintuning auf OpenLedger sollte man nicht nur die Datenmenge erhöhen. Zeitgewichtung und solche Details müssen richtig eingestellt werden, sonst könnte die Antwort des Modells veraltet sein. Der Vorteil dieses Attributionssystems ist, dass man sehen kann, wo das Problem lag. Im Gegensatz zu früher, als ich mit Bitcoin oder Ethereum gespielt habe und bei falschen Adressen nur mir selbst die Schuld geben konnte, gibt es bei einem fehlerhaften Modell keine Möglichkeit, das zu überprüfen. Jungs, wenn ihr zeitkritische Aufgaben angeht, vergesst nicht den Zeitverfall hinzuzufügen. Lernt nicht auf meine Kosten! @OpenLedger $OPEN #OpenLedger