Ursprünglicher Titel: Welche Plattform baut die besten KI-Agenten? Wir testen ChatGPT, Claude, Gemini und mehr.

Ursprünglicher Autor: Jose Antonio Lanz

Ursprüngliche Quelle: https://decrypt.co/

Zusammenstellung: Daisy, Mars Finance

Welche Plattform kann die besten KI-Agenten erstellen? Wir haben ChatGPT, Claude, Gemini und andere Plattformen getestet.

Vergleichen Sie die fünf führenden Plattformen, um herauszufinden, welche sich am besten eignet, um Ihren zukünftigen KI-Agenten im Alltag zu hosten.

KI-Agenten können viele Dinge tun: Informationen aus Ihrer Dokumentenbibliothek suchen, Code schreiben, Webdaten extrahieren, komplexe Daten analysieren und noch viel mehr. Sie können sogar ein virtuelles Büro erstellen, das aus einer Gruppe von KI-Agenten besteht, die sich auf verschiedene Aufgaben konzentrieren und wie ein professionelles digitales Mitarbeiterteam zusammenarbeiten.

Aber wie schwer ist das wirklich? Wenn eine normale Person ihren eigenen KI-Finanzberater erstellen möchte, ohne auf APIs angewiesen zu sein, ohne seltsame Codierung, ohne Github, welche Plattform kann den Benutzern die beste Unterstützung bieten? Wir möchten nur sehen, wie diese führenden KI-Unternehmen bei der Unterstützung normaler Benutzer aussehen, um KI-Agenten zu erstellen, ohne dass die Benutzer über außergewöhnliche technische Fähigkeiten verfügen müssen.

Natürlich, je mehr Sie investieren, desto mehr erhalten Sie. In diesem Fall wollten wir auch sehen, ob es einen Zusammenhang zwischen der Einfachheit, mit der eine normale Person einen Agenten einrichten kann, und der Qualität der Ergebnisse gibt, die jede Plattform liefert.

Unser Experiment verglich die fünf großen Plattformen: ChatGPT, Claude, Huggingface, Mistral AI und Gemini. Jede Plattform erhielt dieselben grundlegenden Anweisungen, um einen Finanzberater zu erstellen.

Der Test konzentrierte sich auf die Plug-and-Play-Fähigkeit der Plattform. Der Schwerpunkt lag darauf, ob der Agent ein häufiges Szenario bewältigen kann - in diesem Fall, jemandem zu helfen, 25.000 Dollar Investitionen mit 30.000 Dollar Schulden auszugleichen. Wir wollten auch sehen, wie gut sie Handelsdiagramme analysieren können. Wir haben versucht, zusätzliche Tools zu vermeiden, um die Produktivität des Agenten zu steigern, sondern haben den einfachsten Ansatz gewählt.

Kurz gesagt, hier sind unsere Erkenntnisse und Modellbewertungen:

Plattform-Rankings

1) OpenAI's GPT (8.5/10)

  • Einrichtungsgrad: 4/5

  • Ergebnisqualität: 4.5/5

ChatGPT ist die am ausgewogensten Plattform, die komplexe Agentenerstellungsoptionen bietet und sowohl geführte als auch manuelle Optionen aufweist, um die Bedürfnisse von völligen Anfängern und erfahrenen Benutzern zu erfüllen.

Obwohl die neueste Benutzeroberflächenaktualisierung einige Funktionen in Menüs versteckt hat, zeigt die Plattform hervorragende Leistungen bei der Umwandlung komplexer Benutzeranforderungen in funktionale Agenten. Wir haben das Modell getestet, indem wir einen Finanzberater erstellt haben, und die Ergebnisse zeigen, dass dieser Agent über ein ausgezeichnetes Kontextbewusstsein und strukturierte Problemlösungsfähigkeiten verfügt, die detaillierte und kohärente Strategien für Schuldenmanagement und Investitionsverteilung bieten.

2) Google Gemini (7/10)

  • Einrichtungsgrad: 4/5

  • Ergebnisqualität: 3/5

Gemini sticht mit seiner eleganten, intuitiven Benutzeroberfläche und hervorragenden Fehlerbehandlung hervor. Zwar sind detailliertere Eingaben erforderlich, um die besten Ergebnisse zu erzielen, aber seine wörtliche Interpretation der Anweisungen schafft konsistente und vorhersehbare Ergebnisse.

Der Agent betont bei der Bereitstellung finanzieller Ratschläge die Beratungsweise, die die Sammlung von Kontext vor der Empfehlung hervorhebt, ähnlich wie in der professionellen Praxis. Allerdings könnte er in Null-Proben-Antworten zu konservativ sein.

3) HuggingChat (6.5/10)

  • Einrichtungsgrad: 2/5

  • Ergebnisqualität: 4.5/5

Diese Open-Source-Plattform bietet unübertroffene Anpassungs- und Modellwahlmöglichkeiten. Für diejenigen, die eine granulare Kontrolle über jedes Detail suchen, ist dies eine hervorragende Wahl, aber möglicherweise nicht für diejenigen geeignet, die eine einfachere Lösung suchen. (Man kann es mit dem Vergleich zwischen Linux- und macOS-Systemen vergleichen). Ihre komplexen Zeitrahmen und die Integration von Tools zeigen ihre fortschrittlichen Fähigkeiten.

Wir haben einen reinen Agenten ohne zusätzliche Funktionen erstellt. Wir haben Nvidia's Nemomotron als Basis-Sprachmodell verwendet, dessen Ausgabequalität mit der von ChatGPT vergleichbar ist. Für das Open-Source-Lager ist das nicht schlecht.

4) Claude (5.5/10)

  • Einrichtungsgrad: 2.5/5

  • Ergebnisqualität: 3/5

Die Plattform von Anthropic zeigt in bestimmten Bereichen hervorragende Leistungen, insbesondere bei Aufgaben, die umfangreiche Kontextverarbeitung und Codeanalyse erfordern. Ihre minimalistische Oberfläche verbirgt ihre komplexen Fähigkeiten, aber das „optionale“ Anweisungsfeld kann für Benutzer verwirrend sein.

Unser Agent war bei der Bereitstellung von Ratschlägen sehr konservativ und vage, zeigte jedoch ein gutes Risikobewusstsein und strategisches Denken. Er benötigt sorgfältigere Eingaben, um sein volles Potenzial zu entfalten, aber wenn der Test adaptive Eingaben verwendet hätte, würde dies der Annahme ähnlicher Bedingungen widersprechen, sodass es nicht fair wäre.

5) Mistral AI (5/10)

Einrichtungsgrad: 2.5/5

Ergebnisqualität: 2.5/5

Diese französische Plattform bietet einzigartige, beispielbasierte Lern- und tiefgehende Anpassungsoptionen. Ihre entwicklerfreundliche Benutzeroberfläche und gelegentlichen Sprachwechsel schaffen jedoch Hindernisse für nicht-technische Benutzer. Sie erfordert auch Änderungen an der Konfiguration des Agenten, um unterschiedlichen Modellen die Ausführung von Aufgaben wie Bildanalyse oder Codeverarbeitung zu ermöglichen. Das ist nicht ideal.

Der Finanzberater zeigt Potenzial im Interaktionsdesign, hat jedoch Schwierigkeiten mit grundlegenden mathematischen Überprüfungen und erzielt die schlechtesten Ergebnisse. Es ist nicht so, dass die Ausgaben schlecht sind, aber im Null-Proben-Test ist dies das wenig zufriedenstellende.

Tiefenanalyse

Angesichts der vorherigen Bewertungen gibt es keine universelle Lösung; jede Plattform hat ihre eigenen Vor- und Nachteile. Durch fokussierte und sorgfältige Anpassungen der Eingabeaufforderungen könnten die Ergebnisse auf einer bestimmten Plattform variieren und sogar andere Plattformen übertreffen. Letztendlich haben alle Sprachmodelle (LLMs) ihre eigenen unterschiedlichen Eingabestile.

Wenn Sie mehr über die Gründe hinter unseren Bewertungen erfahren möchten, finden Sie hier eine tiefere Analyse unserer Erfahrungen und der Ergebnisse der Agenten. Wir haben alle Agenten mit denselben Systemaufforderungen konfiguriert, ohne zusätzliche Parameter und Funktionen, und ihnen die gleiche grundlegende Frage gestellt: „Ich habe 25.000 Dollar zu investieren und 30.000 Dollar Schulden. Erstellen Sie einen Finanzplan für mich.“

OpenAI

Die Benutzeroberfläche von ChatGPT wurde kürzlich aktualisiert, was die Bedienung tatsächlich komplizierter gemacht hat. Die GPT-Erstellungsoptionen sind jetzt im Menü versteckt, aber sobald Sie sie gefunden haben, bietet es zwei Pfade: eine dialogorientierte Einrichtung, bei der die KI hilft, Ihren Agenten zu erstellen; und eine manuelle Konfiguration, die für diejenigen geeignet ist, die genau wissen, was sie wollen.

OpenAI's GPT-Plattform ist ein funktionsreiches „Schweizer Taschenmesser“ - es kann Code lesen, das Web durchsuchen, Bildgenerierung und -analyse durchführen. Der KI-gesteuerte Einrichtungsprozess macht es besonders anfängerfreundlich, obwohl es für fortgeschrittene Benutzer, die eine feine Kontrolle benötigen, möglicherweise etwas einschränkend erscheint. (Wenn Sie beispielsweise das Modell bitten, spezifischer oder detaillierter zu sein, kann es die gesamte Systemaufforderung ändern, was zu schlechteren Ergebnissen führen kann.)

Bei der tatsächlichen Nutzung des Agenten ist ChatGPT sehr direkt, die Oberfläche ist klar und leicht verständlich.

Diese Agenten können Dokumente nativ lesen und Bilder verstehen, was ihnen einen gewissen Vorteil gegenüber anderen Plattformen verschafft.

Jetzt sprechen wir über die Qualität des Agenten, den Sie mit grundlegenden Eingaben erstellen können. Unser Finanzberater MoneyGPT hat uns einen strukturierten Problemlösungs-Masterkurs gezeigt, der ziemlich beeindruckend ist.

Abgesehen von seiner präzisen Mittelverteilung - „$20.000 für hochverzinsliche Schulden“ sowie einer detaillierten Portfolioaufteilung - zeigt der Agent auch komplexes finanzielles Denken. Er bietet einen fünfstufigen Fahrplan an, der nicht nur eine Liste ist, sondern eine kohärente Strategie, die kurzfristige Bedürfnisse und langfristige Planung berücksichtigt.

Der Vorteil dieses Agenten liegt in der Fähigkeit, Details und Kontext auszubalancieren. Während er ein spezifisches Portfolio empfiehlt (40% Investition in S&P 500, 30% Investition in Anleihen), erklärt er auch die Gründe hinter der Empfehlung: „Die Rückzahlung hochverzinslicher Schulden ist wie die Erzielung einer garantierten Rendite.“ Dieses Kontextbewusstsein erstreckt sich auf die langfristige Planung, empfiehlt regelmäßige Überprüfungszyklen und Anpassungen der Strategie je nach veränderlichen Umständen.

Allerdings offenbart diese Fülle an Informationen auch eine potenzielle Schwäche: Sie könnte Benutzer durch die einmalige Bereitstellung zu vieler Details überfordern. Obwohl es technisch sehr umfassend ist, könnten die schnell übermittelten spezifischen Zuteilungen, Anlagestrategien und Überwachungspläne für Finanzneulinge etwas abschreckend wirken.

Google

Insgesamt sticht Googles Gemini-Agenten-Erstellungsplattform ästhetisch hervor, mit einer raffinierten, intuitiven Oberfläche, die den Agentenerstellungsprozess fast zu einfach erscheinen lässt. Die wörtliche Interpretation der Anweisungen hilft, Verwirrung zu vermeiden, und die einfache Benutzeroberfläche beseitigt das Gefühl der Überwältigung in der KI-Entwicklung.

Um qualitativ hochwertige Ergebnisse zu erzielen, benötigt er jedoch detailliertere Eingaben. Er geht nicht davon aus, dass die Dinge klar sind: Kurze Eingaben führen zu minderwertigen Antworten.

Im Hintergrund verfügt es über leistungsstarke Funktionen - die Google-unterstützte Websuche, Codeanalyse und Bildverarbeitung, die mit denen von ChatGPT vergleichbar sind, aber die meisten basieren auf Microsoft-Technologie.

Die Benutzeroberfläche von Gemini fühlt sich an, als wäre sie von jemandem entworfen worden, der wirklich versteht, wie Benutzererfahrung funktioniert. Die Schnittstelle führt die Benutzer durch klare Beschriftungen, alle Informationen sind auf einem Bildschirm sichtbar.

Dieser raffinierte Ansatz macht es besonders ansprechend für neue Benutzer, obwohl erfahrene Benutzer möglicherweise das Gefühl haben, dass es an detaillierter Kontrolle mangelt.

Wir haben unseren Agenten MoneyGem genannt und ihn gebeten, einen Finanzplan zu erstellen. Sein beratender Ansatz zeigt Googles einzigartige Problemlösungsmethode. Er gibt keine direkten Antworten, sondern stellt zuerst Fragen wie „Was für eine Art von Schulden ist das?“ und „Wie hoch ist Ihr Zinssatz?“ - was zeigt, dass er versteht, dass finanzielle Ratschläge nicht universell sind.

Er hebt hervor, Hintergrundinformationen zu sammeln, bevor er Ratschläge gibt, was mit professionellen Finanzplanungspraktiken übereinstimmt, obwohl dies für Benutzer, die schnelle Antworten suchen, frustrierend sein könnte.

Eine Null-Proben-Antwort ist nicht hilfreich. Der Agent gibt im Grunde an, dass er den Benutzer nicht versteht und keine guten finanziellen Ratschläge geben kann. Nachdem er gebeten wurde, Annahmen zu treffen und gezwungen wurde, einen Plan zu erstellen, der für die meisten Szenarien geeignet ist, hat der Agent einen sehr konservativen Entwurf eines Plans erstellt, ohne konkrete Investitionstipps zu geben.

Dennoch gab MoneyGem schließlich den Ratschlag, steuerbegünstigte Konten wie 401(k) oder Roth IRA zu maximieren, um die Steuerlast zu reduzieren. Gut.

Sie können hier klicken, um unsere Interaktion mit MoneyGem zu sehen und das Modell persönlich über diesen Link auszuprobieren.

Mistral AI

Der Agent-Konfigurationsprozess von Mistral ist etwas kompliziert und weicht von der Einfachheit ab. Das Tool zur Erstellung von Agenten ist in seinem Entwickler-Dashboard versteckt und bietet tiefgehende Anpassungsoptionen, die für Anfänger verwirrend sein könnten, aber die Benutzer erfreuen, die gerne experimentieren.

Die Oberfläche zum Erstellen von Agenten ist nicht Teil von LeChat (Chat-Oberfläche), aber sobald der Agent erstellt ist, wird er dort angezeigt.

Was uns besonders gefallen hat, ist die Möglichkeit, das Verhalten und den Antwortstil des Agenten durch Beispiel-Eingaben zu gestalten, eine Funktion, die derzeit auf anderen Plattformen nicht angeboten wird. Es gibt jedoch einen seltsamen Fehler: Bei der Erstellung des Agenten wechselte die UI plötzlich ins Französische, möglicherweise weil das Unternehmen französisch ist. Jedenfalls konnten wir nicht zurück zu Englisch oder Spanisch wechseln.

Sobald der Agent erstellt ist, muss der Benutzer ihn im regulären Chatbereich aufrufen, um ihn zu verwenden. Benutzer müssen Le Plateforme verlassen und zu Le Chat wechseln, was nicht die intuitivste Vorgehensweise ist. Dennoch ist die Verwendung der Agenten-UI ziemlich direkt, es fühlt sich an wie bei anderen KI-Chatbots.

Wir haben unseren Agenten erstellt und ihn Le Money genannt, um Mistrals französische Wurzeln zu würdigen. Seine Leistung zeigt deutlich Mistrals universellen Ansatz zur Problemlösung. Er schlägt vor, „10.000 Dollar als Notfallfonds, 15.000 Dollar zur Schuldentilgung und 10.000 Dollar für Investitionen zu verwenden“, was zunächst einfach erscheint, deutet jedoch auch darauf hin, dass der Agent einige grundlegende mathematische Überprüfungen vermisst.

Ein Gesamtbetrag von 35.000 Dollar übersteigt die verfügbaren Mittel um 10.000 Dollar, was ein grundlegender Fehler ist, und einige Sprachmodelle können solche Fehler machen, wenn sie Konzeptgenauigkeit vor numerischer Genauigkeit priorisieren.

Wir müssen jedoch darauf hinweisen, dass die besten LLMs bereits erhebliche Verbesserungen erzielt haben und solche Fehler nicht häufig auftreten - zumindest nicht so häufig wie bei Mistral.

Abgesehen davon ist der Plan von Le Money nicht sehr detailliert, aber er ist der einzige Agent, der Folgefragen bietet, die die Interaktion reibungsloser gestalten können und ihm helfen, die Bedürfnisse des Benutzers besser zu verstehen.

Den vollständigen Plan von LeMoney können Sie hier einsehen, den Agenten können Sie hier testen.

Anthropic

Das Projekt von Claude fühlt sich weniger wie eine Plattform zur Erstellung von Agenten an, sondern mehr wie ein komplexes Aufgabenverwaltungssystem. Die Benutzeroberfläche ist minimalistisch, fast zu minimalistisch und wenig intuitiv.

Diese minimalistischen Oberfläche könnte einige Benutzer verwirren. Die Plattform bietet eine grundlegende Einrichtung und hat ein „optional“ Anweisungsfeld, das sowohl unwichtig als auch entscheidend erscheint: Wenn die Anweisung als optional gekennzeichnet ist, wie weiß der KI-Agent dann, was er tun soll?

Seine minimalistischen Oberfläche fühlt sich etwas seltsam an, aber Anthropic ist nicht für sein UI-Design bekannt. Das gleiche Fenster zur Konfiguration des Modells wird auch verwendet, um ihm Eingabeaufforderungen zu geben. Seine Funktionen konzentrieren sich hauptsächlich auf die Text- und Code-Interpretation, abgesehen davon gibt es keine weiteren Funktionen. Websuche, Bildverarbeitung und -generierung sind fortgeschrittene Funktionen, die Anthropic seinen Mitbewerbern überlässt.

Unser Agent, genannt MoneyClaude, kann nicht öffentlich getestet werden, da Anthropic das nicht erlaubt. Er hat eine sehr konservative Haltung bei der Bereitstellung finanzieller Ratschläge eingenommen, obwohl die Antworten technisch korrekt sind, sind sie sehr vage - zum Beispiel: „Das Gleichgewicht zwischen Schuldenabbau und notwendigem Sparen halten“ usw.

Er hat um mehr Informationen gebeten, aber zumindest hat er ohne diese Informationen eine sehr allgemeine Strategie angeboten, ohne weitere Interaktion, was anscheinend idealer ist als Googles Ansatz.

Hugging Face

Diese Open-Source-Plattform ist einzigartig und ein Paradies für fortgeschrittene Benutzer - und ein potenzieller Albtraum für Anfänger. Sie ist die einzige Plattform, die es Benutzern ermöglicht, ihr bevorzugtes Sprachmodell auszuwählen und bietet beispiellose Kontrolle über die Grundlagen des Agenten.

Darüber hinaus können Benutzer Dutzende von verschiedenen Tools in ihre Agenten integrieren, aber jeweils nur drei gleichzeitig aktivieren. Diese Einschränkung zwingt die Benutzer dazu, sorgfältig über die wichtigsten Funktionen für jeden spezifischen Anwendungsfall nachzudenken, was kein anderes Modell bieten kann.

Es ist die anpassbarste Erfahrung aller Schnittstellen, mit vielen einstellbaren Optionen. Das Ergebnis ist, dass diese Plattform stärkere, professionellere Agenten erstellen kann als ihre Konkurrenten, aber nur in den Händen von jemandem, der die Funktionsweise vollständig versteht.

Benutzer können ihre Agenten auf HuggingChat ausprobieren - zweifellos ein Traum für fortgeschrittene Benutzer. Sobald ein Agent erstellt ist, ist die Nutzung sehr einfach. Die Oberfläche zeigt eine große Karte mit dem Agentennamen, einer Beschreibung und einem Foto an. Sie ermöglicht es den Benutzern auch, den Link des Agenten zu teilen und seine Einstellungen anzupassen, all dies kann direkt auf der Karte erfolgen.

Nachdem wir unseren HuggingMoney-Agenten getestet haben, stellten wir fest, dass er die Zeitrahmen auf eine Weise behandelt, die ein tieferes Verständnis der Psychologie der Finanzplanung zeigt. Er unterteilt die Planung in „kurzfristig (0-24 Monate), mittelfristig (24-60 Monate) und langfristig (über 60 Monate)“, was mit professionellen Finanzplanungspraktiken übereinstimmt.

Der Agent schlägt vor, „0-$5.000 in liquide, risikoarme Instrumente zu investieren“, während er gleichzeitig „$1.000-$1.500“ pro Monat aktiv Schulden zurückzahlt. Dieser Vorschlag zeigt auf den ersten Blick ein detailliertes Verständnis für das Cashflow-Management.

Ein weiteres interessantes Merkmal ist, dass es Tools mit theoretischen Empfehlungen kombiniert. Neben der Vorschlag des 50/30/20-Prinzips empfiehlt es spezifische Budgetanwendungen und hebt die Steueroptimierung hervor - es schlägt eine Brücke zwischen strategischer Planung und alltäglicher Ausführung. Der Hauptnachteil? Es hat Annahmen zu den Schuldenzinssätzen gemacht, ohne nach Bestätigung zu fragen.

Um nützliche Ratschläge zu geben, hat es zu leichtfertig viele Annahmen getroffen. Dieses Problem, die Impuls zu haben, auf jeden Fall eine Antwort zu geben, könnte mit präziseren Eingaben gelöst werden, aber das ist eine Sache, auf die man achten sollte.