Titre original : Quelle plateforme construit les meilleurs agents AI ? Nous testons ChatGPT, Claude, Gemini et plus.
Auteur original : Jose Antonio Lanz
Source originale : https://decrypt.co/
Compilation : Daisy, Mars Finance
Quelle plateforme peut créer le meilleur agent AI ? Nous avons testé ChatGPT, Claude, Gemini et d'autres plateformes.
Comparez les cinq principales plateformes et découvrez laquelle est la mieux adaptée à l'hébergement de votre futur agent AI dans un contexte quotidien.
Les agents AI peuvent accomplir beaucoup de choses : rechercher des informations dans votre bibliothèque de documents, écrire du code, extraire des données web, analyser des données complexes et bien plus encore. Vous pouvez également créer un bureau virtuel composé d'une équipe d'agents AI se concentrant sur différentes tâches, travaillant ensemble comme une équipe d'employés numériques professionnels.
Mais à quel point cela est-il difficile ? Si une personne ordinaire souhaite créer son propre conseiller financier AI, par exemple, sans dépendre d'une API, sans avoir besoin de codage étrange, sans utiliser Github, quelle plateforme peut offrir le meilleur soutien à l'utilisateur ? Nous voulons simplement voir comment ces grandes entreprises AI se comportent pour aider les utilisateurs ordinaires à créer des agents AI sans que ceux-ci aient besoin de compétences techniques avancées.
Bien sûr, vous obtenez ce que vous payez. Dans ce cas, nous avons également voulu voir s'il existe un lien entre la facilité avec laquelle une personne ordinaire peut configurer un agent et la qualité des résultats fournis par chaque plateforme.
Notre expérience a comparé cinq grandes plateformes : ChatGPT, Claude, Huggingface, Mistral AI et Gemini. Chaque plateforme a reçu les mêmes instructions de base, lui demandant de créer un conseiller financier.
Les tests se concentrent sur la capacité de la plateforme à fonctionner dès le départ. L'accent est mis sur la capacité de l'agent à gérer un scénario courant - dans ce cas, aider quelqu'un à équilibrer un investissement de 25 000 $ avec une dette de 30 000 $. Nous voulions également voir leur capacité à analyser des graphiques de transactions. Nous avons évité d'utiliser des outils supplémentaires pour améliorer la productivité des agents, mais avons plutôt essayé de prendre la voie la plus simple.
En résumé, voici nos découvertes et le classement des modèles :
Classement des plateformes
1) GPT d'OpenAI (8.5/10)
Facilité de configuration : 4/5
Qualité des résultats : 4.5/5
ChatGPT est la plateforme la plus équilibrée, offrant des options de création d'agents complexes tout en ayant des options guidées et manuelles, capables de répondre aux besoins des utilisateurs totalement novices et de ceux ayant une certaine expérience.
Bien que les mises à jour récentes de l'interface aient caché certaines fonctionnalités dans les menus, cette plateforme excelle à transformer des besoins utilisateurs complexes en agents fonctionnels. Nous avons testé le modèle en construisant un conseiller financier, et les résultats ont montré que cet agent avait une excellente conscience contextuelle et une capacité de résolution de problèmes structurée, fournissant des stratégies détaillées et cohérentes pour la gestion des dettes et la répartition des investissements.
2) Google Gemini (7/10)
Facilité de configuration : 4/5
Qualité des résultats : 3/5
Gemini se distingue par son interface raffinée et intuitive ainsi que par son excellent traitement des erreurs. Bien qu'il nécessite des prompts plus détaillés pour obtenir les meilleurs résultats, son interprétation littérale des instructions génère des résultats cohérents et prévisibles.
Cet agent met en avant une approche consultative lors de la fourniture de conseils financiers, soulignant l'importance de collecter le contexte avant de faire des recommandations, similaire à la pratique professionnelle. Cependant, il peut être trop conservateur dans ses réponses zéro échantillon.
3) HuggingChat (6.5/10)
Facilité de configuration : 2/5
Qualité des résultats : 4.5/5
Cette plateforme open source offre une personnalisation et des options de sélection de modèle sans précédent. Pour ceux qui recherchent un contrôle granulaire sur chaque détail, c'est un excellent choix, mais cela peut ne pas convenir à ceux qui cherchent la simplicité. (Cela peut être comparé à la comparaison entre le système Linux et le système macOS). Ses cadres temporels complexes et l'intégration d'outils démontrent ses capacités avancées.
Nous avons construit un agent pur, sans fonctionnalités supplémentaires. Nous avons utilisé le Nemomotron de Nvidia comme modèle de langage de base, dont la qualité de sortie est suffisante pour rivaliser avec ChatGPT. Pas mal pour le camp open source.
4) Claude (5.5/10)
Facilité de configuration : 2.5/5
Qualité des résultats : 3/5
La plateforme d'Anthropic excelle dans des domaines spécifiques, notamment dans les tâches nécessitant une gestion contextuelle importante et l'analyse de code. Son interface minimaliste masque ses capacités complexes, mais le champ d'instructions « optionnel » peut prêter à confusion pour les utilisateurs.
Notre agent est très conservateur et vague dans ses recommandations, mais montre une bonne conscience des risques et une pensée stratégique. Il nécessite des prompts plus prudents pour vraiment réaliser son potentiel, mais si le test avait utilisé des prompts adaptatifs, cela aurait contredit l'hypothèse de conditions similaires, donc ce n'est pas juste.
5) Mistral AI (5/10)
Facilité de configuration : 2.5/5
Qualité des résultats : 2.5/5
Cette plateforme française offre des options d'apprentissage basées sur des exemples et de personnalisation approfondie. Cependant, son interface axée sur les développeurs et ses problèmes occasionnels de changement de langue créent des obstacles pour les utilisateurs non techniques. Elle nécessite également de modifier la configuration de l'agent pour s'adapter à différents modèles exécutant différentes tâches comme l'analyse d'images ou le traitement de code. Ce n'est pas idéal.
Le conseiller financier montre un potentiel dans la conception interactive, mais a des difficultés avec la validation mathématique de base, produisant les pires résultats. Ce n'est pas que les résultats soient mauvais, mais dans les tests zéro échantillon, c'est le moins satisfaisant.
Analyse approfondie
Compte tenu des classements précédents, il n'existe pas de solution unique, chaque plateforme ayant ses propres avantages et inconvénients. Avec quelques personnalisations attentives des prompts, les résultats d'une plateforme peuvent différer et même surpasser d'autres plateformes. En fin de compte, tous les modèles de langage (LLM) ont des styles de prompt différents.
Si vous souhaitez en savoir plus sur les raisons derrière notre classement, voici une analyse plus approfondie de nos expériences et des résultats des agents. Nous avons configuré tous les agents avec le même prompt système, sans paramètres et fonctionnalités supplémentaires, et leur avons posé les mêmes questions de base : « J'ai 25K dollars à investir et 30K dollars de dettes. Élaborez un plan financier pour moi. »
OpenAI

L'interface de ChatGPT a récemment été mise à jour, rendant les opérations en fait plus compliquées. Les options de création GPT sont désormais cachées dans le menu, mais une fois trouvées, elles offrent deux voies : une configuration conversationnelle où l'AI aide à construire votre agent ; l'autre est une configuration manuelle, adaptée à ceux qui savent exactement ce qu'ils veulent.
La plateforme GPT d'OpenAI est un « couteau suisse » complet - elle peut lire du code, rechercher sur le web, traiter des images et analyser. Le processus de configuration guidée par AI la rend particulièrement adaptée aux débutants, bien que pour les utilisateurs avancés nécessitant un contrôle précis, cela puisse sembler un peu restrictif. (Par exemple, si vous demandez au modèle d'être plus spécifique ou détaillé, il peut modifier l'ensemble du prompt système, entraînant une dégradation des résultats.)
Lors de l'utilisation de l'agent, ChatGPT est très direct, avec une interface claire et facile à comprendre.

Ces agents peuvent lire nativement des documents et comprendre des images, ce qui leur confère un certain avantage sur d'autres plateformes.
Maintenant, parlons de la qualité des agents que vous pouvez créer avec des prompts de base. Notre conseiller financier MoneyGPT nous a montré un cours de maîtrise en résolution de problèmes structurés, assez impressionnant.
En plus de sa répartition précise des fonds - « 20 000 $ pour la dette à intérêt élevé » et une répartition détaillée du portefeuille - cet agent montre un raisonnement financier complexe. Il fournit une feuille de route en cinq étapes, non seulement une liste, mais une stratégie cohérente qui prend en compte les besoins à court terme et la planification à long terme.

L'avantage de cet agent réside dans sa capacité à équilibrer les détails et le contexte. Bien qu'il ait recommandé un portefeuille concret (40 % investi dans le S&P 500, 30 % investi dans des obligations), il a également expliqué les raisons derrière ses recommandations : « Rembourser des dettes à intérêt élevé est comme obtenir un retour sur investissement garanti. » Cette conscience contextuelle s'étend à la planification à long terme, suggérant des cycles de révision réguliers et l'ajustement des stratégies en fonction des circonstances changeantes.
Cependant, cette richesse d'information révèle également une faiblesse potentielle : il peut submerger les utilisateurs en fournissant trop de détails d'un coup. Bien qu'il soit techniquement très complet, la transmission rapide d'attributions spécifiques, de stratégies d'investissement et de plans de suivi peut sembler intimidante pour les novices en finance.
Dans l'ensemble, la plateforme de création d'agents Gemini de Google se démarque esthétiquement, avec une interface raffinée et intuitive qui rend le processus de création d'agents presque trop simple. L'interprétation littérale des instructions par le système aide à éviter la confusion, et son interface utilisateur épurée élimine également le sentiment d'oppression dans le développement AI.
Cependant, pour obtenir des résultats de qualité, il nécessite des prompts plus détaillés. Il ne prend pas les choses pour acquises : des prompts courts produiront des réponses de faible qualité.

En arrière-plan, il possède de puissantes fonctionnalités - intégration de recherche web soutenue par Google, analyse de code et capacités de traitement d'images, équivalentes à celles de ChatGPT, mais la plupart dépendent de la technologie de Microsoft.
L'interface utilisateur de Gemini semble avoir été conçue par des personnes qui comprennent vraiment l'expérience utilisateur. L'interface guide les utilisateurs avec des étiquettes claires, toutes les informations étant affichées sur un seul écran.

Cette approche raffinée la rend particulièrement attrayante pour les utilisateurs débutants, bien que les utilisateurs expérimentés puissent la trouver dépourvue d'un contrôle plus détaillé.
Nous avons nommé notre agent MoneyGem et lui avons demandé de fournir un plan financier. Son approche consultative a démontré la méthode de résolution de problèmes unique de Google. Il n'a pas donné de réponse directe, mais a d'abord posé des questions telles que « Quel type de dette est-ce ? » et « Quel est votre taux d'intérêt ? » - montrant qu'il comprend que les conseils financiers ne sont pas universels.
Il souligne la collecte d'informations contextuelles avant de fournir des recommandations, ce qui est cohérent avec les pratiques de planification financière professionnelles, bien que cela puisse frustrer les utilisateurs à la recherche de réponses rapides.

Une réponse zéro-shot n'est pas utile. L'agent indique essentiellement qu'il ne comprend pas l'utilisateur et ne peut pas fournir de bons conseils financiers. Après avoir été invité à faire des hypothèses et à être contraint de fournir un plan adapté à la plupart des scénarios, l'agent a généré un projet de plan très conservateur, mais sans fournir de recommandations d'investissement spécifiques.
Cependant, MoneyGem a finalement donné un conseil de maximiser les comptes d'avantages fiscaux, comme le 401(k) ou le Roth IRA, pour réduire la charge fiscale. Pas mal.
Vous pouvez cliquer ici pour voir notre interaction avec MoneyGem et essayer le modèle vous-même en cliquant sur ce lien.
Mistral AI
Le processus de configuration de l'agent Mistral est un peu complexe, s'éloignant de la simplicité. L'outil de création d'agents est caché dans son tableau de bord développeur, avec des options de personnalisation approfondies qui peuvent être déroutantes pour les débutants, mais raviront les utilisateurs qui aiment expérimenter.
L'interface de construction de l'agent n'est pas une partie de LeChat (interface de chat), mais une fois l'agent créé, il apparaîtra là.

Une chose que nous avons beaucoup aimée est la possibilité de façonner le comportement et le style de réponse de l'agent par des entrées d'exemple, ce qui est une fonctionnalité que d'autres plateformes ne proposent pas actuellement. Cependant, il y a un bug étrange : lors de la création de l'agent, l'UI a soudainement basculé en français, probablement parce que l'entreprise est française. Quoi qu'il en soit, nous n'avons pas pu revenir à l'anglais ou à l'espagnol.
Une fois l'agent créé, l'utilisateur doit l'appeler dans l'interface de chat normale pour l'utiliser. L'utilisateur doit quitter Le Plateforme et entrer dans Le Chat, ce qui n'est pas l'opération la plus intuitive. Cependant, l'UI de l'agent est assez directe, se sentant comme d'autres chatbots AI.

Nous avons créé notre agent et l'avons nommé Le Money en hommage aux racines françaises de Mistral. Ses performances montrent clairement l'approche universelle de Mistral en matière de résolution de problèmes. Il a suggéré de « garder 10 000 $ comme fonds d'urgence, 15 000 $ pour rembourser des dettes et 10 000 $ pour investir », ce qui peut sembler simple, mais indique également que cet agent manque de certaines vérifications mathématiques de base.
Le montant total de 35 000 $ dépasse de 10 000 $ les fonds disponibles, ce qui est une erreur fondamentale que certains modèles de langage peuvent faire lorsqu'ils priorisent la précision conceptuelle plutôt que la précision numérique.
Cependant, nous devons noter que les LLM les plus performants ont déjà connu de grandes améliorations et ne présentent pas fréquemment ce genre d'erreurs - du moins pas aussi souvent que Mistral.

À part cela, le plan de Le Money n'est pas très détaillé, mais c'est le seul agent qui propose des questions de suivi, ce qui peut rendre l'interaction plus fluide et l'aider à mieux comprendre les besoins de l'utilisateur.
Le plan complet de LeMoney peut être consulté ici, et l'agent peut être testé ici.
Anthropic

Le projet de Claude ne ressemble pas à une plateforme de création d'agents, mais plutôt à un système d'exécution de tâches complexe. L'interface est minimaliste, presque trop, et pas très intuitive.
Cette interface minimaliste peut déranger certains utilisateurs. La plateforme propose un paramétrage de base et a un champ d'instruction « optionnel » qui semble à la fois peu important et essentiel : si l'instruction est marquée comme optionnelle, comment l'agent AI sait-il ce qu'il doit faire ?
Son interface minimaliste peut sembler étrange, mais Anthropic n'est pas connu pour son design UI. La même fenêtre utilisée pour configurer le modèle est également utilisée pour lui donner des instructions. Ses fonctionnalités se concentrent principalement sur l'interprétation du code texte, sans autres fonctionnalités. La recherche sur le web, le traitement et la génération d'images sont des fonctionnalités avancées laissées aux concurrents par Anthropic.
Notre agent, nommé MoneyClaude, ne peut pas être testé publiquement car Anthropic ne le permet pas. Il adopte une approche très conservatrice lors de la fourniture de conseils financiers, bien que les réponses soient techniquement précises, le contenu est très vague - par exemple, « Équilibrer la réduction de la dette et les économies nécessaires », etc.

Il a demandé plus d'informations, mais au moins sans ces informations, il a fourni une stratégie très générale, sans nécessiter d'interaction supplémentaire, ce qui semble plus idéal que l'approche de Google.
Hugging Face

Cette plateforme open source est unique, étant un paradis pour les utilisateurs avancés - mais un potentiel cauchemar pour les débutants. C'est la seule qui permet aux utilisateurs de choisir leur modèle de langage préféré, offrant un contrôle sans précédent pour définir les bases de l'agent.
De plus, les utilisateurs peuvent intégrer des dizaines d'outils différents dans leurs agents, mais seulement trois peuvent être activés simultanément. Cette limite oblige les utilisateurs à réfléchir attentivement aux fonctionnalités les plus importantes pour chaque cas d'utilisation spécifique, mais c'est quelque chose que nul autre modèle ne peut offrir.
C'est l'expérience la plus personnalisable de toutes les interfaces, avec de nombreux paramètres ajustables. Le résultat est que cette plateforme peut créer des agents plus puissants et professionnels que ses concurrents, mais cela ne sera réussi que dans les mains de personnes qui comprennent parfaitement son fonctionnement.
Les utilisateurs peuvent essayer leurs agents sur HuggingChat - sans aucun doute le rêve des utilisateurs avancés. Une fois l'agent créé, il est très simple à utiliser. L'interface présente une grande carte contenant le nom de l'agent, sa description et sa photo. Elle permet également aux utilisateurs de partager le lien de l'agent et d'ajuster ses paramètres, le tout pouvant être effectué directement sur la carte.

Après avoir testé notre agent HuggingMoney, nous avons découvert que sa manière de traiter les cadres temporels montre une compréhension plus profonde de la psychologie de la planification financière. Il a divisé la planification en « court terme (0-24 mois), moyen terme (24-60 mois) et long terme (plus de 60 mois) », ce qui est cohérent avec les pratiques de planification financière professionnelles.
L'agent recommande d'« investir de 0 à 5 000 $ dans des outils liquides et à faible risque », tout en maintenant des paiements de dettes actifs de « 1 000 $ à 1 500 $ » par mois. Cette recommandation révèle, à première vue, une compréhension détaillée de la gestion des flux de trésorerie.

Une autre caractéristique intéressante est qu'elle combine des outils avec des conseils théoriques. En plus de recommander la règle 50/30/20, elle suggère des applications budgétaires spécifiques et met l'accent sur l'optimisation fiscale - créant un pont entre la stratégie de haut niveau et l'exécution quotidienne. Le principal inconvénient ? Elle a fait des hypothèses sur les taux d'intérêt des dettes sans demander de confirmation.
Pour fournir des conseils utiles, il a fait trop d'hypothèses. Ce problème, l'impulsion de vouloir répondre quoi qu'il arrive, peut être résolu par des prompts plus précis, mais c'est un point à surveiller.
