原文タイトル:どのプラットフォームが最高のAIエージェントを構築するのか?ChatGPT、Claude、Geminiなどをテストしました
原文著者:Jose Antonio Lanz
原文出典:https://decrypt.co/
編纂:Daisy、火星财经
どのプラットフォームが最高のAIエージェントを構築できるか?私たちはChatGPT、Claude、Gemini、および他のプラットフォームをテストしました
五大主要プラットフォームを比較して、どれが日常シナリオであなたの未来のAIエージェントをホストするのに最適かを明らかにします。
AIエージェントは多くのことを実現できます:あなたの文書ライブラリから情報を検索したり、コードを作成したり、ウェブデータを取得したり、複雑なデータを洞察し、深く分析したり、さらにはそれ以上のこともできます。異なるタスクに集中したAIエージェントのグループで構成された仮想オフィスを構築し、プロフェッショナルなデジタル従業員チームのように協力して作業できます。
しかし、これがどれほど難しいのでしょうか?普通の人が自分のAI金融顧問を作りたいと考えた場合、APIに依存せず、奇妙なコーディングも不要で、Githubも使わずに、どのプラットフォームがユーザーに最高のサポートを提供できるでしょうか?私たちは、これらのトップAI企業が普通のユーザーにAIエージェントを作成する手助けをする際のパフォーマンスを見たいだけです。
もちろん、払った分だけ得られます。この場合、私たちは普通の人がエージェントを設定する難しさと各プラットフォームが提供する結果の質との関連性を見たいと思っています。
私たちの実験では、五大プラットフォームを比較しました:ChatGPT、Claude、Huggingface、Mistral AI、Gemini。それぞれのプラットフォームは同じ基本指示を受け、財務顧問を作成するよう求められました。
テストはプラットフォームの開箱即用能力に焦点を当てました。エージェントが一般的なシナリオ——この場合、誰かが25,000ドルの投資と30,000ドルの借金をバランスさせるのを助けること——を処理できるかどうかを重視しました。また、取引チャートを分析する能力も見たいと思いました。エージェントの生産性を向上させるために追加のツールを使用することは避け、最もシンプルな方法を取ることにしました。
要するに、以下は私たちの発見とモデルのランキングです:
プラットフォームのランキング
1) OpenAIのGPT(8.5/10)
設定の難易度:4/5
結果の質:4.5/5
ChatGPTは最もバランスの取れたプラットフォームで、複雑なエージェント作成オプションを提供し、ガイド式と手動のオプションを持ち、完全な新米とある程度の経験のあるユーザーの両方のニーズに応えます。
最近のインターフェースの更新で、一部の機能がメニューに埋もれてしまったにもかかわらず、このプラットフォームは複雑なユーザーのニーズを機能的なエージェントに変換するのに優れたパフォーマンスを示しています。私たちは財務顧問を構築してこのモデルをテストし、その結果、エージェントは優れたコンテキスト意識と構造的問題解決能力を持っており、負債管理と投資配分に対して詳細かつ一貫した戦略を提供しました。
2) Google Gemini(7/10)
設定の難易度:4/5
結果の質:3/5
Geminiはその洗練された直感的なインターフェースと優れたエラーハンドリングで際立っています。最良の結果を得るためにはより詳細なプロンプトが必要ですが、指示の文字通りの解釈は一貫して予測可能な結果を生み出します。
このエージェントは財務アドバイスを提供する際のコンサルティングアプローチが、推奨の前にコンテキストを収集することを強調し、専門的な実践に類似しています。しかし、ゼロサンプル応答では過度に保守的かもしれません。
3) HuggingChat(6.5/10)
設定の難易度:2/5
結果の質:4.5/5
このオープンプラットフォームは比類のないカスタマイズとモデル選択オプションを提供します。すべての詳細に粒度の制御を求める人には素晴らしい選択肢ですが、簡便さを求めるユーザーには適さないかもしれません。(LinuxシステムとmacOSシステムの比較に例えることができます)。その複雑な時間枠と実用的なツール統合は、先進的な能力を示しています。
私たちは、追加機能なしで純粋なエージェントを構築しました。NvidiaのNemomotronを基盤とする大規模言語モデルを使用し、その出力品質はChatGPTに匹敵します。オープンソース陣営にとっては、良い選択です。
4) Claude(5.5/10)
設定の難易度:2.5/5
結果の質:3/5
Anthropicのプラットフォームは特定の分野で優れたパフォーマンスを示しており、特に大量のコンテキスト処理やコード解析が必要なタスクにおいて際立っています。シンプルなインターフェースはその複雑な能力を隠していますが、「オプション」指示フィールドはユーザーを混乱させるかもしれません。
私たちのエージェントは財務アドバイスを提供する際に非常に保守的かつ曖昧でしたが、良好なリスク意識と戦略的思考を示しました。真の潜在能力を発揮するには、より慎重なプロンプトが必要ですが、テストが適応的なプロンプトを使用する場合、類似の条件を仮定する前提に反するため、公平ではありません。
5) Mistral AI(5/10)
設定の難易度:2.5/5
結果の質:2.5/5
このフランスのプラットフォームは、独特な例に基づく学習と深いカスタマイズオプションを提供しています。しかし、その開発者向けインターフェースと時折の言語切り替えの問題は、非技術的なユーザーに障害をもたらします。また、異なるモデルが画像分析やコード処理などの異なるタスクを実行できるように、エージェントの構成を変更する必要があります。これは理想的ではありません。
財務アドバイザーはインタラクションデザインで潜在能力を示しましたが、基本的な数学的検証で課題に直面し、出力結果は最も悪かったです。出力が悪いわけではありませんが、ゼロサンプルテストでは最も不満足なものでした。
詳細分析
以前のランキングを考慮すると、汎用的な解決策は存在せず、すべてのプラットフォームにはそれぞれの利点と欠点があります。いくつかの焦点を当てた注意深いプロンプトカスタマイズによって、あるプラットフォームの結果は異なる場合があり、他のプラットフォームを超えることさえあります。最終的に、すべての言語モデル(LLM)はそれぞれ異なるプロンプトスタイルを持っています。
私たちのランキングの背後にある理由をもっと知りたい場合、以下は経験とエージェントの結果に関するより深い分析です。すべてのエージェントを同じシステムプロンプトに設定し、追加のパラメータや機能なしで、同じ基本的な質問をしました:「私は25,000ドルを投資しており、30,000ドルの借金があります。私のために財務計画を立ててください。」
OpenAI

ChatGPTのインターフェースは最近更新され、実際に操作をより複雑にしています。GPT作成オプションは現在メニューに隠れていますが、一度見つければ、対話式設定とAIがエージェントを構築するのを助けるルートと、何を求めているのかを正確に知っている人向けの手動構成の2つのパスが提供されます。
OpenAIのGPTプラットフォームは、コードを読み込み、ウェブを検索し、画像生成や分析を処理できる完全装備の「スイスアーミーナイフ」です。AI主導の設定プロセスは特に新米ユーザーに適しており、ただし、精密な制御が必要な上級ユーザーには制約を感じさせるかもしれません。(たとえば、モデルにさらに具体的または詳細を求めると、全体のシステムプロンプトが変更され、結果が悪化する可能性があります。)
エージェントを実際に使用する際、ChatGPTは非常に直接的で、インターフェースは明確で理解しやすいです。

これらのエージェントはネイティブに文書を読み取り、画像を理解することができ、他のプラットフォームに対して一定の優位性を持っています。
さて、基本的なプロンプトを用いて作成できるエージェントの質について話しましょう。私たちが作成した金融顧問MoneyGPTは、構造化問題解決の修士課程を私たちに示し、非常に印象的なパフォーマンスを発揮しました。
その正確な資金配分——「$20,000を高利借金に」、および詳細なポートフォリオ分割に加え、エージェントは複雑な財務推論を示しました。短期のニーズと長期の計画を考慮した一貫した戦略として、単なるチェックリスト以上の五段階のロードマップを提供しました。

このエージェントの利点は、詳細とコンテキストのバランスを取れることです。具体的なポートフォリオ(S&P 500に40%、債券に30%投資)を推奨しましたが、その背後にある理由も説明しました:「高利の借金を返済することは、保証された投資リターンを得ることに似ています。」このコンテキスト意識は長期計画にまで及び、定期的なレビューサイクルを提案し、状況の変化に応じて戦略を調整するよう勧めます。
しかし、この情報の豊富さは潜在的な弱点も露呈します:ユーザーが圧倒されるかもしれない詳細を一度に提供しすぎる可能性があります。技術的には非常に包括的ですが、迅速に伝えられる具体的な配分、投資戦略、モニタリング計画は、金融初心者には少し恐ろしいかもしれません。
全体的に、GoogleのGeminiエージェント作成プラットフォームは美学的に際立っており、洗練された直感的なインターフェースを持ち、エージェント作成プロセスをほぼ過度に簡単にしています。システムの指示の文字通りの解釈は混乱を避けるのに役立ち、そのシンプルなユーザーインターフェースはAI開発における圧迫感を取り除きます。
しかし、良質な結果を得るためには、より詳細なプロンプトが必要です。エージェントは物事を当然のように扱うことはありません:短いプロンプトは低品質の応答をもたらします。

バックエンドでは強力な機能を備えています——Googleがサポートするウェブ検索統合、コード解析、画像処理能力は、ChatGPTの機能に匹敵しますが、大部分はMicrosoftの技術に依存しています。
Geminiのユーザーインターフェースは、実際にユーザー体験を理解している人によってデザインされたように感じます。インターフェースは明確なラベルでユーザーを導き、すべての情報を1つの画面に表示します。

この洗練されたアプローチは、新米ユーザーに特に魅力的ですが、経験豊富なユーザーにはより詳細なコントロールが欠けていると感じられるかもしれません。
私たちはエージェントにMoneyGemという名前を付け、それに財務計画を提供するよう求めました。相談形式のアプローチはGoogleの独特な問題解決方法を示しました。直接答えを出すのではなく、「これはどのタイプの負債ですか?」や「あなたの利率は何ですか?」といった質問を最初に行い——財務アドバイスが一律でないことを示しました。
提案を行う前に背景情報を収集することを強調しており、これは専門的な財務計画の実践と一致していますが、迅速な回答を求めているユーザーには苛立たしいかもしれません。

ゼロショットの回答は役に立ちません。エージェントは基本的にユーザーを理解しておらず、良い財務アドバイスを提供できないと示しています。仮定を立てるよう求め、それに合った計画を提供するように強制したところ、エージェントは非常に保守的な計画草案を生成しましたが、具体的な投資提案は提供しませんでした。
しかし、MoneyGemは最終的に、税金負担を減らすために401(k)やRoth IRAなどの税収優遇口座を最大化するという提案をしました。素晴らしい。
ここをクリックして、私たちのMoneyGemとのインタラクションを確認し、このリンクをクリックしてそのモデルを直接試してみてください。
Mistral AI
Mistralのエージェント設定プロセスは少し複雑で、簡易性から離れています。エージェント作成ツールはその開発者コンソールに隠れており、深いカスタマイズオプションがあり、新米には混乱を招くかもしれませんが、いじるのが好きなユーザーには喜ばれます。
そのエージェント構築インターフェースはLeChat(チャットインターフェース)の一部ではありませんが、エージェントが作成されるとそこに表示されます。

私たちが非常に気に入った点は、例入力を通じてエージェントの行動や応答スタイルを形成できることです。これは現時点で他のプラットフォームにはない機能です。ただし、ここに奇妙なバグがあります:エージェントを作成する際、UIが突然フランス語に切り替わり、会社がフランスにあるためかもしれません。いずれにせよ、私たちは英語やスペイン語に戻すことができませんでした。
エージェントが作成された後、ユーザーは通常のチャットインターフェース内でそれを呼び出して使用する必要があります。ユーザーはLe Plateformeを退出し、Le Chatに入る必要があり、これは最も直感的な操作ではありません。ただし、エージェントのUIは非常に直接的で、他のAIチャットボットと同じように感じられます。

私たちはエージェントを作成し、Mistralのフランスのルーツを称えてLe Moneyと名付けました。そのパフォーマンスは、Mistralの問題解決に関する一般的なアプローチを明確に示しています。「10,000ドルを緊急資金として残し、15,000ドルを負債返済に、10,000ドルを投資に使う」と提案しており、一見シンプルですが、エージェントが基本的な数学的検証を欠いていることを示しています。
35,000ドルの合計が利用可能な資金の10,000ドルを超えており、基本的なエラーであり、特定の言語モデルが数値の正確性よりも概念の正しさを優先する際にこのようなエラーが発生する可能性があります。
しかし、最も優れたLLMは大きな改善を遂げており、このようなエラーは頻繁には発生しません——少なくともMistralほどは頻繁ではありません。

それ以外では、Le Moneyの計画は非常に詳細ではありませんが、ユーザーのニーズをよりよく理解するために、インタラクションをスムーズにするフォローアップの質問を提供する唯一のエージェントです。
LeMoneyの完全な計画はここで確認でき、エージェントはここでテストできます。
Anthropic

Claudeのプロジェクトはエージェント作成プラットフォームというよりも、複雑なタスク実行システムのように感じます。インターフェースはミニマルで、ほとんど過度にシンプルで、直感的ではありません。
このミニマリストなインターフェースは一部のユーザーには混乱を招く可能性があります。プラットフォームは基本的な設定を提供し、「オプション」の指示フィールドがあり、重要であるかのように感じますが、実際には重要ではありません:指示がオプションとされた場合、AIエージェントは何をすべきかどうやって知るのでしょうか?
そのミニマリストなインターフェースは少し奇妙に感じますが、AnthropicはそのUIデザインで知られているわけではありません。同じウィンドウでモデルを構成することも、プロンプトを出すために使用されます。その機能は主にテキストコードの解釈に集中しており、それ以外の機能はありません。ウェブ検索、画像処理、生成はAnthropicが競合他社に残した高級機能です。
私たちのエージェント、MoneyClaudeは公開テストを受けることができませんでした。Anthropicが許可しなかったからです。財務アドバイスを提供する際には非常に保守的な立場を取っており、応答は技術的には正確ですが、内容は非常に曖昧です——例えば、「借金を減らし、必要な貯蓄のバランスを保つ」など。

追加の情報を要求しましたが、少なくともそれらの情報なしでも、さらなるインタラクションなしに非常に一般的な戦略を提供しました。これはGoogleのアプローチよりも理想的に見えます。
Hugging Face

このオープンプラットフォームはユニークで、上級ユーザーの天国でもあり、初心者にとっては潜在的な悪夢です。ユーザーが好きな言語モデルを選択できる唯一のプラットフォームであり、エージェントの基礎を定義するための前例のない制御権を提供します。
さらに、ユーザーはエージェントに数十種類の異なるツールを統合できますが、毎回同時に3つしかアクティブにできません。この制限は、ユーザーに特定のユースケースにおいて最も重要な機能を慎重に考慮させますが、他のどのモデルも提供できないものです。
すべてのインターフェースの中で最もカスタマイズ可能な体験を提供し、多くの調整可能な設定を持っています。その結果、このプラットフォームは競合他社よりも強力でプロフェッショナルなエージェントを作成できますが、操作を完全に理解している人の手にかかる場合に限ります。
ユーザーはHuggingChat上で彼らのエージェントを試すことができます——間違いなく上級ユーザーの夢です。エージェントが作成されると、使用は非常に簡単です。インターフェースはエージェント名、説明、写真を含む大きなカードを表示します。また、ユーザーはエージェントのリンクを共有し、その設定を調整することができ、すべてをカード上で直接行えます。

私たちのHuggingMoneyエージェントをテストした結果、時間枠の取り扱いが財務計画心理学に対するより深い理解を示していることが分かりました。計画を「短期(0-24か月)、中期(24-60か月)、長期(60か月を超える)」に分けており、これは専門的な財務計画の実践と一致しています。
エージェントは「$0-$5,000を流動性が高く、リスクの低いツールに投資する」ことを提案し、同時に毎月「$1,000-$1,500」の積極的な負債支払いを維持します。この提案は一見、現金流の管理に対する詳細な理解を示しています。

もう一つの興味深い特徴は、実用的なツールを理論的な提案と組み合わせていることです。50/30/20ルールを提案するだけでなく、具体的な予算アプリも推奨し、税金最適化を強調して——高レベルの戦略と日常の実行の間に橋を架けています。主な欠点?確認を求めずに借金利率の仮定を立てました。
有用なアドバイスを提供するために、あまりにも多くのことを軽率に仮定しています。この問題、つまりどんなことでも答えを提供したいという衝動は、より正確なプロンプトで解決できますが、注意が必要です。
