Judul asli: Platform Mana yang Membangun Agen AI Terbaik? Kami Menguji ChatGPT, Claude, Gemini, dan Lainnya
Penulis asli: Jose Antonio Lanz
Sumber teks asli: https://decrypt.co/
Disusun oleh: Daisy, Mars Finance
Platform mana yang dapat membangun agen AI terbaik? Kami menguji ChatGPT, Claude, Gemini, dan platform lainnya
Bandingkan lima platform terkemuka, ungkap siapa yang paling cocok untuk mengelola agen AI masa depan Anda dalam skenario sehari-hari.
Agen AI dapat melakukan banyak hal: mulai dari mencari informasi di perpustakaan dokumen Anda, menulis kode, mengambil data dari web, hingga memberikan wawasan dan analisis mendalam pada data kompleks, bahkan lebih dari itu. Anda juga dapat membangun kantor virtual yang terdiri dari sekelompok agen AI yang fokus pada berbagai tugas, bekerja sama seperti tim karyawan digital profesional.
Tapi seberapa sulit ini? Jika seseorang yang biasa ingin membangun penasihat keuangan AI-nya sendiri, misalnya, tanpa bergantung pada API, tanpa perlu coding yang aneh, dan tanpa Github, platform mana yang dapat memberikan dukungan terbaik bagi pengguna? Kami hanya ingin melihat bagaimana perusahaan AI teratas ini membantu pengguna biasa membuat agen AI tanpa memerlukan keterampilan teknis yang tinggi.
Tentu saja, Anda mendapatkan apa yang Anda bayar. Dalam hal ini, kami juga ingin melihat apakah ada hubungan antara seberapa mudahnya orang biasa mengatur agen dan kualitas hasil yang diberikan oleh setiap platform.
Eksperimen kami membandingkan lima platform besar: ChatGPT, Claude, Huggingface, Mistral AI, dan Gemini. Setiap platform menerima instruksi dasar yang sama, meminta untuk membuat penasihat keuangan.
Pengujian berfokus pada kemampuan platform untuk digunakan langsung. Fokus utama adalah apakah agen dapat menangani skenario umum—dalam hal ini, membantu seseorang menyeimbangkan investasi sebesar $25,000 dengan utang $30,000. Kami juga ingin melihat kemampuan mereka dalam menganalisis grafik perdagangan. Kami menghindari penggunaan alat tambahan untuk meningkatkan produktivitas agen, dan mencoba untuk mengambil pendekatan yang paling sederhana.
Singkatnya, berikut adalah temuan dan peringkat model kami:
Peringkat platform
1) GPT OpenAI (8.5/10)
Tingkat kesulitan pengaturan: 4/5
Kualitas hasil: 4.5/5
ChatGPT adalah platform yang paling seimbang, menawarkan opsi pembuatan agen yang kompleks, baik dengan opsi terarah maupun manual, mampu memenuhi kebutuhan pengguna yang benar-benar baru maupun yang memiliki pengalaman tertentu.
Meskipun pembaruan antarmuka baru-baru ini menyembunyikan beberapa fitur dalam menu, platform ini menunjukkan kinerja luar biasa dalam mengubah kebutuhan pengguna yang kompleks menjadi agen fungsional. Kami menguji model ini dengan membangun penasihat keuangan, dan hasilnya menunjukkan bahwa agen ini memiliki kesadaran konteks yang luar biasa dan kemampuan penyelesaian masalah yang terstruktur, memberikan strategi yang rinci dan koheren untuk manajemen utang dan alokasi investasi.
2) Google Gemini (7/10)
Tingkat kesulitan pengaturan: 4/5
Kualitas hasil: 3/5
Gemini menonjol berkat antarmuka yang halus, intuitif, dan penanganan kesalahan yang sangat baik. Meskipun memerlukan prompt yang lebih rinci untuk mendapatkan hasil terbaik, interpretasi harfiah terhadap instruksi menciptakan hasil yang konsisten dan dapat diprediksi.
Agen ini menggunakan pendekatan konsultatif saat memberikan saran keuangan, menekankan pengumpulan konteks sebelum merekomendasikan, mirip dengan praktik profesional. Namun, dalam respons tanpa sampel, ia mungkin terlalu konservatif.
3) HuggingChat (6.5/10)
Tingkat kesulitan pengaturan: 2/5
Kualitas hasil: 4.5/5
Platform open source ini menawarkan kustomisasi dan pilihan model yang tak tertandingi. Ini adalah pilihan yang sangat baik bagi mereka yang mencari kontrol mendetail pada setiap aspek, tetapi mungkin tidak cocok untuk pengguna yang mencari kemudahan. (Ini dapat dibandingkan dengan perbandingan antara sistem Linux dan sistem macOS). Kerangka waktu yang kompleks dan integrasi alat menunjukkan kemampuan canggihnya.
Kami membangun agen yang murni, tanpa fitur tambahan. Kami menggunakan Nemomotron Nvidia sebagai model bahasa besar dasar, hasilnya cukup untuk bersaing dengan ChatGPT. Untuk kalangan open source, ini cukup baik.
4) Claude (5.5/10)
Tingkat kesulitan pengaturan: 2.5/5
Kualitas hasil: 3/5
Platform Anthropic menunjukkan kinerja luar biasa di bidang tertentu, terutama dalam tugas yang memerlukan pemrosesan konteks yang besar dan analisis kode. Antarmuka yang minimalis menyembunyikan kemampuannya yang kompleks, tetapi bidang instruksi 'opsional' mungkin membingungkan bagi pengguna.
Agen kami sangat konservatif dan samar saat memberikan saran, tetapi menunjukkan kesadaran risiko dan pemikiran strategis yang baik. Ia membutuhkan prompt yang lebih hati-hati untuk benar-benar memanfaatkan potensinya, tetapi jika pengujian menggunakan prompt adaptif, itu akan bertentangan dengan premis untuk mempertahankan kondisi serupa, jadi itu tidak adil.
5) Mistral AI (5/10)
Tingkat kesulitan pengaturan: 2.5/5
Kualitas hasil: 2.5/5
Platform Prancis ini menawarkan pembelajaran berbasis contoh yang unik dan opsi kustomisasi mendalam. Namun, antarmuka yang ditujukan untuk pengembang dan masalah perpindahan bahasa yang sesekali menciptakan hambatan bagi pengguna non-teknis. Ini juga memerlukan modifikasi konfigurasi agen untuk menyesuaikan dengan model yang berbeda untuk menangani tugas seperti analisis gambar atau pemrosesan kode. Ini tidak ideal.
Penasihat keuangan menunjukkan potensi dalam desain interaksi, tetapi mengalami kesulitan dalam verifikasi matematika dasar, menghasilkan hasil yang paling buruk. Bukan berarti hasilnya buruk, tetapi dalam pengujian nol sampel, ini adalah yang paling tidak memuaskan.
Analisis mendalam
Mengingat peringkat sebelumnya, tidak ada solusi universal, semua platform memiliki kelebihan dan kekurangan masing-masing. Dengan beberapa penyesuaian fokus dan perhatian pada prompt, hasil dari satu platform mungkin berbeda, bahkan melampaui platform lainnya. Pada akhirnya, semua model bahasa (LLM) memiliki gaya prompt yang berbeda.
Jika Anda ingin memahami lebih lanjut tentang alasan di balik peringkat kami, berikut adalah analisis yang lebih mendalam tentang pengalaman dan hasil agen. Kami mengonfigurasi semua agen dengan prompt sistem yang sama, tanpa parameter dan fungsi tambahan, dan menanyakan kepada mereka pertanyaan dasar yang sama: "Saya memiliki investasi sebesar 25K dolar dan utang sebesar 30K dolar. Buatkan rencana keuangan untuk saya."
OpenAI

Antarmuka ChatGPT baru-baru ini diperbarui, yang sebenarnya membuat operasi menjadi lebih rumit. Opsi pembuatan GPT sekarang tersembunyi dalam menu, tetapi setelah ditemukan, ia menawarkan dua jalur: satu adalah pengaturan berbasis percakapan, di mana AI membantu membangun agen Anda; yang lainnya adalah konfigurasi manual, cocok untuk mereka yang tahu persis apa yang mereka inginkan.
Platform GPT OpenAI adalah 'pisau tentara Swiss' yang lengkap—ia dapat membaca kode, mencari web, menangani pemrosesan gambar dan analisis. Proses pengaturan yang dipandu AI membuatnya sangat cocok untuk pemula, meskipun bagi pengguna tingkat lanjut yang membutuhkan kontrol halus, mungkin terasa agak terbatas. (Misalnya, jika Anda meminta model untuk lebih spesifik atau rinci, ia mungkin mengubah seluruh prompt sistem, yang dapat mengakibatkan hasil yang lebih buruk.)
Saat menggunakan agen secara langsung, ChatGPT sangat langsung, antarmuka jelas dan mudah dipahami.

Agen-agen ini dapat secara nativ membaca dokumen dan memahami gambar, yang memberi mereka keunggulan tertentu di antara platform lain.
Sekarang, mari kita bicarakan kualitas agen yang dapat Anda buat hanya dengan prompt dasar. Penasihat keuangan yang kami buat, MoneyGPT, menunjukkan kepada kami program master dalam penyelesaian masalah terstruktur, dengan kinerja yang cukup mengesankan.
Selain alokasi dana yang tepat—"$20,000 untuk utang berbunga tinggi" serta pembagian portofolio yang rinci—agen ini juga menunjukkan penalaran keuangan yang kompleks. Ini menyediakan peta jalan lima langkah, bukan hanya daftar, tetapi strategi yang koheren yang mempertimbangkan kebutuhan jangka pendek dan perencanaan jangka panjang.

Keunggulan agen ini terletak pada kemampuannya untuk menyeimbangkan detail dan konteks. Meskipun merekomendasikan portofolio tertentu (40% diinvestasikan dalam S&P 500, 30% diinvestasikan dalam obligasi), ia juga menjelaskan alasan di balik rekomendasi tersebut: "Melunasi utang berbunga tinggi seperti mendapatkan pengembalian investasi yang dijamin." Kesadaran konteks ini meluas ke perencanaan jangka panjang, menyarankan untuk meninjau secara berkala, dan menyesuaikan strategi berdasarkan situasi yang berubah.
Namun, kelimpahan informasi ini juga mengungkapkan potensi kelemahan: bisa membuat pengguna merasa kewalahan karena terlalu banyak detail sekali jalan. Meskipun secara teknis sangat komprehensif, penyampaian alokasi konkret, strategi investasi, dan rencana pemantauan yang cepat dapat terasa sedikit menakutkan bagi pemula di bidang keuangan.
Secara keseluruhan, platform pembuatan agen Gemini dari Google menonjol secara estetika, memiliki antarmuka yang halus dan intuitif, membuat proses pembuatan agen hampir terasa terlalu mudah. Sistem ini membantu menghindari kebingungan dengan interpretasi harfiah instruksi, dan antarmuka pengguna yang sederhana menghilangkan rasa tertekan dalam pengembangan AI.
Namun, untuk mendapatkan hasil yang berkualitas, ia memerlukan prompt yang lebih rinci. Ia tidak akan otomatis menangani hal-hal: prompt yang singkat akan memberikan respons berkualitas rendah.

Di belakang, ia memiliki kemampuan kuat—integrasi pencarian web yang didukung Google, analisis kode, dan kemampuan pemrosesan gambar, setara dengan kemampuan ChatGPT, tetapi sebagian besar bergantung pada teknologi Microsoft.
Antarmuka pengguna Gemini terasa seperti dirancang oleh orang yang benar-benar memahami pengalaman pengguna. Antarmuka memandu pengguna dengan label yang jelas, semua informasi dapat ditampilkan di satu layar.

Pendekatan halus ini membuatnya sangat menarik bagi pengguna pemula, meskipun pengguna berpengalaman mungkin merasa kurang memiliki kontrol yang lebih mendetail.
Kami menamai agen kami MoneyGem dan memintanya untuk memberikan rencana keuangan. Pendekatannya yang konsultatif menunjukkan cara unik Google dalam memecahkan masalah. Ia tidak memberikan jawaban langsung, tetapi terlebih dahulu menanyakan pertanyaan seperti "Apa jenis utang ini?" dan "Berapa suku bunga Anda?"—menunjukkan bahwa ia memahami bahwa saran keuangan tidak selalu sama.
Ia menekankan pengumpulan informasi latar belakang sebelum memberikan saran, sejalan dengan praktik perencanaan keuangan profesional, meskipun ini mungkin membuat pengguna yang mencari jawaban cepat merasa frustrasi.

Jawaban tanpa sampel tidak berguna. Agen pada dasarnya menyatakan bahwa ia tidak memahami pengguna dan tidak dapat memberikan saran keuangan yang baik. Setelah memintanya untuk membuat asumsi dan memaksa agar memberikan rencana yang sesuai untuk sebagian besar skenario, agen menghasilkan draf rencana yang sangat konservatif, tetapi tidak memberikan saran investasi yang konkret.
Namun, MoneyGem akhirnya memberikan saran untuk memaksimalkan akun manfaat pajak, seperti 401(k) atau Roth IRA, untuk mengurangi beban pajak. Bagus.
Anda dapat mengklik di sini untuk melihat interaksi kami dengan MoneyGem dan mencoba model tersebut secara langsung dengan mengklik tautan ini.
Mistral AI
Proses pengaturan agen Mistral agak rumit, jauh dari kesederhanaan. Alat pembuatan agen tersembunyi di dalam konsol pengembangnya, dengan opsi kustomisasi mendalam yang mungkin membingungkan bagi pemula tetapi menyenangkan bagi pengguna yang suka bereksperimen.
Antarmuka pembangunan agen bukan bagian dari LeChat (antarmuka chat), tetapi setelah agen dibuat, ia akan muncul di sana.

Satu hal yang sangat kami sukai adalah kemampuan untuk membentuk perilaku dan gaya respons agen melalui masukan contoh, yang merupakan fitur yang tidak ditawarkan oleh platform lain saat ini. Namun, ada bug aneh di sini: saat membuat agen, UI tiba-tiba beralih ke bahasa Prancis, mungkin karena perusahaan ini berasal dari Prancis. Bagaimanapun, kami tidak dapat kembali ke bahasa Inggris atau Spanyol.
Setelah agen dibuat, pengguna harus memanggilnya di antarmuka chat normal untuk menggunakannya. Pengguna perlu keluar dari Le Plateforme, masuk ke Le Chat, yang bukan operasi paling intuitif. Namun, UI penggunaan agen cukup langsung, terasa seperti chatbot AI lainnya.

Kami telah membuat agen kami dan menamakannya Le Money sebagai penghormatan kepada akar Prancis Mistral. Kinerjanya dengan jelas menunjukkan pendekatan Mistral dalam penyelesaian masalah. Ia merekomendasikan "menyimpan $10,000 sebagai dana darurat, $15,000 untuk melunasi utang, dan $10,000 untuk investasi," yang tampaknya jelas, tetapi juga menunjukkan bahwa agen tersebut kurang dalam beberapa verifikasi matematika dasar.
Total $35,000 melebihi $10,000 dana yang tersedia, yang merupakan kesalahan mendasar, beberapa model bahasa dapat melakukan kesalahan seperti ini saat mengutamakan kebenaran konsep daripada akurasi numerik.
Namun, kami harus menunjukkan bahwa LLM yang berkinerja terbaik telah mengalami banyak perbaikan dan tidak sering melakukan kesalahan seperti ini—setidaknya tidak sesering Mistral.

Selain itu, rencana Le Money tidak terlalu rinci, tetapi ini adalah satu-satunya agen yang memberikan pertanyaan lanjutan yang dapat membuat interaksi lebih lancar dan membantu memahami kebutuhan pengguna dengan lebih baik.
Rencana lengkap LeMoney dapat dilihat di sini, dan agen dapat diuji di sini.
Anthropic

Proyek Claude terasa lebih seperti sistem pelaksanaan tugas yang rumit daripada platform pembuatan agen. Antarmukanya minimalis, hampir terlalu minimalis, dan kurang intuitif.
Antarmuka minimalis ini mungkin membuat beberapa pengguna merasa bingung. Platform menyediakan pengaturan dasar dan memiliki bidang instruksi yang 'opsional', yang terasa baik tidak penting dan sangat penting: jika instruksi ditandai sebagai opsional, bagaimana agen AI tahu apa yang harus dilakukan?
Antarmuka yang sangat minimalis terasa agak aneh, tetapi Anthropic tidak dikenal dengan desain UI-nya. Jendela yang sama untuk mengonfigurasi model juga digunakan untuk memberikan prompt. Fungsinya terutama berfokus pada interpretasi kode teks, tanpa fungsi lain. Pencarian web, pemrosesan gambar, dan generasi adalah fitur tingkat lanjut yang ditinggalkan Anthropic untuk pesaingnya.
Agen kami, yang dinamai MoneyClaude, tidak dapat diuji secara terbuka karena Anthropic tidak mengizinkannya. Ia mengambil posisi yang sangat konservatif saat memberikan saran keuangan, meskipun responsnya secara teknis akurat, kontennya sangat samar—misalnya, "Menjaga keseimbangan antara mengurangi utang dan tabungan yang diperlukan," dan sebagainya.

Ia meminta lebih banyak informasi, tetapi setidaknya tanpa informasi tersebut, ia memberikan strategi yang sangat umum tanpa memerlukan interaksi lebih lanjut, yang tampaknya lebih ideal dibandingkan dengan pendekatan Google.
Hugging Face

Platform open source ini unik dan merupakan surga bagi pengguna tingkat lanjut—juga bisa menjadi mimpi buruk bagi pemula. Ini adalah satu-satunya platform yang memungkinkan pengguna memilih model bahasa sesuai keinginan mereka, memberikan kontrol yang belum pernah ada sebelumnya untuk mendefinisikan dasar agen.
Selain itu, pengguna dapat mengintegrasikan puluhan alat yang berbeda ke dalam agen mereka, tetapi hanya dapat mengaktifkan tiga sekaligus. Pembatasan ini memaksa pengguna untuk mempertimbangkan dengan cermat fungsi terpenting untuk setiap kasus penggunaan tertentu, tetapi ini adalah sesuatu yang tidak dapat ditawarkan oleh model lain.
Ini adalah pengalaman yang paling dapat disesuaikan di antara semua antarmuka, dengan banyak pengaturan yang dapat disesuaikan. Hasilnya, platform ini dapat menciptakan agen yang lebih kuat dan profesional dibandingkan pesaing, tetapi hanya berhasil di tangan orang yang benar-benar memahami cara mengoperasikannya.
Pengguna dapat mencoba agen mereka di HuggingChat—tanpa diragukan lagi ini adalah impian pengguna tingkat lanjut. Setelah agen dibuat, pengguna sangat mudah menggunakannya. Antarmuka menampilkan kartu besar yang berisi nama agen, deskripsi, dan foto. Ia juga memungkinkan pengguna untuk membagikan tautan agen dan menyesuaikan pengaturannya, semua ini dapat dilakukan langsung di kartu.

Setelah menguji agen HuggingMoney kami, kami menemukan bahwa cara ia menangani kerangka waktu menunjukkan pemahaman yang lebih mendalam tentang psikologi perencanaan keuangan. Ia membagi perencanaan menjadi "jangka pendek (0-24 bulan), jangka menengah (24-60 bulan), dan jangka panjang (lebih dari 60 bulan)," yang sejalan dengan praktik perencanaan keuangan yang profesional.
Agen merekomendasikan "$0-$5,000 diinvestasikan dalam instrumen yang likuid dan berisiko rendah," sambil mempertahankan pembayaran utang aktif setiap bulan "$1,000-$1,500." Rekomendasi ini, pada pandangan pertama, menunjukkan pemahaman yang mendetail tentang manajemen arus kas.

Fitur menarik lainnya adalah menggabungkan alat dengan saran teoritis. Selain merekomendasikan aturan 50/30/20, ia juga merekomendasikan aplikasi anggaran tertentu dan menekankan pengoptimalan pajak—menjembatani strategi tingkat tinggi dan pelaksanaan sehari-hari. Kekurangan utama? Ia membuat asumsi tentang suku bunga utang tanpa meminta konfirmasi.
Untuk memberikan saran yang berguna, ia terlalu sembrono dalam membuat banyak asumsi. Masalah ini, yaitu dorongan untuk memberikan respons apapun, dapat diselesaikan dengan prompt yang lebih tepat, tetapi ini perlu diperhatikan.
