Исходное название: Какая платформа создает лучших AI-агентов? Мы тестируем ChatGPT, Claude, Gemini и другие
Автор оригинала: Jose Antonio Lanz
Исходная статья: https://decrypt.co/
Составила: Daisy, Mars Finance
Какая платформа может создать лучших AI-агентов? Мы протестировали ChatGPT, Claude, Gemini и другие платформы
Сравните пять ведущих платформ, чтобы узнать, какая из них лучше всего подходит для размещения вашего будущего AI-агента в повседневных сценариях.
AI-агенты могут выполнять множество задач: от поиска информации в вашей библиотеке документов, написания кода, сбора данных с веб-страниц до предоставления глубокого анализа сложных данных и многого другого. Вы также можете создать виртуальный офис, состоящий из группы AI-агентов, сосредоточенных на различных задачах, которые работают вместе как профессиональная команда цифровых сотрудников.
Но насколько это трудно? Если обычный человек хочет создать своего AI-финансового консультанта, например, без использования API, без странного кодирования и без GitHub, какая платформа может предложить пользователю наилучшую поддержку? Мы просто хотим увидеть, как эти ведущие AI-компании помогают обычным пользователям создавать AI-агентов без необходимости в высоких технических навыках.
Конечно, вы получаете то, за что платите. В данном случае мы также хотели увидеть, существует ли связь между тем, насколько легко обычному человеку настроить агента и качеством результатов, предоставленных каждой платформой.
Наш эксперимент сравнил пять ведущих платформ: ChatGPT, Claude, Huggingface, Mistral AI и Gemini. Каждая платформа получила одни и те же основные команды, чтобы создать финансового консультанта.
Тестирование сосредоточено на возможности платформы из коробки. Основное внимание уделяется тому, может ли агент справиться с распространенным сценарием — в данном случае помочь кому-то сбалансировать инвестиции в $25,000 и долги в $30,000. Мы также хотели увидеть, как они анализируют торговые графики. Мы избегали использования дополнительных инструментов для повышения продуктивности агентов и старались придерживаться самого простого подхода.
Вкратце, вот наши выводы и рейтинг модели:
Рейтинг платформ
1) GPT от OpenAI (8.5/10)
Уровень сложности настройки: 4/5
Качество результатов: 4.5/5
ChatGPT — наиболее сбалансированная платформа, предлагающая сложные опции создания агентов, а также проводит пользователей через процесс и предоставляет ручные варианты, удовлетворяя потребности как абсолютно новичков, так и пользователей с некоторым опытом.
Несмотря на то, что недавние обновления интерфейса скрыли некоторые функции в меню, эта платформа показывает отличные результаты в преобразовании сложных пользовательских требований в функциональные агенты. Мы протестировали модель, создав финансового консультанта, и результаты показали, что этот агент обладает отличным контекстным пониманием и структурированными навыками решения проблем, предоставляя детализированные и последовательные стратегии для управления долгами и распределения инвестиций.
2) Google Gemini (7/10)
Уровень сложности настройки: 4/5
Качество результатов: 3/5
Gemini выделяется своим изысканным и интуитивно понятным интерфейсом и отличной обработкой ошибок. Хотя для достижения наилучших результатов требуются более детальные подсказки, его литеральная интерпретация команд создает последовательные и предсказуемые результаты.
Агент акцентирует внимание на сборе контекста перед тем, как предоставить финансовые советы, что похоже на профессиональную практику. Однако в ответах без примеров он может быть слишком осторожным.
3) HuggingChat (6.5/10)
Уровень сложности настройки: 2/5
Качество результатов: 4.5/5
Эта открытая платформа предлагает беспрецедентные возможности настройки и выбора моделей. Это отличный выбор для тех, кто ищет детальный контроль за каждым аспектом, но может не подойти тем, кто ищет простоты. (Это можно сравнить с различием между системами Linux и macOS). Ее сложные временные рамки и интеграция утилит демонстрируют ее продвинутые возможности.
Мы создали чистого агента, без каких-либо дополнительных функций. Мы использовали язык модели Nvidia Nemomotron в качестве основы, качество его вывода достаточно для сопоставления с ChatGPT. Неплохо для открытого кода.
4) Claude (5.5/10)
Уровень сложности настройки: 2.5/5
Качество результатов: 3/5
Платформа Anthropic показывает отличные результаты в определенных областях, особенно в задачах, требующих обработки большого объема контекста и анализа кода. Ее минималистский интерфейс скрывает сложные возможности, но поле «опциональных» инструкций может сбивать с толку пользователей.
Наш агент очень осторожен и неопределенен в предоставлении советов, но демонстрирует хорошее понимание рисков и стратегического мышления. Ему нужны более внимательные подсказки, чтобы по-настоящему раскрыть свой потенциал, но если тесты используют адаптивные подсказки, это будет противоречить предположению о схожих условиях, поэтому это не справедливо.
5) Mistral AI (5/10)
Уровень сложности настройки: 2.5/5
Качество результатов: 2.5/5
Эта французская платформа предлагает уникальные варианты обучения на основе примеров и глубокой настройки. Однако ее интерфейс, ориентированный на разработчиков, и случайные переключения языка создают барьеры для пользователей без технических навыков. Она также требует модификации конфигурации агента для использования различных моделей для выполнения различных задач, таких как анализ изображений или обработка кода. Это не идеально.
Финансовый консультант проявил потенциал в области взаимодействия дизайна, но столкнулся с трудностями в базовой математической верификации, результат оказался худшим. Не то чтобы результат был плохим, но в тестах без примеров это было наименее удовлетворительным.
Глубокий анализ
Учитывая предыдущие рейтинги, не существует универсального решения, все платформы имеют свои сильные и слабые стороны. С помощью некоторых сосредоточенных и продуманных подсказок результаты могут варьироваться между платформами, и одна платформа может превзойти другую. В конечном итоге все языковые модели (LLM) имеют свои собственные стили подсказок.
Если вы хотите узнать больше о причинах нашего ранжирования, вот более глубокий анализ нашего опыта и результатов агентов. Мы настроили всех агентов на одни и те же системные подсказки, без дополнительных параметров и функций, и задали им одни и те же основные вопросы: «У меня есть 25 тысяч долларов для инвестиций и 30 тысяч долларов долгов. Составьте для меня финансовый план.»
OpenAI

Интерфейс ChatGPT недавно был обновлен, что на самом деле усложнило операции. Опции создания GPT теперь скрыты в меню, но как только вы их найдете, они предлагают два пути: один — это диалоговое создание, где AI помогает вам создать агента; другой — это ручная настройка, подходящая тем, кто точно знает, что хочет.
Платформа GPT от OpenAI является многофункциональным «швейцарским армейским ножом» — она может читать код, искать в интернете, обрабатывать генерацию изображений и анализировать их. Процесс настройки, управляемый AI, делает его особенно подходящим для новичков, хотя для опытных пользователей, нуждающихся в тонком контроле, это может показаться несколько ограниченным. (Например, если вы попросите модель быть более конкретной или детализированной, она может изменить всю системную подсказку, что приведет к ухудшению результатов.)
В реальном использовании агента ChatGPT очень прост, интерфейс понятен и легко воспринимается.

Эти агенты могут читать документы и понимать изображения, что дает им определенное преимущество перед другими платформами.
Теперь давайте поговорим о качестве агентов, которых вы можете создать с помощью базовых подсказок. Созданный нами финансовый консультант MoneyGPT показал нам мастер-класс по структурированному решению проблем, продемонстрировав довольно впечатляющие результаты.
Помимо точного распределения средств — «$20,000 на высокие долги» и подробного разбора портфеля — этот агент демонстрирует сложное финансовое рассуждение. Он предлагает пятитактную дорожную карту, которая не просто список, а связная стратегия, учитывающая краткосрочные потребности и долгосрочное планирование.

Преимущество этого агента заключается в его способности балансировать детали и контекст. Хотя он рекомендует конкретный инвестиционный портфель (40% инвестиций в S&P 500, 30% в облигации), он также объясняет причины своих рекомендаций: «Погашение высоких долговых обязательств похоже на получение гарантированной инвестиционной доходности». Это осознание контекста распространяется на долгосрочное планирование, предлагая регулярные пересмотры и корректировку стратегий в зависимости от меняющихся обстоятельств.
Тем не менее, это богатство информации также выявляет потенциальный слабый момент: может перегрузить пользователя, предоставив слишком много деталей за один раз. Хотя технически он очень всеобъемлющий, быстро предоставляемое конкретное распределение, инвестиционные стратегии и планы мониторинга могут показаться пугающими для финансовых новичков.
В целом, платформа создания агентов Google Gemini выделяется с эстетической точки зрения, предлагая изысканный, интуитивно понятный интерфейс, который делает процесс создания агентов практически чрезмерно простым. Литеральная интерпретация команд помогает избежать путаницы, а лаконичный интерфейс пользователя устраняет давление в разработке AI.
Тем не менее, чтобы получить качественные результаты, ему нужны более детализированные подсказки. Он не будет воспринимать вещи как должное: краткие подсказки приведут к низкокачественным ответам.

На заднем плане он имеет мощные функции — интеграция веб-поиска на основе Google, возможности анализа кода и обработки изображений, сопоставимые с функциональностью ChatGPT, но в основном опираются на технологии Microsoft.
Интерфейс пользователя Gemini ощущается так, будто его разрабатывали люди, действительно понимающие пользовательский опыт. Интерфейс направляет пользователей с помощью четких ярлыков, вся информация отображается на одном экране.

Этот изысканный подход делает его особенно привлекательным для новичков, хотя опытные пользователи могут считать его недостаточно подробным.
Мы назвали нашего агента MoneyGem и попросили его предоставить финансовый план. Его консультативный подход продемонстрировал уникальный метод решения проблем от Google. Он не дал прямого ответа, а сначала задал вопросы вроде «Какой это тип долга?» и «Какова ваша процентная ставка?» — что показывает, что он понимает, что финансовые советы не являются универсальными.
Он подчеркивает сбор контекстной информации перед тем, как предоставить советы, что соответствует профессиональной практике финансового планирования, хотя это может расстроить пользователей, ищущих быстрые ответы.

Ответ в формате zero-shot не был полезен. Агент в основном заявляет, что не понимает пользователя и не может предоставить хорошие финансовые советы. Когда его просят сделать предположения и заставляют предоставить планы, подходящие для большинства сценариев, агент создает очень осторожный проект плана, но не предоставляет конкретных инвестиционных советов.
Тем не менее, в конце концов, MoneyGem предложил максимизировать налоговые льготы, такие как 401(k) или Roth IRA, чтобы уменьшить налоговую нагрузку. Неплохо.
Вы можете нажать здесь, чтобы увидеть наше взаимодействие с MoneyGem, и попробовать эту модель, нажав на эту ссылку.
Mistral AI
Процесс настройки агента Mistral немного сложен, он не ориентирован на простоту. Инструмент создания агентов скрыт в консоли разработчика и предлагает глубокие параметры настройки, которые могут сбить с толку новичков, но радовать любителей tinkering.
Интерфейс создания агентов не является частью LeChat (интерфейс чата), но после создания агента он появится там.

Нам очень понравилось, что можно формировать поведение и стиль ответов агента через ввод примеров, чего нет на других платформах. Однако здесь есть странная ошибка: при создании агента интерфейс внезапно переключился на французский, вероятно, потому что компания французская. В любом случае, мы не смогли переключиться обратно на английский или испанский.
После того, как агент создан, пользователю необходимо вызвать его в обычном интерфейсе чата для использования. Пользователям нужно выйти из Le Plateforme и зайти в Le Chat, что не является самым интуитивным действием. Тем не менее, использование UI агента довольно прямолинейно, ощущается как другие AI-чат-боты.

Мы создали нашего агента и назвали его Le Money в честь французских корней Mistral. Его результаты ясно показывают универсальный подход Mistral к решению проблем. Он предлагает «оставить 10,000 долларов в качестве резервного фонда, 15,000 долларов на погашение долгов и 10,000 долларов для инвестиций», что кажется простым, но также указывает на то, что агент страдает от недостатка базовой математической проверки.
Сумма в 35,000 долларов превышает доступные средства на 10,000 долларов, что является базовой ошибкой, и некоторые языковые модели могут допускать такие ошибки, когда приоритет отдается концептуальной правильности, а не числовой точности.
Тем не менее, мы должны отметить, что лучшие LLM значительно улучшились и не допускают таких ошибок так часто — по крайней мере, не так часто, как Mistral.

Кроме того, план Le Money не очень подробен, но он единственный, кто предлагает последующие вопросы, которые могут сделать взаимодействие более плавным и помочь ему лучше понять потребности пользователя.
Полный план LeMoney можно посмотреть здесь, а агента можно протестировать здесь.
Anthropic

Проект Claude выглядит не как платформа создания агентов, а скорее как сложная система выполнения задач. Интерфейс минималистичен, почти слишком минималистичен и не очень интуитивен.
Этот минималистский интерфейс может сбивать с толку некоторых пользователей. Платформа предлагает основные настройки и имеет «опциональное» поле для инструкций, которое кажется как незначительным, так и критически важным: если инструкции помечены как опциональные, как агент AI знает, что он должен делать?
Его минималистский интерфейс ощущается немного странно, но Anthropic никогда не славилась дизайном UI. То же окно, что используется для настройки модели, также служит для подачи ей запросов. Его функции в основном сосредоточены на интерпретации текстового кода, и никаких других функций нет. Веб-поиск, обработка изображений и генерация остаются продвинутыми функциями, которые Anthropic оставляет своим конкурентам.
Наш агент, названный MoneyClaude, не может быть протестирован публично, так как Anthropic этого не позволяет. Он занимает очень осторожную позицию при предоставлении финансовых советов, хотя ответы технически точны, но содержат много неопределенностей — например, «сохранение баланса между погашением долгов и необходимыми сбережениями» и т. д.

Он запросил больше информации, но, по крайней мере, в отсутствие этой информации предоставил очень общий стратегический план без необходимости дальнейшего взаимодействия, что, по-видимому, более предпочтительно, чем подход Google.
Hugging Face

Эта открытая платформа уникальна и является раем для опытных пользователей — и потенциальным кошмаром для новичков. Это единственная платформа, которая позволяет пользователям выбирать предпочитаемую языковую модель, предоставляя беспрецедентный контроль над основами агента.
Кроме того, пользователи могут интегрировать десятки различных инструментов в свои агенты, но одновременно можно активировать только три. Это ограничение заставляет пользователей тщательно обдумывать, какие функции наиболее важны для каждого конкретного случая, но это не может предложить никакая другая модель.
Это самый настраиваемый опыт среди всех интерфейсов, с множеством настраиваемых параметров. В результате эта платформа может создать более мощных и профессиональных агентов, чем конкуренты, но только в руках тех, кто полностью понимает, как с ними работать.
Пользователи могут попробовать своих агентов на HuggingChat — безусловно, мечта для опытных пользователей. После создания агента его использование становится очень простым. Интерфейс показывает большую карточку с именем агента, описанием и фотографией. Он также позволяет пользователям делиться ссылкой на агента и настраивать его параметры, все это можно сделать прямо на карточке.

После тестирования нашего агента HuggingMoney мы обнаружили, что его подход к временным рамкам демонстрирует более глубокое понимание психологии финансового планирования. Он разделяет планирование на «краткосрочное (0-24 месяца), среднесрочное (24-60 месяцев) и долгосрочное (более 60 месяцев)», что соответствует профессиональной практике финансового планирования.
Агент рекомендует «инвестировать $0-$5,000 в ликвидные, низкорисковые инструменты», при этом поддерживая «активные платежи по долгам в $1,000-$1,500» каждый месяц. Это предложение на первый взгляд демонстрирует тонкое понимание управления денежными потоками.

Еще одной интересной особенностью является то, что он сочетает утилиты с теоретическими рекомендациями. Кроме рекомендаций о принципе 50/30/20, он также рекомендует конкретные приложения для бюджета и подчеркивает налоговую оптимизацию — строя мост между высокоуровневыми стратегиями и повседневным выполнением. Основной недостаток? Он предположил процентные ставки по долгам без предварительного запроса на подтверждение.
Чтобы предоставить полезные советы, он слишком легкомысленно предположил множество вещей. Эта проблема, возникающая из желания дать ответ любой ценой, может быть решена более точными подсказками, но это требует внимания.
