Título original: Qual Plataforma Cria os Melhores Agentes de IA? Testamos ChatGPT, Claude, Gemini e Mais
Autor original: Jose Antonio Lanz
Fonte original: https://decrypt.co/
Compilado por: Daisy, 火星财经
Qual plataforma pode criar o melhor agente de IA? Testamos o ChatGPT, Claude, Gemini e outras plataformas
Compare as cinco principais plataformas e descubra qual delas é a mais adequada para hospedar seu futuro agente de IA em cenários do dia a dia.
Os agentes de IA podem realizar muitas tarefas: pesquisar informações em sua biblioteca de documentos, escrever código, extrair dados da web, até oferecer insights e análises profundas sobre dados complexos, e muito mais. Você pode até construir um escritório virtual composto por uma equipe de agentes de IA focados em diferentes tarefas, trabalhando em colaboração como uma equipe profissional de funcionários digitais.
Mas quão difícil é isso? Se uma pessoa comum quiser criar seu próprio consultor financeiro de IA, por exemplo, sem depender de APIs, sem codificação estranha e sem o Github, qual plataforma pode oferecer o melhor suporte ao usuário? Queremos apenas ver como essas principais empresas de IA se saem em ajudar usuários comuns a criar agentes de IA sem que eles precisem de habilidades técnicas avançadas.
Claro, você recebe o que paga. Nesse caso, também queríamos ver se existe uma correlação entre a facilidade de configuração de um agente por um usuário comum e a qualidade dos resultados entregues por cada plataforma.
Nosso experimento comparou cinco grandes plataformas: ChatGPT, Claude, Huggingface, Mistral AI e Gemini. Cada plataforma recebeu as mesmas instruções básicas, pedindo a criação de um consultor financeiro.
Os testes se concentraram na capacidade de uso imediato da plataforma. O foco foi examinar se o agente poderia lidar com um cenário comum — ajudar alguém a equilibrar um investimento de $25,000 com uma dívida de $30,000. Também queríamos ver sua capacidade de analisar gráficos de transações. Evitamos usar ferramentas adicionais para aumentar a produtividade do agente, em vez disso, tentamos adotar a abordagem mais simples.
Resumindo, aqui estão nossas descobertas e a classificação dos modelos:
Classificação da Plataforma
1) GPT da OpenAI (8.5/10)
Nível de Dificuldade de Configuração: 4/5
Qualidade dos Resultados: 4.5/5
O ChatGPT é a plataforma mais equilibrada, oferecendo opções complexas de criação de agentes, ao mesmo tempo que possui opções guiadas e manuais, capazes de atender tanto iniciantes completos quanto usuários com alguma experiência.
Embora as atualizações recentes da interface tenham enterrado algumas funcionalidades em menus, a plataforma se destaca em converter necessidades complexas do usuário em agentes funcionais. Testamos o modelo criando um consultor financeiro, e os resultados mostraram que o agente possui uma excelente consciência de contexto e habilidades estruturadas de resolução de problemas, oferecendo estratégias detalhadas e coerentes para gestão de dívidas e alocação de investimentos.
2) Google Gemini (7/10)
Nível de Dificuldade de Configuração: 4/5
Qualidade dos Resultados: 3/5
O Gemini se destaca por sua interface refinada e intuitiva e excelente tratamento de erros. Embora precise de prompts mais detalhados para obter os melhores resultados, sua interpretação literal das instruções cria resultados consistentes e previsíveis.
O agente ressalta a coleta de contexto ao oferecer aconselhamento financeiro, semelhante à prática profissional. No entanto, ele pode ser excessivamente conservador em respostas de zero amostra.
3) HuggingChat (6.5/10)
Nível de Dificuldade de Configuração: 2/5
Qualidade dos Resultados: 4.5/5
Esta plataforma de código aberto oferece personalização e opções de escolha de modelos sem igual. Para aqueles que buscam controle detalhado sobre cada aspecto, é uma excelente escolha, mas pode não ser adequada para aqueles que buscam facilidade de uso. (Pode-se comparar isso à comparação entre sistemas Linux e macOS). Sua complexa estrutura de tempo e integração de ferramentas demonstra suas capacidades avançadas.
Construímos um agente puramente, sem funcionalidades adicionais. Usamos o Nemomotron da Nvidia como modelo de linguagem de base, cuja qualidade de saída é suficiente para rivalizar com o ChatGPT. Para o campo de código aberto, isso é ótimo.
4) Claude (5.5/10)
Nível de Dificuldade de Configuração: 2.5/5
Qualidade dos Resultados: 3/5
A plataforma da Anthropic se destaca em áreas específicas, especialmente em tarefas que requerem processamento de contexto extenso e interpretação de código. Sua interface minimalista oculta suas capacidades complexas, mas o campo de instruções "opcional" pode confundir os usuários.
Nosso agente foi muito conservador e vago ao oferecer conselhos, mas demonstrou uma boa consciência de risco e pensamento estratégico. Ele precisa de prompts mais cuidadosos para realmente atingir seu potencial, mas se o teste usasse prompts adaptativos, isso contradiz a premissa de condições similares, tornando-se injusto.
5) Mistral AI (5/10)
Nível de Dificuldade de Configuração: 2.5/5
Qualidade dos Resultados: 2.5/5
Esta plataforma francesa oferece opções de aprendizado baseadas em exemplos e personalização profunda únicas. No entanto, sua interface voltada para desenvolvedores e problemas ocasionais de mudança de idioma criam barreiras para usuários não técnicos. Também requer ajustes nas configurações do agente para se adequar a diferentes modelos em tarefas como análise de imagens ou processamento de código. Isso não é ideal.
O consultor financeiro demonstrou potencial em design interativo, mas encontrou dificuldades na validação matemática básica, apresentando os piores resultados. Não é que a saída seja ruim, mas em testes de zero amostra, foi a menos satisfatória.
Análise Profunda
Considerando os rankings anteriores, não existe uma solução única; todas as plataformas têm suas próprias vantagens e desvantagens. Com algumas personalizações e prompts cuidadosos, os resultados de uma plataforma podem variar e até superar os de outras. No final, todos os modelos de linguagem (LLMs) têm seus próprios estilos de prompt.
Se você deseja entender mais sobre os motivos por trás de nossa classificação, aqui está uma análise mais profunda de nossas experiências e resultados dos agentes. Configuramos todos os agentes com o mesmo prompt do sistema, sem parâmetros ou funcionalidades adicionais, e fizemos a eles as mesmas perguntas básicas: "Eu tenho 25 mil dólares para investir e 30 mil dólares em dívidas. Elabore um plano financeiro para mim."
OpenAI

A interface do ChatGPT foi recentemente atualizada, o que na verdade tornou a operação mais complexa. As opções de criação do GPT agora estão escondidas em um menu, mas uma vez que você as encontra, elas oferecem dois caminhos: uma configuração conversacional, onde a IA ajuda a construir seu agente; e uma configuração manual, adequada para aqueles que sabem exatamente o que querem.
A plataforma GPT da OpenAI é uma "ferramenta suíça" completa — pode ler códigos, pesquisar na web, processar geração de imagens e análises. O processo de configuração guiado por IA torna-a especialmente adequada para iniciantes, embora para usuários avançados que exigem controle fino, pode parecer um pouco limitante. (Por exemplo, se você pedir ao modelo para ser mais específico ou detalhado, ele pode alterar todo o prompt do sistema, resultando em uma piora nos resultados.)
Ao usar o agente, o ChatGPT é muito direto, com uma interface clara e fácil de entender.

Esses agentes podem ler documentos nativamente e entender imagens, o que lhes confere uma certa vantagem sobre outras plataformas.
Agora, vamos falar sobre a qualidade do agente que você pode criar com prompts básicos. O consultor financeiro que criamos, MoneyGPT, nos mostrou um mestrado em resolução estruturada de problemas, apresentando um desempenho bastante impressionante.
Além de sua alocação de fundos precisa — "$20,000 para dívidas de alto juros" e uma divisão detalhada da carteira — o agente também demonstra raciocínio financeiro complexo. Ele oferece um roteiro em cinco etapas, não apenas uma lista, mas uma estratégia coerente que considera as necessidades de curto prazo e o planejamento a longo prazo.

A força desse agente está em equilibrar detalhes e contexto. Embora tenha recomendado uma carteira específica (40% investido no S&P 500, 30% em títulos), também explicou a lógica por trás da recomendação: "Pagar dívidas de alto juros é como obter um retorno garantido sobre o investimento." Essa consciência de contexto se estende ao planejamento de longo prazo, sugerindo revisões periódicas e ajustes de estratégia conforme as circunstâncias mudam.
No entanto, essa riqueza de informações também revela uma fraqueza potencial: pode sobrecarregar o usuário com muitos detalhes de uma só vez. Embora seja tecnicamente abrangente, a rápida entrega de alocações específicas, estratégias de investimento e planos de monitoramento pode parecer um pouco intimidante para iniciantes em finanças.
De modo geral, a plataforma de criação de agentes Gemini do Google se destaca esteticamente, com uma interface refinada e intuitiva, tornando o processo de criação do agente quase excessivamente simples. A interpretação literal das instruções pelo sistema ajuda a evitar confusões, e sua interface de usuário limpa elimina a sensação de opressão na criação de inteligência artificial.
No entanto, para obter resultados de qualidade, ele precisa de prompts mais detalhados. Ele não lida com as coisas de forma automática: prompts curtos levam a respostas de baixa qualidade.

Nos bastidores, ele possui funcionalidades robustas — integração de busca na web suportada pelo Google, análise de código e processamento de imagens, comparáveis às funcionalidades do ChatGPT, mas a maioria depende da tecnologia da Microsoft.
A interface do Gemini parece ter sido projetada por alguém que realmente entende a experiência do usuário. A interface orienta o usuário com rótulos claros, e todas as informações podem ser exibidas em uma única tela.

Esse modo refinado o torna especialmente atraente para usuários iniciantes, embora usuários experientes possam achar que falta um controle mais detalhado.
Nomeamos nosso agente de MoneyGem e pedimos que ele fornecesse um plano financeiro. Sua abordagem consultiva demonstra o método único de resolução de problemas do Google. Ele não deu uma resposta direta, mas fez perguntas como "Que tipo de dívida é essa?" e "Qual é a sua taxa de juros?" — mostrando que entende que o aconselhamento financeiro não é uma abordagem única.
Ele enfatiza a coleta de informações contextuais antes de oferecer conselhos, o que é consistente com práticas profissionais de planejamento financeiro, embora isso possa frustrar usuários que buscam respostas rápidas.

Uma resposta de zero-shot não é útil. O agente basicamente afirma que não entende o usuário e não pode oferecer bons conselhos financeiros. Quando solicitado a fazer suposições e forçado a fornecer um plano adequado para a maioria dos cenários, o agente gerou um esboço de plano muito conservador, mas não forneceu recomendações de investimento específicas.
No entanto, o MoneyGem acabou oferecendo uma recomendação de maximizar contas com benefícios fiscais, como 401(k) ou Roth IRA, para reduzir a carga tributária. Bom.
Você pode clicar aqui para ver nossa interação com o MoneyGem e experimentar o modelo pessoalmente clicando neste link.
Mistral AI
O processo de configuração do agente do Mistral é um pouco complicado, afastando-se da simplicidade. A ferramenta de criação de agentes está escondida em seu console de desenvolvedor, com opções de personalização profunda que podem confundir iniciantes, mas que agradam os usuários que gostam de experimentar.
A interface de construção do agente não faz parte do LeChat (interface de chat), mas uma vez que o agente é criado, ele aparece lá.

O que realmente gostamos é a capacidade de moldar o comportamento e o estilo de resposta do agente por meio de entradas de exemplo, uma funcionalidade que atualmente outras plataformas não oferecem. No entanto, há um bug estranho: ao criar o agente, a UI de repente mudou para francês, talvez porque a empresa seja francesa. De qualquer forma, não conseguimos voltar para o inglês ou espanhol.
Uma vez que o agente é criado, o usuário deve chamá-lo na interface de chat normal para usá-lo. O usuário precisa sair do Le Plateforme e entrar no Le Chat, o que não é a operação mais intuitiva. No entanto, a UI do agente é bastante direta, parecendo com outros chatbots de IA.

Criamos nosso agente e o nomeamos de Le Money, em homenagem às raízes francesas do Mistral. Seu desempenho demonstra claramente a abordagem universal do Mistral em resolução de problemas. Ele sugeriu "manter $10,000 como fundo de emergência, $15,000 para pagar dívidas, e $10,000 para investir", que parece direto, mas também indica que o agente carece de alguma validação matemática básica.
Um total de $35,000 excede os fundos disponíveis em $10,000, o que é um erro básico, e alguns modelos de linguagem podem cometer esse tipo de erro ao priorizar a correção conceitual em vez da precisão numérica.
No entanto, devemos notar que os LLMs que se destacam já apresentaram melhorias significativas e não cometem frequentemente esses erros — pelo menos não com a mesma frequência que o Mistral.

Além disso, o plano do Le Money não é muito detalhado, mas é o único agente que oferece perguntas de acompanhamento que podem tornar a interação mais fluida e ajudar a entender melhor as necessidades do usuário.
O plano completo do LeMoney pode ser visualizado aqui, e o agente pode ser testado aqui.
Anthropic

O projeto da Claude não parece uma plataforma de criação de agentes, mas sim um sistema complexo de execução de tarefas. A interface é minimalista, quase excessivamente simples, e não muito intuitiva.
Essa interface minimalista pode confundir alguns usuários. A plataforma fornece uma configuração básica e um campo de instrução "opcional", que parece tanto desnecessário quanto crucial: se a instrução é marcada como opcional, como o agente de IA sabe o que deve fazer?
Sua interface minimalista parece um pouco estranha, mas a Anthropic nunca foi conhecida por seu design de UI. A mesma janela usada para configurar o modelo também é usada para enviar comandos. Suas funcionalidades se concentram principalmente na interpretação de código de texto, sem outras opções. Pesquisa na web, processamento de imagens e geração são recursos avançados deixados para os concorrentes pela Anthropic.
Nosso agente, chamado MoneyClaude, não pode ser testado publicamente, pois a Anthropic não permite. Ele adota uma abordagem muito conservadora ao oferecer conselhos financeiros, e embora as respostas sejam tecnicamente corretas, o conteúdo é muito vago — por exemplo, "equilibrar a redução da dívida e a necessidade de poupança".

Ele pediu mais informações, mas pelo menos na ausência dessas informações, ofereceu uma estratégia muito genérica sem necessidade de mais interações, o que parece mais ideal do que a abordagem do Google.
Hugging Face

Esta plataforma de código aberto se destaca, sendo um paraíso para usuários avançados — e um pesadelo potencial para iniciantes. É a única que permite aos usuários escolher seus modelos de linguagem preferidos, oferecendo controle sem precedentes para definir a base do agente.
Além disso, os usuários podem integrar dezenas de ferramentas diferentes em seus agentes, mas apenas três podem ser ativadas de cada vez. Essa limitação força os usuários a considerar cuidadosamente quais funcionalidades são mais importantes para cada caso específico, mas isso é algo que nenhum outro modelo pode oferecer.
É a experiência mais personalizável entre todas as interfaces, com muitas configurações ajustáveis. O resultado é que esta plataforma pode criar agentes mais poderosos e profissionais do que seus concorrentes, mas só terá sucesso nas mãos de quem entender completamente como operar.
Os usuários podem experimentar seus agentes no HuggingChat — sem dúvida um sonho para usuários avançados. Uma vez que o agente é criado, é muito fácil de usar. A interface exibe um grande cartão com o nome do agente, descrição e foto. Ele também permite que os usuários compartilhem o link do agente e ajustem suas configurações, tudo isso pode ser feito diretamente no cartão.

Após colocar nosso agente HuggingMoney à prova, notamos que sua maneira de lidar com prazos demonstra uma compreensão mais profunda da psicologia do planejamento financeiro. Ele divide o planejamento em "curto prazo (0-24 meses), médio prazo (24-60 meses) e longo prazo (mais de 60 meses)", o que está alinhado com as práticas profissionais de planejamento financeiro.
O agente sugere investir "$0-$5,000 em ferramentas de alta liquidez e baixo risco", enquanto mantém pagamentos ativos de dívida entre "$1,000-$1,500" por mês. Essa recomendação, à primeira vista, demonstra uma compreensão detalhada da gestão de fluxo de caixa.

Outro aspecto interessante é que ele combina ferramentas com recomendações teóricas. Além de sugerir a regra 50/30/20, recomenda aplicativos de orçamento específicos e enfatiza a otimização fiscal — construindo uma ponte entre estratégia de alto nível e execução diária. O principal ponto negativo? Ele fez suposições sobre taxas de juros da dívida sem buscar confirmação.
Para oferecer conselhos úteis, ele fez suposições excessivamente levianas sobre muitas coisas. Essa questão, o impulso de querer fornecer uma resposta a qualquer custo, pode ser abordada com prompts mais precisos, mas é algo a ser observado.
