O GitHub ficou recentemente muito popular por um Agent de Browser de IA bem interessante.

O nome é Jev Ultrafast.

O projeto apareceu apenas em 16 de setembro; depois de cerca de 15 horas online, ainda não tinha chegado a 1.000 Stars.

Alguns dias depois:

16/9: menos de 1.000 Stars

21/9: cerca de 6.800

Agora: ultrapassou 10.000 Stars

Em apenas 6 dias, a velocidade de crescimento é realmente absurda.

Mas o que realmente vale a pena notar não são as Stars do GitHub, e sim a escolha bem diferente que ele fez para o seu Browser Agent.

Atualmente, a forma como muitos agentes de navegador operam as páginas da web é mais ou menos assim:

capturar tela
→ a IA vê a imagem
→ encontrar o botão
→ clicar
→ capturar tela de novo
→ julgar o próximo passo

Esse método é bem intuitivo, mas também implica em muito processamento visual, inferência do modelo e custos de operação.

A ideia da Jev é diferente.

Ela não precisa que a IA fique “olhando a tela” continuamente; em vez disso, organiza o DOM da página e os elementos acionáveis em um Action Space estruturado.

O que o modelo “vê” é mais como:

botão A
campo de entrada B
opção C

E então basta decidir qual ação executar no próximo passo.

Só quando for realmente necessário gerar texto é que ela chama o LLM.

Em uma demonstração oficial do Google Flights, na qual se faz uma busca de Zurich até London, leva cerca de 7,1 segundos.

Os testes publicados pela própria equipe também mostram que, em algumas tarefas, as chamadas do protocolo do browser podem ser reduzidas bastante.

Isso, sinceramente, me parece muito interessante.

No passado, quando as pessoas falavam de AI Agent, quase toda a atenção era voltada para:

será que o modelo é mais inteligente?

Mas, depois que os Agents forem implantados em grande escala, um outro problema pode ser ainda mais importante:

para concluir uma tarefa, quantas vezes precisa rodar inferência do modelo, quantos Tokens, quantos segundos e quanto custa?

Se um Browser Agent puder “olhar” menos vezes e “pensar” menos vezes, mas ainda assim concluir o mesmo trabalho,

a próxima competição entre Agents talvez não seja só sobre inteligência.

E sim sobre:

Eficiência.