GitHub 最近突然爆紅了一個很有意思的 AI Browser Agent。

名字叫 Jev Ultrafast。

專案 9 月 16 日才出現,上線約 15 小時時還不到 1,000 Stars。

幾天後:

9/16:不到 1,000 Stars

9/21:約 6,800

現在:突破 10,000 Stars

短短 6 天,增長速度非常誇張。

但真正值得注意的不是 GitHub Stars,而是它對 Browser Agent 做了一個很不一樣的選擇。

目前很多 AI Browser Agent 操作網頁的方式,大致是:

截圖
→ AI 看畫面
→ 找按鈕
→ 點擊
→ 再截圖
→ 再判斷下一步

這種方法很直覺,但也意味著大量視覺處理、模型推理與操作成本。

Jev 的思路不同。

它不需要讓 AI 不斷「看螢幕」,而是直接把網頁 DOM 與可操作元素整理成結構化的 Action Space。

模型看到的更像是:

按鈕 A
輸入框 B
選項 C

然後只需要決定下一步執行什麼動作。

真正需要產生文字時,才呼叫 LLM。

官方展示的一個 Google Flights Demo 中,從 Zurich 搜尋到 London 的航班,大約 7.1 秒完成。

官方公開的測試還顯示,部分任務的 browser protocol calls 可以大幅減少。

這件事讓我覺得很有意思。

過去大家談 AI Agent,注意力幾乎都放在:

模型是不是更聰明?

但真正大規模部署 Agent 之後,另一個問題可能更重要:

完成一個任務,到底需要多少次模型推理、多少 Token、多少秒,以及多少錢?

如果 Browser Agent 可以少「看」很多次、少「想」很多次,卻完成同樣的工作,

下一場 Agent 競爭可能不只是 Intelligence。

而是:

Efficiency。