GitHub 最近突然爆紅了一個很有意思的 AI Browser Agent。
名字叫 Jev Ultrafast。
專案 9 月 16 日才出現,上線約 15 小時時還不到 1,000 Stars。
幾天後:
9/16:不到 1,000 Stars
↓
9/21:約 6,800
↓
現在:突破 10,000 Stars
短短 6 天,增長速度非常誇張。
但真正值得注意的不是 GitHub Stars,而是它對 Browser Agent 做了一個很不一樣的選擇。
目前很多 AI Browser Agent 操作網頁的方式,大致是:
截圖
→ AI 看畫面
→ 找按鈕
→ 點擊
→ 再截圖
→ 再判斷下一步
這種方法很直覺,但也意味著大量視覺處理、模型推理與操作成本。
Jev 的思路不同。
它不需要讓 AI 不斷「看螢幕」,而是直接把網頁 DOM 與可操作元素整理成結構化的 Action Space。
模型看到的更像是:
按鈕 A
輸入框 B
選項 C
然後只需要決定下一步執行什麼動作。
真正需要產生文字時,才呼叫 LLM。
官方展示的一個 Google Flights Demo 中,從 Zurich 搜尋到 London 的航班,大約 7.1 秒完成。
官方公開的測試還顯示,部分任務的 browser protocol calls 可以大幅減少。
這件事讓我覺得很有意思。
過去大家談 AI Agent,注意力幾乎都放在:
模型是不是更聰明?
但真正大規模部署 Agent 之後,另一個問題可能更重要:
完成一個任務,到底需要多少次模型推理、多少 Token、多少秒,以及多少錢?
如果 Browser Agent 可以少「看」很多次、少「想」很多次,卻完成同樣的工作,
下一場 Agent 競爭可能不只是 Intelligence。
而是:
Efficiency。
名字叫 Jev Ultrafast。
專案 9 月 16 日才出現,上線約 15 小時時還不到 1,000 Stars。
幾天後:
9/16:不到 1,000 Stars
↓
9/21:約 6,800
↓
現在:突破 10,000 Stars
短短 6 天,增長速度非常誇張。
但真正值得注意的不是 GitHub Stars,而是它對 Browser Agent 做了一個很不一樣的選擇。
目前很多 AI Browser Agent 操作網頁的方式,大致是:
截圖
→ AI 看畫面
→ 找按鈕
→ 點擊
→ 再截圖
→ 再判斷下一步
這種方法很直覺,但也意味著大量視覺處理、模型推理與操作成本。
Jev 的思路不同。
它不需要讓 AI 不斷「看螢幕」,而是直接把網頁 DOM 與可操作元素整理成結構化的 Action Space。
模型看到的更像是:
按鈕 A
輸入框 B
選項 C
然後只需要決定下一步執行什麼動作。
真正需要產生文字時,才呼叫 LLM。
官方展示的一個 Google Flights Demo 中,從 Zurich 搜尋到 London 的航班,大約 7.1 秒完成。
官方公開的測試還顯示,部分任務的 browser protocol calls 可以大幅減少。
這件事讓我覺得很有意思。
過去大家談 AI Agent,注意力幾乎都放在:
模型是不是更聰明?
但真正大規模部署 Agent 之後,另一個問題可能更重要:
完成一個任務,到底需要多少次模型推理、多少 Token、多少秒,以及多少錢?
如果 Browser Agent 可以少「看」很多次、少「想」很多次,卻完成同樣的工作,
下一場 Agent 競爭可能不只是 Intelligence。
而是:
Efficiency。
