Gần đây trên GitHub bất ngờ “bùng nổ” một AI Browser Agent rất thú vị.

Tên là Jev Ultrafast.

Dự án mãi đến ngày 16 tháng 9 mới xuất hiện, lúc vừa lên sóng được khoảng 15 giờ thì còn chưa đến 1.000 Stars.

Vài ngày sau:

9/16: Chưa đến 1.000 Stars

9/21: Khoảng 6.800

Hiện tại: Vượt mốc 10.000 Stars

Chỉ trong 6 ngày ngắn ngủi, tốc độ tăng trưởng cực kỳ đáng kinh ngạc.

Nhưng điều đáng chú ý thực sự không phải số Stars trên GitHub, mà là việc nó đã đưa ra một lựa chọn rất khác biệt cho Browser Agent.

Hiện tại, đa số AI Browser Agent khi thao tác trên trang web thường làm như sau:

Chụp màn hình
→ AI xem hình ảnh
→ Tìm nút
→ Nhấn
→ Chụp màn hình lại
→ Đánh giá bước tiếp theo

Cách này rất trực quan, nhưng đồng nghĩa với việc phải xử lý thị giác rất nhiều, suy luận mô hình và tốn chi phí thao tác.

Jev có cách nghĩ khác.

Nó không cần để AI liên tục “nhìn màn hình”, mà thay vào đó trực tiếp sắp xếp DOM của trang web và các phần tử có thể thao tác thành một Action Space dạng cấu trúc.

Thứ mô hình nhìn thấy giống như:

Nút A
Ô nhập B
Tùy chọn C

Sau đó chỉ cần quyết định bước tiếp theo nên thực hiện hành động gì.

Chỉ khi nào thực sự cần tạo văn bản thì mới gọi LLM.

Trong một demo Google Flights của phía chính thức, từ Zurich tìm đến London mất khoảng 7,1 giây.

Các bài kiểm thử được công bố chính thức cũng cho thấy rằng ở một số tác vụ, số lần browser protocol calls có thể giảm đáng kể.

Chuyện này khiến tôi thấy rất thú vị.

Trong quá khứ, khi mọi người nói về AI Agent, gần như sự chú ý đều tập trung vào:

Liệu mô hình có thông minh hơn không?

Nhưng sau khi triển khai Agent ở quy mô lớn, vấn đề có thể quan trọng hơn là:

Để hoàn thành một nhiệm vụ thì cần bao nhiêu lần suy luận mô hình, bao nhiêu Token, bao nhiêu giây và tốn bao nhiêu tiền?

Nếu Browser Agent có thể ít phải “nhìn” hơn rất nhiều lần, ít “nghĩ” hơn rất nhiều lần mà vẫn hoàn thành công việc tương tự,

thì cuộc cạnh tranh Agent tiếp theo có thể không chỉ là Intelligence.

Mà là:

Efficiency.