Điều gì sẽ xảy ra nếu một tác nhân AI có thể kiếm tiền từ một sai lầm mà nó đã từng mắc?
Hôm nay, một sự cố của tác nhân có thể được lưu giữ như một quỹ đạo: chuỗi các lệnh gọi mô hình, lệnh gọi công cụ, hành động và phản hồi từ môi trường. AgentLoop của Alibaba Cloud đã biến các dấu vết này thành các bản ghi có cấu trúc để đánh giá và huấn luyện, trong khi AgentRx của Microsoft có thể xác định bước lỗi then chốt trong một quỹ đạo thất bại.
Giờ hãy thay đổi một điều.
Thay vì xóa quỹ đạo thất bại đó sau khi đã sửa tác nhân, hãy tưởng tượng việc gắn thêm một mô tả nhỏ vào nó: đã xảy ra chuyện gì, nó đã thất bại ở đâu, điều kiện nào gây ra nó, và cuối cùng điều gì đã sửa lại. Một tác nhân khác đang làm một nhiệm vụ tương tự có thể trả tiền để truy cập vào thất bại đó trước khi mắc lại cùng một sai lầm. Tác nhân ban đầu đã biến một quyết định tệ thành một mẩu thông tin huấn luyện.
Điều đó tạo ra một vòng lặp kinh tế kỳ lạ: thất bại → quỹ đạo có cấu trúc → tri thức có thể tái sử dụng → thanh toán. IBM’s Agent Trajectory Explorer đã coi các quỹ đạo của tác nhân như những tư liệu có thể được kiểm tra và gắn nhãn để lấy phản hồi. Phần thiếu là thị trường xung quanh thông tin đó. Và điều đó khiến tôi tự hỏi: liệu các tác nhân cuối cùng có cạnh tranh không chỉ bằng việc đúng, mà còn bằng việc có hồ sơ giá trị nhất về việc mình đã sai?
Với người dùng, điều này có thể thay đổi ý nghĩa của “độ tin cậy của AI”. Bạn không chỉ muốn một tác nhân có thành tích thành công tốt. Bạn có thể muốn quyền truy cập vào một thư viện các trường hợp thất bại đã được xác thực trước khi trao cho nó quyền hạn thực tế. Một thương vụ thất bại, một lệnh gọi công cụ sai hoặc một quy trình bị hỏng sẽ không còn chỉ là một khoản lỗ; phần giải thích có cấu trúc của nó có thể trở thành thứ mà một tác nhân khác dùng để tránh lặp lại.
Phần thú vị không phải là AI học từ sai lầm của nó. Các hệ thống AI đã sử dụng dấu vết, phản hồi và phân tích lỗi. Điều “What If” lớn hơn là: điều gì xảy ra khi sai lầm trở thành tài sản có thể chuyển nhượng? Một tác nhân trả tiền cho tác nhân khác để học cách không nên làm, và đột nhiên, cách nhanh nhất để cải thiện một nền kinh tế AI có thể là mua các thất bại của tất cả những người đi trước.
Hôm nay, một sự cố của tác nhân có thể được lưu giữ như một quỹ đạo: chuỗi các lệnh gọi mô hình, lệnh gọi công cụ, hành động và phản hồi từ môi trường. AgentLoop của Alibaba Cloud đã biến các dấu vết này thành các bản ghi có cấu trúc để đánh giá và huấn luyện, trong khi AgentRx của Microsoft có thể xác định bước lỗi then chốt trong một quỹ đạo thất bại.
Giờ hãy thay đổi một điều.
Thay vì xóa quỹ đạo thất bại đó sau khi đã sửa tác nhân, hãy tưởng tượng việc gắn thêm một mô tả nhỏ vào nó: đã xảy ra chuyện gì, nó đã thất bại ở đâu, điều kiện nào gây ra nó, và cuối cùng điều gì đã sửa lại. Một tác nhân khác đang làm một nhiệm vụ tương tự có thể trả tiền để truy cập vào thất bại đó trước khi mắc lại cùng một sai lầm. Tác nhân ban đầu đã biến một quyết định tệ thành một mẩu thông tin huấn luyện.
Điều đó tạo ra một vòng lặp kinh tế kỳ lạ: thất bại → quỹ đạo có cấu trúc → tri thức có thể tái sử dụng → thanh toán. IBM’s Agent Trajectory Explorer đã coi các quỹ đạo của tác nhân như những tư liệu có thể được kiểm tra và gắn nhãn để lấy phản hồi. Phần thiếu là thị trường xung quanh thông tin đó. Và điều đó khiến tôi tự hỏi: liệu các tác nhân cuối cùng có cạnh tranh không chỉ bằng việc đúng, mà còn bằng việc có hồ sơ giá trị nhất về việc mình đã sai?
Với người dùng, điều này có thể thay đổi ý nghĩa của “độ tin cậy của AI”. Bạn không chỉ muốn một tác nhân có thành tích thành công tốt. Bạn có thể muốn quyền truy cập vào một thư viện các trường hợp thất bại đã được xác thực trước khi trao cho nó quyền hạn thực tế. Một thương vụ thất bại, một lệnh gọi công cụ sai hoặc một quy trình bị hỏng sẽ không còn chỉ là một khoản lỗ; phần giải thích có cấu trúc của nó có thể trở thành thứ mà một tác nhân khác dùng để tránh lặp lại.
Phần thú vị không phải là AI học từ sai lầm của nó. Các hệ thống AI đã sử dụng dấu vết, phản hồi và phân tích lỗi. Điều “What If” lớn hơn là: điều gì xảy ra khi sai lầm trở thành tài sản có thể chuyển nhượng? Một tác nhân trả tiền cho tác nhân khác để học cách không nên làm, và đột nhiên, cách nhanh nhất để cải thiện một nền kinh tế AI có thể là mua các thất bại của tất cả những người đi trước.
