Các tác nhân AI đang tiến hóa từ những hệ thống chỉ đơn giản phản hồi thành những hệ thống có thể suy luận và thực thi các tác vụ phức tạp trong thế giới thực.

Chúng đang vượt ra ngoài việc trả lời câu hỏi và bắt đầu duyệt web, làm việc với tệp, tương tác với ứng dụng, sử dụng API và thực hiện các tác vụ nhiều bước. Nhưng khi các tác nhân có được nhiều quyền tự chủ hơn, một câu hỏi quan trọng xuất hiện: làm thế nào để trao cho AI khả năng hành động mà không đánh đổi an ninh, độ tin cậy và quyền kiểm soát của người dùng?

@NEAR Protocol ’s IronClaw 1.0 mang đến một cách tiếp cận thú vị cho thách thức này bằng cách thiết kế lại cách một tác nhân AI suy nghĩ, hành động và duy trì tiến trình của nó.

IronClaw 1.0: Tách suy nghĩ khỏi hành động

Ở cốt lõi của #IronClaw 1.0 là một ý tưởng kiến trúc đơn giản nhưng quan trọng: tác nhân đưa ra quyết định không nên có quyền kiểm soát không bị hạn chế đối với các hành động mà nó thực hiện.

IronClaw tách quá trình suy luận khỏi việc thực thi thông qua một lớp guard chuyên biệt.

Tác nhân có thể suy luận về một nhiệm vụ, xác định điều gì cần xảy ra và chọn các công cụ phù hợp. Sau đó, lớp “guard” sẽ cung cấp một cơ chế phối hợp có kiểm soát giữa quá trình ra quyết định đó và việc thực thi trong thế giới thực.

Điều này tạo ra một lớp bổ sung, nơi các hành động có thể được đánh giá và, khi cần thiết, được phê duyệt rõ ràng trước khi diễn ra.

Đối với môi trường doanh nghiệp, sự phân biệt này đặc biệt quan trọng. Một tác nhân tương tác với email, tệp, trang web, thông tin xác thực hoặc các hệ thống kinh doanh cần nhiều hơn “chỉ” là trí tuệ. Nó cần các ranh giới có thể dự đoán được.

Hiệu suất Benchmark nổi bật

Kiến trúc chỉ có giá trị khi nó chuyển hóa thành hiệu suất thực sự.

IronClaw 1.0 chứng minh năng lực trên ba benchmark sử dụng mô hình nền DeepSeek-V4-Flash.

  • PinchBench: 93.5% IronClaw dẫn đầu bảng benchmark, vượt Hermes và OpenClaw.

  • ClawBench: 88.6% Ngoài ra, nó cũng xếp hạng thứ nhất trong các tác vụ tác nhân nhiều bước, vượt trội OpenClaw và Hermes.

  • OfficeQA: 76.4% IronClaw lại một lần nữa dẫn đầu ở các tác vụ tập trung vào việc suy luận dựa trên thông tin nơi làm việc và doanh nghiệp.

So sánh benchmark cho thấy IronClaw duy trì vị trí dẫn đầu trên cả ba lần đánh giá.


Trên ClawBench, IronClaw đạt 88.6%, vượt Hermes ở 84% và OpenClaw ở 82.5%.

Trên OfficeQA, IronClaw đạt 76.4%, so với 73.2% của Hermes và 72.4% của OpenClaw.

Trên PinchBench, IronClaw ghi nhận 93.5%, so với 90% của Hermes và 88.6% của OpenClaw.

Kết quả nêu bật khả năng của IronClaw trong việc duy trì hiệu suất ổn định trên nhiều loại khối lượng công việc của tác nhân.

Điểm quan trọng là các benchmark này bao phủ những thách thức khác nhau. Thay vì chỉ đo xem AI phản hồi prompt tốt đến mức nào, chúng đánh giá mức độ hiệu quả của một tác nhân khi thực hiện nhiệm vụ trong các môi trường thực tế. Do đó, các kết quả nhất quán của IronClaw ở vị trí đầu tiên cung cấp bằng chứng định lượng cho cách tiếp cận của nó trong việc xây dựng các tác nhân AI có năng lực hơn.

Được thiết kế cho quy trình làm việc AI trong thế giới thực

Giá trị của IronClaw cũng đến từ hạ tầng bao quanh kiến trúc lõi của nó.

An toàn theo thiết kế

Các hành động nhạy cảm có thể cần phê duyệt rõ ràng, giúp người dùng có quyền kiểm soát lớn hơn đối với những gì tác nhân được phép thực thi.

Trạng thái bền vững

Các mốc kiểm tra liên tục cho phép IronClaw duy trì tiến độ. Nếu một nhiệm vụ bị gián đoạn hoặc cần phê duyệt, tác nhân có thể tiếp tục thay vì phải bắt đầu lại từ đầu.

Bộ nhớ đa kênh

Trợ lý có thể hoạt động trên CLI, Web, Slack và Telegram trong khi vẫn duy trì cùng các quy tắc về bộ nhớ và an toàn.


Cô lập nhóm

Các tổ chức có thể tách biệt môi trường và quy trình làm việc, giúp IronClaw phù hợp hơn cho các nhóm xử lý các dự án, công cụ hoặc mức độ truy cập khác nhau.


Cách tiếp cận đa kênh của IronClaw cho thấy các trợ lý AI có thể vượt ra khỏi một giao diện duy nhất trong khi vẫn duy trì tính liên tục giữa các môi trường khác nhau.


Thay vì coi mỗi kênh là một tương tác riêng lẻ, cùng một trợ lý có thể hoạt động trên CLI, Web, Slack và Telegram trong khi vẫn giữ nguyên bộ nhớ, trạng thái và các quy tắc an toàn của mình.


Điều này tạo ra một trải nghiệm kết nối hơn cho người dùng và các nhóm làm việc trên nhiều nền tảng.

NEAR AI và vai trò của staking

IronClaw 1.0 nằm trong một hướng đi rộng hơn xung quanh #NEARAI : xây dựng hạ tầng AI nơi trí tuệ có thể trở nên riêng tư hơn, có thể xác minh được hơn và do người dùng sở hữu.

Tầm nhìn này đòi hỏi nhiều hơn các mô hình AI có năng lực. Nó cũng cần hạ tầng có thể hỗ trợ các ứng dụng phi tập trung, tác nhân và dịch vụ một cách đáng tin cậy.

Đó là lúc NEAR staking trở nên phù hợp.

Staking không chỉ đơn thuần là kiếm lợi suất. Ở cấp độ mạng, NEAR được stake hỗ trợ hệ thống validator giúp bảo vệ blockchain nền tảng. Các validator chịu trách nhiệm duy trì mạng và xử lý giao dịch, trong khi các khuyến khích kinh tế giúp đồng bộ lợi ích của người tham gia với bảo mật của mạng.

Đối với AI phi tập trung, nền tảng này rất quan trọng.

Các tác nhân AI cần một hạ tầng mà họ có thể tin cậy khi chúng ngày càng trở nên mạnh mẽ và tự chủ hơn. Khi hệ sinh thái tiến tới các hệ thống tác nhân như OpenClaw sắp tới, mối quan hệ giữa hạ tầng AI và bảo mật mạng phi tập trung ngày càng trở nên quan trọng.


Bức tranh lớn hơn

IronClaw 1.0 hướng tới một tương lai nơi các tác nhân AI được đánh giá dựa trên nhiều hơn việc chúng có thể phản hồi thông minh đến đâu.

Tiêu chuẩn tiếp theo cũng sẽ liên quan đến việc chúng hành động an toàn đến mức nào, duy trì tiến độ một cách đáng tin cậy ra sao, hoạt động nhất quán trên nhiều kênh ra sao và người dùng giữ được bao nhiêu quyền kiểm soát.

#NEARAI represents tầm nhìn rộng hơn, trong khi staking cung cấp một nền tảng bảo mật quan trọng cho hạ tầng phi tập trung bên dưới.

Sự kết hợp này rất thuyết phục: AI có thể suy nghĩ, hạ tầng có thể phối hợp, các mạng lưới có thể được bảo mật nhờ sự tham gia kinh tế, và người dùng có thể duy trì quyền sở hữu lớn hơn đối với các hệ thống mà họ phụ thuộc.

Vì vậy, IronClaw 1.0 có thể được xem là nhiều hơn một bản phát hành tác nhân AI khác. Đó là cái nhìn về việc hạ tầng cho một hệ sinh thái AI có năng lực hơn, an toàn hơn và phi tập trung hơn có thể sẽ trông như thế nào.

Tham khảo

  • IronClaw 1.0: https://near.ai/blog/introducing-ironclaw-1-0

  • NEAR AI Staking: https://www.near.ai/blog/staking-for-near-ai

  • NEAR Staking: https://docs.near.org/protocol/network/staking

  • NEAR AI Infrastructure: https://near.ai/blog/near-ai-launches-ironclaw-confidential-gpu-marketplace-and-multimodal-confidential-inference