Ngày 25 tháng 2, một đội ngũ mang tên Nous Research đã lén lút phát hành một phiên bản v0.1.0 trên GitHub. Ban đầu, mô hình Hermes chỉ có một dòng lệnh cài đặt và một câu định vị sản phẩm: "Một đại lý phát triển cùng bạn."

Khi đó rất ít người chú ý đến nó, ngay cả khi Nous Research có một danh tiếng nhất định trong lĩnh vực mô hình, dòng mô hình Hermes của họ đã tích lũy được 33 triệu lượt tải xuống trên HuggingFace, nhưng toàn bộ cộng đồng nhà phát triển lại đang bị cuốn hút bởi OpenClaw "tiểu long xà". Trong 33 ngày, nó đã vượt qua React để trở thành dự án đầu tiên trong lịch sử, "tiểu long xà" trở thành dự án tăng sao nhanh nhất trong lịch sử GitHub, đạt đỉnh mỗi giờ 710 sao, nhưng ngay lúc đó có các nhà nghiên cứu an ninh đang liên tục công bố lỗ hổng với tốc độ trung bình 2.2 CVE mỗi ngày trong cùng một khoảng thời gian, tổng cộng 138 lỗ hổng an ninh trong 63 ngày. Toàn bộ cộng đồng bắt đầu suy nghĩ lại một câu hỏi: Liệu thứ này có thể sử dụng trong môi trường sản xuất hay không?

Trong bối cảnh như vậy, Hermes Agent, cũng là một sản phẩm cạnh tranh, cuối cùng đã có cơ hội và đã bước vào giai đoạn tăng trưởng nhanh đầu tiên của mình.

Hermes đã viết vào mã của mình một công cụ di chuyển từ OpenClaw, những nhà phát triển đã rời bỏ OpenClaw cần một nơi để dừng chân, Hermes Agent đã trở thành một lựa chọn tốt được truyền miệng.

Vậy là từ đầu tháng 3, Hermes Agent đã nhảy vào GitHub Trending, có lúc lên đến vị trí thứ 11, số sao vượt qua 2200. AwesomeAgents gọi nó là "Agent mã nguồn mở tham vọng nhất từ năm 2026 đến nay", hiện tại GitHub của Hermes có 69.9k sao và 9k fork.

Hôm nay, nhịp điệu BlcokBeats sẽ nói chuyện với mọi người về sự khác biệt của Agent này.

Hermes Agent là gì?

Hermes Agent là một AI thông minh tự tiến hóa được xây dựng bởi Nous Research, và cũng là Agent duy nhất hiện tại được tích hợp vòng lặp học tập.

Nó có khả năng tự động tạo kỹ năng từ kinh nghiệm sử dụng, liên tục cải thiện những kỹ năng này trong quá trình sử dụng, chủ động củng cố kiến thức thành tài sản có thể tái sử dụng, truy xuất lịch sử đối thoại của chính nó, và ngày càng hiểu sâu hơn về bạn qua nhiều phiên giao dịch.

Vì vậy, nói một cách đơn giản, ưu điểm lớn nhất của Hermes Agent là: càng dùng càng thông minh, càng dùng càng thuận tay.

Vị trí của nó không phải là một trợ lý lập trình gắn liền với IDE, cũng không phải là một gói trò chuyện cho một API đơn lẻ, mà là một Agent tự trị thực sự, trú ngụ trên server của bạn, có khả năng nhớ những gì nó đã học, thời gian hoạt động càng lâu thì khả năng càng mạnh.

Nous Research từ đầu đã định vị mình là một phòng thí nghiệm AI ưu tiên mã nguồn mở và phi tập trung, mục tiêu là xây dựng AI mà người dùng có thể tự kiểm soát, chứ không phải tập trung trí tuệ vào vài công ty đóng cửa. Công việc ban đầu của họ tập trung vào chuỗi mô hình Hermes, đồng thời đầu tư mạnh vào hạ tầng và hệ thống, cũng như khám phá công nghệ DisTrO cho việc huấn luyện mô hình trên GPU tiêu dùng phân tán toàn cầu, cũng như các môi trường mô phỏng tương tác đa tác nhân như WorldSim, Doomscroll.

Đội ngũ Hermes Agent chính là nhóm người đứng sau các mô hình như Nomos, Psyche.

Những công cụ hữu ích là gì?

Cơ chế cốt lõi nhất của Hermes Agent là hệ thống trí nhớ và hệ thống kỹ năng của nó. Agent duy trì hai tệp tin cốt lõi được tinh giản: MEMORY.md lưu trữ thông tin môi trường, quy ước và kinh nghiệm tóm tắt từ các nhiệm vụ trước; USER.md lưu trữ sở thích và phong cách giao tiếp của bạn. Hai tệp này sẽ tự động được tiêm vào hệ thống nhắc nhở mỗi khi bắt đầu phiên giao dịch, tương đương với "trí nhớ làm việc dài hạn" của Agent. Hơn nữa, tất cả các phiên giao dịch lịch sử đều được lưu vào cơ sở dữ liệu tìm kiếm toàn văn SQLite, giúp Agent có thể truy xuất nội dung đối thoại từ vài tuần trước.

Về hệ thống kỹ năng, mỗi khi hoàn thành nhiệm vụ phức tạp (thường là trên 5 lần gọi công cụ), Agent sẽ tự tạo một tài liệu Markdown có cấu trúc "tài liệu kỹ năng", ghi lại các bước thực hiện, nội dung đã biết và cách xác minh, để sử dụng lại cho tương lai. Tài liệu kỹ năng tuân theo mô hình tiết lộ dần dần: Agent mặc định chỉ xem tên và mô tả kỹ năng (khoảng 3000 token), chỉ tải nội dung đầy đủ của một kỹ năng khi cần, từ đó kiểm soát tiêu thụ token.

Về công cụ, Hermes Agent tích hợp hơn 40 công cụ, bao gồm tìm kiếm web, tự động hóa trình duyệt, hiểu hình ảnh, tạo hình ảnh, chuyển văn bản thành giọng nói, và còn hỗ trợ thiết lập nhiệm vụ định kỳ bằng ngôn ngữ tự nhiên, cho phép Agent tự động thực hiện các công việc định kỳ như tạo báo cáo, sao lưu dữ liệu, giám sát hệ thống trong tình trạng không có người giám sát.

Trong số các công cụ phổ biến nhất, tức là những công cụ mà người dùng cộng đồng sử dụng nhiều nhất, phản hồi nhiều nhất, và dựa trên cấu trúc chức năng của Hermes cùng nhu cầu điển hình từ cộng đồng nhà phát triển, đứng đầu là một số công cụ này:

Hindsight là công cụ đơn lẻ hot nhất trong hệ sinh thái hiện tại, là plugin trí nhớ lâu dài được Hermes chính thức khuyến nghị. Nó tự động hồi phục ngữ cảnh liên quan trước mỗi lần gọi LLM, hỗ trợ PostgreSQL cục bộ hoặc triển khai đám mây, đã được tích hợp vào Hermes như một Nhà cung cấp bộ nhớ gốc.

Anthropic-Cybersecurity-Skills là gói kỹ năng cao sao nhất trong hệ sinh thái, bao gồm hơn 753 kỹ năng an ninh mạng có cấu trúc, hoàn toàn ánh xạ khung MITRE ATT&CK, phù hợp cho nghiên cứu an ninh và tình huống thử nghiệm xâm nhập.

mission-control là bảng điều khiển phối hợp Agent hot nhất trong hệ sinh thái hiện nay, hỗ trợ quản lý đội tàu Agent, phân phối nhiệm vụ, theo dõi chi phí và quy trình làm việc phối hợp giữa nhiều Agent, được cộng đồng khuyến nghị như một tiêu chuẩn cho triển khai cấp sản xuất.

Hermes Agent Self-Evolution là một công nghệ tự cải tiến theo hướng tiến hóa, sử dụng DSPy + GEPA để tối ưu hóa kỹ năng, nhắc nhở và mã.

Hermes Workspace là không gian làm việc gốc của Hermes, tích hợp giao diện trò chuyện, terminal và trình quản lý kỹ năng, là cổng thông tin đồ họa phổ biến nhất.

Ngoài ra, nó còn có thể sinh ra các sub-Agent độc lập, mỗi sub-Agent có ngữ cảnh đối thoại riêng, terminal độc lập và script Python RPC, từ đó tạo ra các pipeline song song với chi phí ngữ cảnh bằng 0.

Về tính linh hoạt hạ tầng, hỗ trợ sáu loại backend: chạy cục bộ, Docker, SSH từ xa, Daytona không máy chủ, Singularity container và Modal cloud functions. Daytona và Modal sẽ ngủ đông khi không sử dụng, chi phí gần như bằng 0. Bạn có thể chạy nó trên VPS 5 đô la hoặc cụm GPU, ra lệnh qua Telegram, để nó làm việc trên server đám mây mà bạn không trực tiếp SSH vào.

Hermes Agent hiện đang là đối thủ cạnh tranh trực tiếp với OpenClaw, cả hai đều là framework Agent mã nguồn mở hướng tới các nhà phát triển.

Triết lý kiến trúc của hai bên hoàn toàn khác nhau: OpenClaw có thiết kế cốt lõi là một "mặt phẳng điều khiển", một tiến trình chạy lâu dài thống nhất, chịu trách nhiệm quản lý các phiên giao dịch, định tuyến, thực hiện công cụ và trạng thái, mọi thứ đều chạy qua bộ điều khiển trung tâm này. Trong khi đó, Hermes lại lấy vòng lặp thực thi của chính Agent làm trung tâm, xây dựng tất cả xung quanh vòng lặp "làm, học, cải tiến".

Trong hệ thống kỹ năng, sự khác biệt giữa hai bên đặc biệt rõ rệt: Kỹ năng của OpenClaw chủ yếu là do con người viết, tải từ các cấp độ khác nhau như workspace, personal, shared hoặc plugin; trong khi đó, Hermes lại cho phép Agent tự tạo ra kỹ năng từ kinh nghiệm, hình thành vòng lặp học tập tự chủ thật sự.

Cách cài đặt và sử dụng

Bắt đầu rất đơn giản. Chỉ cần một dòng lệnh "curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash" là bạn đã hoàn tất cài đặt, hỗ trợ Linux, macOS và WSL2, Hermes Agent sẽ tự động hoàn tất mọi cấu hình mà không cần thao tác thủ công.

Trang web Hermes

Sau khi cài đặt xong Hermes Agent, hãy chạy "hermes setup" để khởi động hướng dẫn thiết lập, chọn nhà cung cấp mô hình của bạn (hỗ trợ Nous Portal, OpenRouter, OpenAI hoặc bất kỳ endpoint tùy chỉnh nào), kết nối với nền tảng nhắn tin của bạn (Telegram, Discord, Slack hoặc WhatsApp), và sau đó bắt đầu cuộc trò chuyện đầu tiên. Ngay từ lần tương tác đầu tiên, Hermes Agent đã ngay lập tức vào chế độ học tập, bắt đầu xây dựng trí nhớ, tạo kỹ năng và ngày càng trở nên mạnh mẽ hơn sau mỗi phiên giao dịch.

Các lệnh chính sử dụng hàng ngày bao gồm:

hermes (bắt đầu cuộc trò chuyện),

mô hình hermes (chọn nhà cung cấp và mô hình LLM),

công cụ hermes (cấu hình để kích hoạt những công cụ nào),

cổng hermes (khởi động cổng tin nhắn, kết nối Telegram, Discord và các nền tảng khác),

cài đặt hermes (chạy hướng dẫn cài đặt đầy đủ, cấu hình mọi thứ một lần),

migrate claw hermes (di chuyển từ OpenClaw),

cập nhật hermes (cập nhật lên phiên bản mới nhất),

bác sĩ hermes (chẩn đoán vấn đề);

Các tình huống phù hợp cho Hermes Agent bao gồm: cần nhớ ngữ cảnh qua các phiên giao dịch và cải thiện khả năng liên tục của AI trợ lý tổng quát; cần kết hợp sử dụng công cụ, plugin, máy chủ MCP, trình duyệt hoặc Shell trong quy trình làm việc Agent tùy chỉnh; triển khai Agent trên phần cứng cục bộ, cloud VM hoặc hạ tầng không máy chủ giá rẻ; và các tình huống cần giữ lịch sử đối thoại có thể tìm kiếm và kỹ năng đã học qua các nền tảng.

Cụ thể hơn, bạn có thể dùng nó để trò chuyện trên Telegram trong khi cho nó thực hiện nhiệm vụ trên cloud VM, thiết lập tự động hóa và gửi báo cáo đến bất kỳ nền tảng nào, để nó đảm nhận các nhiệm vụ định kỳ; hoặc kết nối nó với Slack hoặc Discord để cung cấp hỗ trợ hợp tác AI cho toàn đội; hoặc tận dụng khả năng xuất theo dõi của nó để tạo dữ liệu huấn luyện cho mô hình tool-calling thế hệ tiếp theo.