AIエージェントは、単に応答するシステムから、現実世界で複雑なタスクを推論し実行できるシステムへと進化しています。

彼らは質問に答えることを超え、ウェブを閲覧し、ファイルを扱い、アプリケーションとやり取りし、APIを使い、複数 चरणのタスクを実行し始めています。しかし、エージェントの自律性が高まるにつれて、重要な問いが浮かび上がります。セキュリティ、信頼性、そしてユーザーの制御を犠牲にすることなく、AIに行動する能力をどのように与えるのでしょうか?

@NEAR Protocol のIronClaw 1.0は、AIエージェントがどのように考え、行動し、進捗を維持するかを再設計することで、この課題に対して興味深いアプローチを提示しています。

IronClaw 1.0:考えることと実行することを分離

#IronClaw の中核にあるのは、シンプルですが重要な設計思想です。意思決定を行うエージェントが、自ら実行する行動を無制限に制御できてはいけない、ということです。

IronClawは、専用のガードレイヤーによって推論プロセスを実行から分離します。

エージェントはタスクについて推論し、何を行う必要があるかを判断し、適切なツールを選択できます。その後、ガードが、意思決定プロセスと現実世界での実行の間に、制御された連携レイヤーを提供します。

これにより、アクションを評価でき、必要に応じて、それが起こる前に明示的に承認できる追加レイヤーが生まれます。

企業環境では、この区別が特に重要です。メール、ファイル、Webサイト、資格情報、または業務システムとやり取りするエージェントには、単なる知能以上のものが必要です。必要なのは、予測可能な境界線です。

際立つベンチマーク性能

アーキテクチャは、それが実際の性能に変換されてはじめて価値を持ちます。

IronClaw 1.0は、DeepSeek-V4-Flashのベースモデルを用いて3つのベンチマークすべてで能力を示しています。

  • ClawBench:93.5% IronClawがベンチマークをリードしており、HermesとOpenClawに先行しています。

  • ClawBench:88.6% さらに、マルチステップのエージェント課題でも1位にランクインしており、OpenClawとHermesを上回っています。

  • OfficeQA:76.4% IronClawは、職場や企業の情報をめぐる推論に焦点を当てたタスクでも再びリードしています。

ベンチマーク比較では、IronClawが3つすべての評価においてリードを維持していることが示されています。


ClawBenchでは、IronClawは88.6%でスコアし、Hermes(84%)とOpenClaw(82.5%)を上回っています。

OfficeQAでは、IronClawは76.4%に到達しています。Hermesは73.2%、OpenClawは72.4%です。

PinchBenchでは、IronClawは93.5%を記録しています。Hermesは90%、OpenClawは88.6%です。

結果は、IronClawがさまざまな種類のエージェント作業負荷に対しても一貫してパフォーマンスを発揮できることを示しています。

重要なのは、これらのベンチマークが扱う課題はそれぞれ異なるということです。AIがプロンプトにどれだけうまく応答できるかだけを測るのではなく、実際の環境でエージェントがタスクをどれだけ効果的に実行できるかを検証します。そのため、IronClawの一貫した1位の結果は、より高機能なAIエージェントを構築するというアプローチに裏付けとなる、測定可能な証拠を提供しています。

現実世界のAIワークフローのために設計

IronClawの価値は、その中核アーキテクチャの周囲にあるインフラにもあります。

設計による安全性

機密性の高い操作では、明示的な承認が必要になる場合があり、それによってユーザーはエージェントが実行できることに対するより強いコントロールを得られます。

永続的な状態

継続的なチェックポイントにより、IronClawは進捗を保持できます。タスクが中断されたり承認が必要になった場合、エージェントは最初からやり直すのではなく、再開できます。

オムニチャネル・メモリ

アシスタントは、同じメモリと安全ルールを維持しながら、CLI、Web、Slack、Telegramにまたがって動作できます。


チームの隔離

組織は環境やワークフローを分離でき、それによってIronClawは、異なるプロジェクト、ツール、またはアクセス権レベルを扱うチームにより適したものになります。


IronClawのマルチチャネル方式は、AIアシスタントが単一のインターフェースを超えて、さまざまな環境間で継続性を維持できることを示しています。


各チャネルを別々のやり取りとして扱うのではなく、同じアシスタントがCLI、Web、Slack、Telegramにまたがって動作し、そのメモリ、状態、安全ルールを維持できます。


これにより、複数のプラットフォームにまたがって働くユーザーやチームにとって、よりつながりのある体験が生まれます。

NEAR AIとステーキングの役割

IronClaw 1.0は、より広い方向性の一部であり、#NEARAI の周辺にあります。つまり、知能がよりプライベートで、検証可能で、かつユーザーが所有できるものになれるAIインフラを構築することです。

このビジョンには、優れたAIモデルだけでは不十分です。また、分散型アプリケーション、エージェント、サービスを確実に支えるインフラも必要です。

その点でNEARのステーキングが関係してきます。

ステーキングは、単に利回りを得ることではありません。ネットワークのレベルでは、ステークされたNEARが、基盤となるブロックチェーンを保護するのに役立つバリデータ・システムを支えます。バリデータはネットワークの維持とトランザクション処理を担当し、一方で経済的なインセンティブが参加者の行動をネットワークのセキュリティに整合させます。

分散型AIにとって、この土台は重要です。

AIエージェントがより高機能になり、自律性が増していくにつれて、頼れるインフラが必要になります。エコシステムが、近々登場するOpenClawのようなエージェント・システムへと進むにつれて、AIインフラと分散型ネットワークのセキュリティの関係がますます重要になります。


より大きな全体像

IronClaw 1.0は、将来のAIエージェントが「どれだけ賢く応答できるか」だけでなく、より多面的に評価される世界を指し示しています。

次の標準では、安全にどのように振る舞うか、どれだけ確実に進捗を維持できるか、チャネル間でどれだけ一貫して動作できるか、そしてユーザーがどれだけのコントロールを保持できるか、も含まれることになります。

#NEARAI はより広いビジョンを表しています。一方で、ステーキングはその下にある分散型インフラにとって重要なセキュリティ基盤を提供します。

組み合わせは説得力があります。つまり、考えることのできるAI、調整できるインフラ、経済的な参加によって保護できるネットワーク、そして自分が依存するシステムに対してより大きな所有権を維持できるユーザーです。

したがって、IronClaw 1.0は単なる別のAIエージェントのリリース以上のものとして捉えられるでしょう。より高機能で、安全で、分散化されたAIエコシステムのためのインフラがどうあるべきか、その一端が見えてきます。

参考文献

  • IronClaw 1.0:https://near.ai/blog/introducing-ironclaw-1-0

  • NEAR AIステーキング:https://www.near.ai/blog/staking-for-near-ai

  • NEARステーキング:https://docs.near.org/protocol/network/staking

  • NEAR AIインフラ:https://near.ai/blog/near-ai-launches-ironclaw-confidential-gpu-marketplace-and-multimodal-confidential-inference