誰でも送金を提案できる会社を想像してみてください。マーケティングが1件依頼でき、エンジニアリングが1件依頼でき、HRも1件依頼できます。しかし、誰が開始したとしても、同じ確認を毎回行う単一の承認窓口を通過するまで、お金は動きません。どの部門にも抜け道はありません。これが NEAR AI の IronClaw 1.0 の基本的な考え方です。エージェントは自分が何をしたいのかを推論できますが、実際のアクションは実行される前に、必ず単一の調整レイヤーを通過しなければなりません。

この違いが重要なのは、AI エージェントがテキストを生成したり質問に答えたりする領域を超えつつあるからです。Web サイトを閲覧し、ファイルを操作し、外部サービスとやり取りし、資格情報(クレデンシャル)を使い、メッセージを送り、ユーザーに代わって複数ステップのタスクを完了できます。エージェントが現実世界で行動できるようになった時点で、課題はもはや「基盤モデルが十分に賢いかどうか」だけではありません。問題は、そのモデルの周囲にあるインフラが、エージェントに許可されたことを確実に制御できるかどうかです。

アーキテクチャ: 「考える」ことと「行う」ことを分離する

#IronClaw 1.0 は、本質的に異なるアーキテクチャ手法を採用しています。推論、実行、メモリ、シークレット、ツールを密結合したコンポーネントとして動かすのではなく、推論レイヤーを実行レイヤーから切り離し、それらの間に「guard(ガード)」と呼ばれる単一の調整ポイントを置きます。どの能力によって開始されたアクションであっても、実行の前にそのチェックポイントを必ず通過しなければなりません。

その設計の重要性は過小評価されがちです。異なるツールや能力ごとに安全策(ガードレール)を個別に実装すると、新機能が追加されるたびに、そうした統制を正しく実装する場所がさらに増えてしまいます。中央集権型のガードレールを作れば、代わりに共通の強制経路が生まれ、同じ権限・安全ロジックがシステム全体のアクションを統治できます。実務的には、そのアーキテクチャは従来の Think ➔ Act モデルよりも、Think ➔ Guard ➔ Act に近い形です。

このアーキテクチャは、見落とされがちな別の問題にも対処しています。継続性(continuity)です。IronClaw は連続的なチェックポイント保存(continuous checkpointing)を使うため、中断されたタスクは、エージェントを最初からやり直させるのではなく、直前の状態から再開できます。ワークフローが承認待ちで一時停止した場合、再起動に遭遇した場合、あるいは実行途中で中断された場合でも、すでに進めた内容を保持し、最後のチェックポイントからタスクを再開できます。

ベンチマーク: 異なる失敗の表面(failure surfaces)における性能

アーキテクチャだけでは不十分です。エージェントは極めて慎重にすることもできますが、与えられたタスクを完了できなければ、実用上ほとんど役に立ちません。比較では同じ深層(deepseek-v4-flash)基盤モデルを使っているにもかかわらず、#IronClaw は現在、異なる次元の実世界性能をそれぞれテストする 3 つの異なるエージェント・ベンチマークでトップに立っています。

PinchBench では、#IronClaw のスコアが 147 件の実務タスクにわたり 93.5%です。スケジューリング、メールの一次仕分け、コーディング、リサーチ、ファイル管理を含みます。140 超の実運用 Web サイトにまたがる多段階のやり取りを評価する ClawBench では 88.6%を記録しています。OfficeQA は、米国の財務省(U.S. Treasury)公報のほぼ 1 世紀分にわたる巨大なコーパス、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、IronClaw のスコアは 89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、IronClaw のスコアは 89,000 ページ、26,000,000 超の数値データに基づく推論をテストし、IronClaw のスコアは 76.4%です。

これらのベンチマークは異なる能力に焦点を当てています。PinchBench は実務的なタスク完了を強調し、ClawBench は実運用の Web 環境が持つ予測不能性を導入しています。そして OfficeQA は、複雑なドキュメントと数値情報に対する推論をテストします。3 つすべてでトップに立つことは、性能が単に基盤モデルの関数であるだけではないことを示唆します。エージェントハーネス(運用基盤)と、その周辺のアーキテクチャも意味のある形で貢献しているのです。

デモから、実際に使えるシステムへ

実世界での利用を想定して設計された制御(コントロール)と組み合わせると、アーキテクチャの説得力はさらに増します。IronClaw は、エージェントが先に行動して後から説明するのを許すのではなく、機微なアクションが実行される前に明示的な承認を要求できるようにします。また、使用後にログから消去できる「使い捨て」シークレットにも対応し、システム内に残り続ける機微情報の量を減らします。

同じ考え方はメモリとコラボレーションにも広がります。IronClaw は、CLI、Web、Slack、Telegram の各インターフェースをそれぞれ単独のアシスタントとして扱うのではなく、メモリと安全ルールを一貫して維持します。組織においては、チームの隔離によってツールやスキルを共有しつつ、個々の作業スペースをデフォルトで非公開に保てます。さらに、強い分離を必要とするチーム向けの完全に分離されたシングルテナントオプションもあります。 @NEAR Protocol #NEARAI はすでに、チーム全体にわたって IronClaw を社内で稼働させており、プロダクトのデモを超えた実践的なテストの場を提供しています。

NEARAI と Staking がどのようにかみ合うか

能力のあるエージェントでも、継続的に稼働するには 推論(inference)、計算(compute)、信頼できるインフラが必要です。ここで #NEARAI が登場します。AI の計算を、従来のインフラ契約によって別サービスとして購入するだけだと考えるのではなく、NEAR AI は、ステーキングモデルによって AI サービスへのアクセスと NEAR エコシステムへの参加を結びつけます。

エージェントのホスティングでは、構造は固定比率で決まっています。ステークされた NEAR ÷ 100 = 月次クレジット予算(ドル)。500 NEAR をステークすると、トークンがステークされたままである限り、毎月 $5 のクレジットが付与されます。スターター(Starter)層は 50 NEAR から始まり、最初の IronClaw エージェントを有効化します。上位層では、より大きなクレジット配分と追加の並列エージェントが解放されます。なお、基盤の NEAR は消費されません。ユーザーの資産として残ります。

機密(confidential)な推論は別の形で機能します。ここでは、ユーザーのポジションによって生成されるステーキング報酬(現在のネットワーク APY は約 4.5–4.7%)が、収入として支払われるのではなく、計算クレジットと引き換えに NEAR AI に振り向けられます。元本(principal)はユーザーの管理下にとどまり、通常のプロトコル手順を通じてアンステークできます。さらに、より広いインフラによって、Anthropic、OpenAI、Google を含むプロバイダのモデルへアクセスすることも可能です。

重要なのは、NEAR でのステーキングは利回り(yield)だけが目的ではないことです。これは、今後登場する OpenClaw を含むこれらの AI エージェントが依拠する基盤となる分散型インフラを確保します。計算(compute)へのアクセスをネットワーク参加と結びつけることで、#NEARAI はネットワーク確保と、それによって動くアプリケーションの稼働(パワー)を、より密接な関係にします。

より大きな全体像

だからこそ #IronClaw 1.0 は、より能力の高い AI エージェントに関する別の発表よりも興味深いのです。自律的な AI における重要な変化は、モデルがより多くのことを学ぶ(できるようになる)というだけではありません。つまり、それらのモデルの周囲にあるインフラが、自律性を「知能」だけの問題ではなく、権限、実行、メモリ、復旧、隔離、計算(compute)を含むシステム問題として扱い始めている点です。

IronClaw は実行レイヤーでこの問題に対処します。推論とアクションを分離し、アクションを中央集権型ガード経由でルーティングし、中断による状態保持を可能にし、機微な操作を制御し、異なるインターフェース間で一貫した安全ルールを維持します。#NEARAI は、AI 計算(compute)へのアクセスを分散型ネットワーク参加と結びつけ、エージェントが実際に稼働できるインフラを提供することで、スタックの別の部分でも同様に取り組んでいます。

これらの要素をまとめると、AI インフラに向けたより広い方向性が見えてきます。自律エージェントの未来は、「人間の介入なしでどれだけモデルができるか」だけで決まるのではないでしょう。むしろ、そのモデルの周囲にあるシステムが、どれだけ確実にその行動を制約できるか、何か問題が起きたときにどれだけ復旧できるか、時間とともにどれだけ文脈(コンテキスト)を保持できるか、そしてそれを稼働し続けるためにどんなインフラを提供できるかによって決まるはずです。

より賢いエージェントは、方程式の一部にすぎません。より重要な課題は、そのエージェントを信頼できる状態にして行動させるためのインフラを構築することかもしれません。

これについては 𝕏 で読むことができます: https://x.com/Cryptfancier/status/2096337705550434561

出典

╰─➤ IronClaw 1.0 を紹介(NEAR AI ブログ): https://near.ai/blog/introducing-ironclaw-1-0

╰─➤ NEAR AI のためのステーキング(NEAR AI ブログ): https://near.ai/blog/staking-for-near-ai

╰─➤ NEAR プロトコル公式発表: https://x.com/NEARProtocol/status/2082875217995796606

╰─➤ IronClaw の GitHub リポジトリ: https://github.com/nearai/ironclaw

╰─➤ NEAR AI のプライベート推論ドキュメント: https://docs.near.ai/cloud/private-inference

╰─➤ ステーキング報酬 – NEAR のライブ利回りデータ: https://www.stakingrewards.com/asset/near-protocol