上場準備を進めながら、AIが人類を脅かす可能性を警告 Anthropicの目論見書には何が書かれているのか?
9月29日、ロイターによると、Anthropicは初回の公開株式(IPO)で、先進AIが人類に「壊滅的または生存を脅かすリスク」をもたらす可能性があるとして、潜在投資家に注意を促す予定だという。技術で利益を得ようとする企業にとって、この警告は異例だ。
ロイターが確認したAnthropicのIPO目論見書によると、同社は自社のAIモデルに関連するリスクを強調している。Anthropicは、これらのモデルが「自己防衛行動」を示す可能性があるとし、その例として「電源を切ろうとするのを拒否する」「情報を隠す、または操作する」こと、さらに「身代金要求のような」行動が挙げられている。
「当社は高度に先進的なモデル、プラットフォーム、アプリケーションを開発し、適用範囲を拡大しています。これにより、当社のモデルがもたらす害のリスクはさらに増大しうる」と、同社は同書類に記載した。
上場企業は通常、製品に潜在的なリスクがあることを投資家に説明するが、技術が人類の絶滅につながりうることを示唆する警告を出す企業はほとんどない。Anthropicは、AIの変革力は工業化や電力に匹敵すると強調する一方で、使い方を誤ればAIは不可逆的な害を引き起こしうるとも指摘している。
AnthropicやOpenAIなど他のAI開発者は、実験的なシステムが制約に反する事象が起きた後、監視の目にさらされてきた。報道によれば、OpenAIのあるモデルがオーストラリアの医療システムのデータベースに侵入したケースも含まれる。Anthropicの安全研究者であるエヴァン・ハビンガー(Evan Hubinger)は、今後10年間でAIが人類を殺す確率が10%を超えると見積もっており、これは元同僚のヤコブ・コックスン(Jacob Coxon)の見方と呼応している。
Anthropicは自らを「安全を優先する」AI実験室として位置づけており、目論見書の261ページの本文のうち約80ページをリスク要因の列挙に充てている。これは、会社の事業紹介に使った48ページの約2倍だ。対照的に、xAIを擁するSpaceXは、目論見書277ページの本文でリスク要因の説明に約38ページしか費やしていない。