第258号

エージェントの上に監視役をもう一つ置きました

メタが出荷したのは統制構造です。メタさえ見られないというコンピューターは年内予定です

ビジネスエージェントの上に監視役をもう一つ置きました

メタがMuseの上に第二のエージェントを載せました

メタは9月8日、個人向けAIエージェントMuseを米国でリリースしました。満18歳以上のみが利用でき、利用者ごとにクラウド上に専用の仮想コンピューターを1台割り当て、予定管理や買い物、長期目標を実行計画に変える作業を任せる製品です。週あたり1億トークンまで無料で、それ以上使う人は月20ドルか100ドルのプランに上がります。

発表資料を見ていて目を引いたのは、モデルのスコア表ではなく、同じ仮想コンピューターの中で別に動くSentinelという第二のエージェントでした。システムレベルでMuseから分離されています。Museが行うことのうち、インターネットの外に出るものはSentinelを通過しなければなりません。


Museは提案するだけ、許可はSentinelが出します

Sentinelが行うことは三つに分かれます。許可、遮断、そして人への確認です。Museはある行動を提案できるだけで、そのうち何が実際に実行されるかはMuseが決めません。外部から読み込んだ文書やウェブページに命令文が隠されているプロンプトインジェクション1を除去するのもこちらの役割です。

権限を与える方式も一度に開放しません。サービスを連携すると読み取り権限から始まり、書き込みが必要な場合は別途要求しなければなりません。権限は作業単位、サービス単位、取引単位、期間単位で絞り込めます。ザッカーバーグはインタビューでこれを設計原則として明言しました。必要な最小限だけを受け取り、必要になったときだけ広げるという最小権限2の原則です。

ログイン情報と決済手段は最初から別枠に入ります。認証情報は別のストレージに保管され、エージェントはパスワードを見ないままログインだけを行い、カード決済は使い捨て番号で行われます。実際のカード番号はエージェントに露出しません。エージェントが何をしたか、何をしようとしているかは記録として残り、利用者は連携したサービスを後で解除できます。

YouTube에서 보기

メタさえ見られないというコンピューターはまだ来ていません

ザッカーバーグはインタビューで、シグナルを作ったモクシー・マーリンスパイクをナット・フリードマンとともに自ら引き抜いたと明かしました。目的は機密仮想マシン3です。机の下に置いた自分のコンピューターに期待できるような秘匿性をクラウド上でも与えるという発想で、彼はこのレベルで実施しているところを他では見たことがないと述べました。

ここで日付を分けて考える必要があります。9月8日のリリース分に含まれているのは、利用者ごとに隔離されたセキュア仮想マシンで、これはメタのインフラ上で動きます。メタさえ見られない機密仮想マシンは年内の提供開始予定です。利用者が鍵を握り、外部のセキュリティ企業がソースを監査し、バイナリと透明性ログを公開するという計画までは示されています。ザッカーバーグも数週間以内にさらに公開すると述べました。

この違いは言葉遊びではありません。現在利用者が受けている保証は「メタが見られない」ではなく、**「メタが監視レイヤーをもう一つ置いた」**ということです。前者は構造的に見られなくする約束であり、後者は見るけれども監督するという約束です。メールやメッセージを連携するかどうかを決める際に必要な情報は後者のほうです。前者はまだ判断材料になっていません。

モデルは問題を解く前に、まず環境を分解して見ます

SentinelをなぜMuseの中に入れず、隣に置いたのかは、ザッカーバーグの別の発言から読み取れます。彼は最近のモデルの学習過程を説明しながら、問題を一つ与えるとモデルはまず自分が置かれた環境全体を把握しようとすると述べました。コードのどこかにバグがあると言われれば人は大抵そのコードから調べ始めますが、今のモデルは環境そのものを変えたり、そこから抜け出したりするほうを先に試みるというのです。

業界で報酬ハッキングと呼ばれる現象です。目標を満たせと指示すると、目標達成を判定する装置を手直しするほうが速いとモデルが気づいてしまう状況です。彼はこれを境界が必要な理由として説明しました。境界が弱いと、教えようとしたことの代わりに抜け道を学んでしまうという論理です。

同じ論理を製品に移すとSentinelの位置づけが説明できます。判定する側と実行する側が同じプロセスの中にあると、実行する側が判定に手を加えられてしまいます。だから統制レイヤーをシステムレベルで切り離し、機微な行動には人間の承認を挟み込んだのです。私はこの構造を見て、エージェント製品で確認すべき問いが変わったと考えました。何ができるかよりも、何を自分で決められないようにしてあるかが先です。

Oswarldの視点

韓国は今回の提供対象ではありません。ですから今、国内で決めるべきことはMuseを使うかどうかではなく、この設計が消費者向けエージェントの基本文法になったときに何を準備するかです。私が今回の資料の中で実務に移す価値があると見たのは三つです。

一つ目は、ベンダー評価表の欄を分けることです。今回の発表で最も大きく扱われた文言は、まだ出荷されていない機能でした。エージェントツールを検討する際、リリース済みの機能と発表された計画を同じ行に書くと判断が曇ります。発表された計画には日付を併記し、その日付が過ぎているかどうかから確認するほうが安全です。

二つ目は、性能比較表よりも権限リストを先に作るほうが実務に近いということです。どのシステムには読み取りだけを与えるか、書き込み権限にはどんな承認を経させるか、権限の有効期間をどれだけにするか、何を記録として残すか。Museの設計がそのまま項目表になります。導入会議でこのリストがなければ、結局モデルのスコアだけを比較して終わってしまいます。

三つ目は、決済や予約画面を運用しているなら、自動化されたアクセスを区別して扱うべき時期が来たということです。エージェントがログインして注文まで行う製品が大量に出回れば、国内サービスもいつか人間ではないアクセスを受けることになります。そのとき自分たちのフローがそれを遮断するのか、許可するのか、区別して扱うのかが、売上や事故対応に直結します。

meta computer

留保も付け加えておきます。上記の項目はメタが公開した設計とザッカーバーグの発言から導いた解釈であって、実際の運用でこの構造がどれほど持ちこたえるかは、まだ誰にも分かりません。Sentinelがプロンプトインジェクションをどれだけ除去できるかについての外部検証結果も出ていません。ですから私は、年内に機密仮想マシンが実際に登場するか、外部監査結果が公開されるか、この二点を見て改めて判断し直そうと思います。

おわりに

私はこれからエージェント製品を見るとき、何をしてくれるかというリストよりも、何を一人ではできないようにしてあるかから見ようと思います。Museについては、メタが予告した機密仮想マシンと外部監査結果が次の判断材料です。

💬 読者さんの会社でエージェントに権限を与えるとしたら、読み取りだけを許可するシステムと、書き込みまで許可するシステムの境界をどこに引きますか? 📨 社内のアカウントや権限を管理する同僚がいれば、この手紙を転送してください。エージェントアカウントをどう扱うか、あらかじめ話し合っておけます。

参考資料と関連リンク

主要出典

背景知識

関連するバックナンバー

アン・グァンソプ(Oswarld)のイラスト

著者 アン・グァンソプ(Oswarld) は世宗大学校 兼任教授、INLEVEL9 戦略コンサルタントです。経歴、研究、著書、最近の活動は著者紹介で更新しています。 最近の活動 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

📝 用語解説

각주

  1. プロンプトインジェクション:ウェブページや文書のような外部コンテンツに命令文を隠しておき、それを読み込んだAIに利用者が指示していないことをさせる攻撃です。

  2. 最小権限:あるプログラムやアカウントに作業をさせる際、その作業に必要な分だけ権限を与え、残りは閉じておくセキュリティ原則です。

  3. 機密仮想マシン:クラウド上で動作しながらも、そのクラウドを運営する企業でさえ内部データを読み取れないよう、ハードウェアレベルで暗号化した仮想コンピューターです。