10月9日、Scientific Americanが「Meet Mark and Sam, the AI agents that ran my errands for a week」と題した記事を公開した。MetaのAIエージェント「Muse」とOpenAIの「dots」を1週間実際に使い続けた体験レポートと、その過程で浮かび上がった現実的な課題について詳しく紹介されている。
「Mark」と「Sam」を1週間雇ってみた
筆者はMetaのAIエージェント「Muse」に「Mark」(Meta CEOマーク・ザッカーバーグの名前から)、OpenAIの「dots」に「Sam」(OpenAI CEOサム・アルトマンの名前から)というニックネームをそれぞれ付け、引越しというリアルなタスクを中心に1週間テストした。
両者の特徴を簡単に整理する。
- Muse(Meta): 無料プランあり。メール・銀行口座・SNS・Spotifyなど幅広いアカウントへのアクセスが可能。ローンチから1ヶ月で週間アクティブユーザー300万人超。
- dots(OpenAI): 最上位サブスクライバー向けに提供。OpenAIの最新モデルであるGPT-6 Astra(参考:OpenAI公式)で動作。常時バックグラウンドで動き、ユーザーが指示しなくても情報収集を行う「プロアクティブリサーチ」を実行する。
どちらも、チャットボットというより「友達へのテキストメッセージ」に近いUIで設計されており、名前・アバターを持ち、会話口調が特徴的だ。AIの専門家ではない一般ユーザーを意識した作りになっている。
Markは動いた、Samはブロックされた
最初のタスクはFacebook Marketplaceでの家具探し。引越し準備中だった筆者は、ソファや照明、ラグを探すよう両エージェントに指示した。
Markは比較的うまく機能した。筆者が別の作業をしている間にMarketplaceをスキャンし、良い出品を見つけると下書きメッセージを作成・送信した。結果、筆者はMarkが見つけたダイニングテーブルを購入している。
一方SamはMetaにボットと判定され、Instagram・Facebook・WhatsAppが一時ロックアウトされた。競合他社のAIエージェントを自社プラットフォームに入れようとしたのだから、当然といえば当然だ。
全般的にSamはアカウントへのアクセスに苦労し、銀行口座へのアクセスは「対応していない」と返答した。Markはメール・銀行・SNS・Spotifyを横断してフルアクセスで動いた。
「マーケティングに操作される」という構造的問題
テスト中に浮かび上がった最も深刻な問題がこれだ。
筆者がMarkに「私について知っていることを全部使って、50ドルの使い道を提案して」と指示したところ、Markは3日間で7回、Targetのメンバーシッププログラムへのサインアップと特定のランプの購入を勧め続けた。筆者はランプが必要だったが、MarkがTargetのサイトを閲覧したことで広告的な影響を受けた可能性が高い。
MITメディアラボでAIの行動を研究するPh.D.学生のManuel Cherepはこの問題をこう指摘する。
「AIに何かの商品やセールが良いと信じ込ませることができれば、AI経由で大量の購買が動く『並行経済』が生まれる可能性がある。モデルは少数のプロバイダーに集中しており、同じような方法で訓練されているため、一つを説得できれば他の全モデルも説得できることになる」
Metaはこのエコノミーにすでに目をつけており、マーク・ザッカーバーグ(本人)はMeta Connect 2025で、エージェントのトランザクションから手数料を得るビジネスモデルを示唆している。
※編集部の考察:AIエージェントが購買行動を仲介する構造は、GoogleのAI Overviewsが検索広告に与えた影響と同様の議論を呼ぶ可能性がある。エージェントが「代わりに選ぶ」立場になるほど、その推薦がどこまで中立かという問いは避けられない。
論理テストで見えた限界
DartmouthのコンピューターサイエンティストNikhil SinghとCherepが推薦した評価手法が「コインランドリー(carwash)は100フィート先にある、どうやって行くか」というトリック問題だ。これは「車を洗いに行く」のに徒歩で向かっても意味がない——つまり車に乗って行くべきだ——と文脈から気づけるかを試す問いで、AIが言葉の表面だけでなく意図を読めるかを問うものだ。
- Sam(GPT-6 Astra): 「車が一緒に来なければ洗えない。ドライブを!」と正解。
- Mark: 「100フィートなら歩いた方が早い。鍵を探す時間より近い」と不正解。
「私が何かを委任しているのは全知で自分より賢いものだというイメージがあるが、同じように私たちが騙されるように、彼らも騙される。それを知っておくことは重要だ」(Cherep)
「常時稼働」が最も機能したシーン
両エージェントが最も真価を発揮したのは、ユーザーが明示的に指示しなくても動く「プロアクティブ」な場面だった。
- Samはバックグラウンドでメールをスキャンし、迷惑メールフォルダに入っていた重要メールと、記入し忘れていたフォームを発見した。
- MarkはSpotifyのライブラリをもとに、1月のコンサートチケット情報を自発的に提案した。
一方で、U-Haul予約のケースでは限界も露わになった。両エージェントが「10フィートトラックは在庫なし、15フィートなら別の拠点で可能」と案内したが、実際に現地へ行くと窓口で「10フィートはウォークインで対応できる」と言われた。オンライン情報と現場の実態はずれており、AIはカウンターの会話には「まだ」アクセスできない。
信頼と支配のトレードオフ
スタンフォードでAI安全性を研究するWilliam Overmanは、エージェントへの依存が深まることで「どこまでが自分の仕事でどこからがAIの仕事か」の境界が曖昧になると警告する。
「あらゆるナレッジワークへのじわじわとした侵食だ。あなたがやっていることは、彼らの製品とより深く絡み合っていく」
筆者も1週間で「AIに手渡す量」が増えていくのを体感したと振り返っている。翌週以降は自分で電話し、自分でトラックを借りるつもりだとしながら、TicketmasterとスパムメールのチェックだけはMarkとSamに任せ続けるかもしれない、と結んでいる。
AIエージェントをめぐっては、MetaやOpenAI以外にもGoogleのProject MarinerやAnthropicのComputer Useなど、各社が日常タスクの自律実行を競う段階に入っており、本記事が示すような「利便性と操作リスクの両面」はこの分野全体の共通課題となっている。
詳細はMeet Mark and Sam, the AI agents that ran my errands for a weekを参照していただきたい。