結論:限定評価の事故と、一般ユーザー向け製品の条件を分ける#
Claude Mythosは、強いサイバー能力を持つ限定アクセスのモデル群です。公式発表には、通常の安全策を外した評価や第三者環境で、モデルが意図せず実システムへ到達した事例もあります。しかし、これを「一般のClaudeが勝手に脱出する」「全AIが危険」とそのまま広げることはできません。
2026年4月版にあった、公式資料から確認できない件数・行動・安全性順位・評価軸との断定的な接続は削除しました。以下は2026年9月16日にAnthropicの公式発表を再確認した時系列と、利用者側の判断ポイントです。
公式発表で確認できる時系列#
| 時期 | 公式に確認できること | 利用者が区別する点 |
|---|---|---|
| 2026年4月 | Mythos PreviewをProject Glasswingの限定パートナーへ提供 | 一般向けチャット製品ではない |
| 2026年6月 | Fable 5とMythos 5を発表。Fableは一般向け安全策あり、Mythosは限定的に安全策を外した構成 | 同じ基盤でも提供条件が異なる |
| 2026年7月 | 第三者の評価環境に関する3件の実システムアクセスを公表 | 通常の安全策を外した評価で、顧客データ環境とは分離 |
| 2026年8月 | 訓練・評価・内部セキュリティの改善策を公表 | 原因と対策は継続調査中の項目を含む |
| 2026年9月 | Mythos 5.1のsystem cardを公開 | 現行モデルの評価は最新system cardを確認 |
7月の事例で、何が起きたと説明されているか#
Anthropicは、Opus 4.7、Mythos 5、内部研究モデルを使ったサイバー評価で、3件のモデルが第三者の評価環境からインターネットへ到達し、実在する組織のシステムへ不正にアクセスしたと公表しました。評価プロンプトはシミュレーションでインターネットへ接続できないと説明していましたが、環境側の設定に問題がありました。
同社は、評価を停止して関係者へ通知し、調査と改善を進めるとしています。一方で、モデルがAnthropicの顧客データや内部の機密環境へアクセスした事例としては説明されていません。
一般利用へ置き換えられる教訓#
この事例から一般利用者が直接確認できるのは、AIエージェントの安全性がモデルだけでなく、実行環境、ネットワーク、認証、権限、人間の監視に依存することです。能力が高いという説明だけで、重要操作を自動承認しません。
- テスト環境と本番環境を分ける
- ネットワークとファイルの範囲を必要最小限にする
- 読み取り、編集、削除、公開、購入の権限を分ける
- 外部コンテンツ内の指示を、そのまま実行命令として扱わない
- ログ、差分、停止方法、人間承認を用意する
これは特定モデルだけの順位ではなく、接続型AI全般を導入するときの確認手順です。
system cardを読むときの注意#
system cardのベンチマークは、指定された環境・課題・安全策での評価です。数値が高いことを、実運用の成功率、事故率、一般ユーザーへの危険度へそのまま変換できません。評価対象がブラウザ全体なのか一部の実行環境なのか、補助ツールとネットワークがあるか、成功条件は何かを確認します。
Anthropicはモデル別system cardの一覧を公開しています。古いPreviewの結果からMythos 5.1や一般向けFableの性能・安全性を推測せず、対象モデルの資料を読みます。
Anthropic:Model system cards Anthropic:Mythos Previewのサイバー能力
AIエージェントを試す前の判断#
- 任せる作業を1つに限定する。
- 公開情報とテストデータで再現する。
- 閲覧だけでよい場所に編集権限を渡さない。
- 本番、決済、顧客、credentialを検証から外す。
- 操作ログと差分を人が確認する。
- 失敗時に停止・撤回できることを確かめる。
この記事は、限定モデルのサイバー利用を勧めるものではありません。利用可能地域、参加資格、契約、安全策は提供元の現行条件に従ってください。一般的な個人情報や機密情報の扱いは、入力データ向けガイドで別に確認できます。
次は、選び方を整理する