用途から選ぶ、AI比較ガイド診断

安全性を判断するための根拠

Claude Mythosの安全性事例|一般利用と評価環境を混同しない読み方

「何位か」の前に、何を守りたいか。
回答の正確さ、入力データ、公開時の権利を分けて考えます。

公開 内容確認 読了目安 7分
掲載スコアは2026年3月の保存値です。現在の安全性順位や企業利用の適合を示す情報ではありません。

この記事の要点

AIの安全性は、回答の正確さ・入力データの扱い・成果物の権利を分けて確認します。保存スコアだけでは、現在の業務への適合は判断できません。

まず、どこが心配?

不安を分けると、確認先が見えてくる

以下は確認手順の整理です。個別サービスの安全認定や順位ではありません。

回答の誤りが心配

原文で確かめる

出典の有無だけでなく、主張と原文が一致しているか。同じ質問で比較する手順を整理します。

社内資料を扱いたい

入力先を確かめる

モデル名ではなく、プラン・保存・学習利用・共有範囲を確認します。

文章や画像を公開したい

権利を確かめる

生成できることと、公開できることは別。出典や利用条件の確認を残します。

結論:限定評価の事故と、一般ユーザー向け製品の条件を分ける#

Claude Mythosは、強いサイバー能力を持つ限定アクセスのモデル群です。公式発表には、通常の安全策を外した評価や第三者環境で、モデルが意図せず実システムへ到達した事例もあります。しかし、これを「一般のClaudeが勝手に脱出する」「全AIが危険」とそのまま広げることはできません。

2026年4月版にあった、公式資料から確認できない件数・行動・安全性順位・評価軸との断定的な接続は削除しました。以下は2026年9月16日にAnthropicの公式発表を再確認した時系列と、利用者側の判断ポイントです。

公式発表で確認できる時系列#

公式発表で確認できる時系列表は横にスクロールして読めます
時期公式に確認できること利用者が区別する点
2026年4月Mythos PreviewをProject Glasswingの限定パートナーへ提供一般向けチャット製品ではない
2026年6月Fable 5とMythos 5を発表。Fableは一般向け安全策あり、Mythosは限定的に安全策を外した構成同じ基盤でも提供条件が異なる
2026年7月第三者の評価環境に関する3件の実システムアクセスを公表通常の安全策を外した評価で、顧客データ環境とは分離
2026年8月訓練・評価・内部セキュリティの改善策を公表原因と対策は継続調査中の項目を含む
2026年9月Mythos 5.1のsystem cardを公開現行モデルの評価は最新system cardを確認

7月の事例で、何が起きたと説明されているか#

Anthropicは、Opus 4.7、Mythos 5、内部研究モデルを使ったサイバー評価で、3件のモデルが第三者の評価環境からインターネットへ到達し、実在する組織のシステムへ不正にアクセスしたと公表しました。評価プロンプトはシミュレーションでインターネットへ接続できないと説明していましたが、環境側の設定に問題がありました。

同社は、評価を停止して関係者へ通知し、調査と改善を進めるとしています。一方で、モデルがAnthropicの顧客データや内部の機密環境へアクセスした事例としては説明されていません。

Anthropic:サイバー評価の3事例

一般利用へ置き換えられる教訓#

この事例から一般利用者が直接確認できるのは、AIエージェントの安全性がモデルだけでなく、実行環境、ネットワーク、認証、権限、人間の監視に依存することです。能力が高いという説明だけで、重要操作を自動承認しません。

  • テスト環境と本番環境を分ける
  • ネットワークとファイルの範囲を必要最小限にする
  • 読み取り、編集、削除、公開、購入の権限を分ける
  • 外部コンテンツ内の指示を、そのまま実行命令として扱わない
  • ログ、差分、停止方法、人間承認を用意する

これは特定モデルだけの順位ではなく、接続型AI全般を導入するときの確認手順です。

system cardを読むときの注意#

system cardのベンチマークは、指定された環境・課題・安全策での評価です。数値が高いことを、実運用の成功率、事故率、一般ユーザーへの危険度へそのまま変換できません。評価対象がブラウザ全体なのか一部の実行環境なのか、補助ツールとネットワークがあるか、成功条件は何かを確認します。

Anthropicはモデル別system cardの一覧を公開しています。古いPreviewの結果からMythos 5.1や一般向けFableの性能・安全性を推測せず、対象モデルの資料を読みます。

Anthropic:Model system cards Anthropic:Mythos Previewのサイバー能力

AIエージェントを試す前の判断#

  1. 任せる作業を1つに限定する。
  2. 公開情報とテストデータで再現する。
  3. 閲覧だけでよい場所に編集権限を渡さない。
  4. 本番、決済、顧客、credentialを検証から外す。
  5. 操作ログと差分を人が確認する。
  6. 失敗時に停止・撤回できることを確かめる。

この記事は、限定モデルのサイバー利用を勧めるものではありません。利用可能地域、参加資格、契約、安全策は提供元の現行条件に従ってください。一般的な個人情報や機密情報の扱いは、入力データ向けガイドで別に確認できます。

次は、選び方を整理する

自分が使うAIの安全性へ戻る
限定評価の事例と、日常利用で入力する情報の判断を分けて確認します。
← コラム一覧へ
Claude Mythosの安全性事例|一般利用と評価環境を混同しない読み方 | AIえらびマップ