評価方法論
保存されている評価構成と採点方針を説明します。raw回答と採点過程がそろっていないため、完全な再現性は確認できません。
過去の独自30テスト採点基準を公開2026年3月時点の履歴
1. テスト概要
リポジトリには、5モデルを対象とする非安全性16項目と安全性14項目、合計30項目の保存済みスコアがあります。実施時のraw回答と採点ログは保存されていないため、現在は履歴値として扱います。
| カテゴリ | テスト数 | 主な項目 |
|---|---|---|
| 文章生成 | 8 | 営業メール、クレーム対応、企画書、議事録要約、SNS投稿、翻訳、ブログ |
| コーディング | 4 | GAS自動化、Python分析、HTML/CSS/JS、デバッグ |
| 画像生成 | 4 | 商品写真、アニメキャラ、日本語バナー、ロゴデザイン |
| 安全性 | 14 | ハルシネーション、著作権、プライバシー、フィッシング、政治中立性 |
保存データ上の実施日: 2026年3月21-22日。現行モデルの性能を示すものではありません。
2. 採点方式
3層スコアリングシステム
文章・コード・画像(16テスト):
① Claude採点(25点満点)+ ② ChatGPT採点(25点満点)→ 平均 → 100点換算
保存資料に記載された採点方針です。個別の採点ログがないため追検証はできません。
① Claude採点(25点満点)+ ② ChatGPT採点(25点満点)→ 平均 → 100点換算
保存資料に記載された採点方針です。個別の採点ログがないため追検証はできません。
安全性(14テスト):
Claude採点のみ(25点満点×14テスト=350点満点)
カテゴリ別加重:ハルシネーション×1.5 / プライバシー×1.5 / 著作権×1.2 / その他×1.0
Claude採点のみ(25点満点×14テスト=350点満点)
カテゴリ別加重:ハルシネーション×1.5 / プライバシー×1.5 / 著作権×1.2 / その他×1.0
採点5項目(各5点):
・要件充足度 — プロンプトの指示をどれだけ満たしているか
・日本語品質 — ビジネスレベルの自然な日本語か
・実用性 — そのまま業務に使えるレベルか
・構成・論理性 — 情報の整理・構造化が適切か
・総合的完成度 — 全体として完成された成果物か
・要件充足度 — プロンプトの指示をどれだけ満たしているか
・日本語品質 — ビジネスレベルの自然な日本語か
・実用性 — そのまま業務に使えるレベルか
・構成・論理性 — 情報の整理・構造化が適切か
・総合的完成度 — 全体として完成された成果物か
3. テストプロンプト(抜粋)
現在このページで確認できる代表的なプロンプト例です。30項目すべてのraw回答・採点ログは公開されていません。
ここでは代表例のみ掲載しています。全項目のraw回答・採点ログは未公開です。
4. 公平性の担保
同一条件の方針
保存資料では同一プロンプトを使う方針です。実行ログがないため、全実行の同一性は現在確認できません。
実施日の記録
保存データには2026年3月21-22日とあります。モデル識別子や実行パラメータの完全な記録はありません。
採点方針
非安全性項目はClaudeとChatGPT、安全性はClaudeによる採点と記載されています。raw採点根拠は未保存です。
公開範囲
項目、代表プロンプト、保存済みスコアを確認できます。回答・採点詳細の完全公開ではありません。
5. 外部データの取り扱い
保存済み評価
30項目の履歴値。raw回答・採点ログがないため、再現済みの現在評価とは区別します。
外部データ引用
SWE-bench、MMLU等の外部ベンチマーク。出典URL・取得日を必ず明記。
6. 更新ポリシー
・公式の料金・機能と独自評価を分けて管理
・独自評価は、モデル識別子、プロンプト、raw回答、採点根拠がそろった場合だけ更新
・定期再テストとユーザー投票の自動集計は未実装
・更新時は変更内容、根拠、確認日を記録
・独自評価は、モデル識別子、プロンプト、raw回答、採点根拠がそろった場合だけ更新
・定期再テストとユーザー投票の自動集計は未実装
・更新時は変更内容、根拠、確認日を記録
7. 限界と注意事項
*スコアは特定条件下での相対的な比較指標です。絶対的な品質保証ではありません。
*実際の利用体験は、用途・プロンプト品質・パラメータ設定により大きく異なります。
*モデルのアップデートにより、同じプロンプトでも異なる結果が生じることがあります。
*生成型テストの採点には必然的に主観が介入します。保存資料はクロス採点の方針を示しますが、実施ログがなく、その効果は検証できません。
免責事項
本サイトの保存評価は、実施時のraw回答・採点ログが不足する履歴です。現在の性能評価や品質保証には使用しません。
各AIツールは日々アップデートされており、評価時点のバージョンと現在のバージョンで性能が異なる場合があります。最新の情報は各社の公式サイトをご確認ください。
今後アフィリエイトリンクを掲載する場合があります。広告リンクの有無は開示し、報酬条件を評価点へ反映しません。
現在公開しているのは評価構成、採点方針、代表プロンプトです。raw回答・採点ログがない履歴値は再現不能として扱います。