ベンチマークとは
ベンチマークとは、特定のタスクにおけるモデルの性能を測るために設計されたデータセットや評価です。 同じデータセットで複数のモデルを実行することで、それぞれの相対的な強みと弱みを測定できます。 一般的な例:- 🧠 MMLU (Massive Multitask Language Understanding) — 一般知識と推論を評価します。
- 🔢 GSM8K — 数学的推論と問題解決力を評価します。
- 💬 HellaSwag — 常識と文脈理解を評価します。
- 🧮 ARC-Challenge — 科学的推論と論理力を測定します。
- 💡 HumanEval — プログラミングとコード生成の能力を評価します。
Phaseo のベンチマークへの取り組み
Phaseo は複数の公開情報源と公式レポートからベンチマークデータを収集し、一貫した形式に標準化します。 各モデルのベンチマーク欄には次の情報が含まれます。- スコア値 — 通常はパーセンテージまたは正規化された尺度で表されます。
- データセットのソース — 例: MMLU、GSM8K など。
- 評価方法 — スコアの算出元(公式レポート、第三者評価、コミュニティからの投稿)を示します。
- 最終更新日 — ベンチマークデータが最後に更新された日付を示します。
ベンチマークページの例
ベンチマークのカテゴリ
ベンチマークは、評価対象の能力を表すカテゴリに分類されています。スコアの解釈方法
ベンチマークによって採点方式が異なる場合があることに注意してください。
Phaseo は可能な限り正規化し、比較の有用性を高めます。
Phaseo でのベンチマークの可視化
ベンチマーク結果は次の方法で可視化されます。- 📊 同じデータセット内のモデルを比較する棒グラフ。
- 📈 時間の経過に伴うモデルの改善を示す推移グラフ。
- 🧮 複数のデータセットにわたる性能をまとめる集計スコア。
- モデルの種類(チャット、コード、埋め込みなど)
- プロバイダー
- リリース年
- データセットのカテゴリ
データソースと方法論
Phaseo は次の情報源からベンチマークデータを集約しています。- 公式の研究論文とモデルレポート。
- プロバイダー の評価ページ(OpenAI Evals、Anthropic Reports など)。
- オープンなコミュニティデータセット(例: Hugging Face のリーダーボード)。
- GitHub 経由のユーザーからの直接投稿。
利用例
ベンチマークデータへの貢献
新しいベンチマークスコアや修正の根拠を添えて、GitHubのIssueを作成してください。 一貫性と正確性を保つため、投稿内容は掲載前に審査されます。ベンチマークデータを投稿する
ベンチマークのIssueに含める根拠を確認します。
次のステップ
ベンチマークデータの仕組みを理解したら、モデルをプログラムから利用できるようにするAPI プロバイダーを確認しましょう。API プロバイダーを探す
モデルがどこでホストされ、どのように料金設定され、利用できるかを確認しましょう。