Skip to main content
ベンチマークは、Phaseoがモデルの品質と進歩を測定するうえで中核となるものです。 推論やコーディングから言語理解、画像認識まで、タスク、分野、プロバイダーをまたいでモデルの性能を比較できる客観的で再現可能な指標を提供します。

ベンチマークとは

ベンチマークとは、特定のタスクにおけるモデルの性能を測るために設計されたデータセットや評価です。 同じデータセットで複数のモデルを実行することで、それぞれの相対的な強みと弱みを測定できます。 一般的な例:
  • 🧠 MMLU (Massive Multitask Language Understanding) — 一般知識と推論を評価します。
  • 🔢 GSM8K — 数学的推論と問題解決力を評価します。
  • 💬 HellaSwag — 常識と文脈理解を評価します。
  • 🧮 ARC-Challenge — 科学的推論と論理力を測定します。
  • 💡 HumanEval — プログラミングとコード生成の能力を評価します。

Phaseo のベンチマークへの取り組み

Phaseo は複数の公開情報源と公式レポートからベンチマークデータを収集し、一貫した形式に標準化します。 各モデルのベンチマーク欄には次の情報が含まれます。
  • スコア値 — 通常はパーセンテージまたは正規化された尺度で表されます。
  • データセットのソース — 例: MMLU、GSM8K など。
  • 評価方法 — スコアの算出元(公式レポート、第三者評価、コミュニティからの投稿)を示します。
  • 最終更新日 — ベンチマークデータが最後に更新された日付を示します。

ベンチマークページの例


ベンチマークのカテゴリ

ベンチマークは、評価対象の能力を表すカテゴリに分類されています。

スコアの解釈方法

ベンチマークによって採点方式が異なる場合があることに注意してください。 Phaseo は可能な限り正規化し、比較の有用性を高めます。

Phaseo でのベンチマークの可視化

ベンチマーク結果は次の方法で可視化されます。
  • 📊 同じデータセット内のモデルを比較する棒グラフ。
  • 📈 時間の経過に伴うモデルの改善を示す推移グラフ。
  • 🧮 複数のデータセットにわたる性能をまとめる集計スコア。
Phaseo の各ベンチマークデータセットには、次のフィルターがあります。
  • モデルの種類(チャット、コード、埋め込みなど)
  • プロバイダー
  • リリース年
  • データセットのカテゴリ
これにより、推論やコーディングのタスクでどのモデルファミリーが優勢かなど、傾向をすばやく把握できます。

データソースと方法論

Phaseo は次の情報源からベンチマークデータを集約しています。
  • 公式の研究論文とモデルレポート。
  • プロバイダー の評価ページ(OpenAI Evals、Anthropic Reports など)。
  • オープンなコミュニティデータセット(例: Hugging Face のリーダーボード)。
  • GitHub 経由のユーザーからの直接投稿。
すべてのデータは標準化・検証してから公開されます。 詳しくは調査と方法論 → ベンチマークの方法論をご覧ください。

利用例


ベンチマークデータへの貢献

新しいベンチマークスコアや修正の根拠を添えて、GitHubのIssueを作成してください。 一貫性と正確性を保つため、投稿内容は掲載前に審査されます。

ベンチマークデータを投稿する

ベンチマークのIssueに含める根拠を確認します。

次のステップ

ベンチマークデータの仕組みを理解したら、モデルをプログラムから利用できるようにするAPI プロバイダーを確認しましょう。

API プロバイダーを探す

モデルがどこでホストされ、どのように料金設定され、利用できるかを確認しましょう。
最終更新日 2026年10月2日