Skip to main content
ベンチマークはモデルやプロバイダーを比較する基礎となります。このページでは、データがプラットフォームに取り込まれる流れと、一貫性を保つ方法を説明します。

データソース

  • 公式リリース — プロバイダーのお知らせ、技術ブログ、報道資料。
  • 学術論文 — 再現可能な結果を含む査読済み論文や arXiv プレプリント。
  • コミュニティからの投稿 — Phaseo コミュニティやパートナーからの確認済み投稿。
スコアを受け付けるには、公開された出典または再現可能な評価を提示する必要があります。

正規化

モデル間の比較を正確にするため、ベンチマーク名、指標、分割を標準化します。
  1. 各投稿を内部ベンチマーク ID に対応付ける。
  2. 報告された指標を標準スケール(例:パーセンテージ)に変換する。
  3. few-shot 版や独自の評価ハーネスなど、差異を記録する。
  4. 自動検証を実行して、フィールドと値の範囲が妥当か確認する。

更新頻度

  • MMLU、GSM8K、HumanEval などの人気ベンチマークは毎週。
  • ニッチまたは新しいベンチマークは毎月。
  • プロバイダーやコミュニティメンバーから質の高い評価が投稿された場合は随時。
大規模な更新は changelog に記録され、過去の変化を確認できます。

透明性と再現性


フィードバック

不一致や不足しているデータを見つけた場合:
  1. ベンチマークスコアの提出で説明されている根拠を添えてIssueを作成します。
  2. Issueのレビュー質問に回答します。確認済みの修正はメンテナーがデータベースエディターで公開します。
  3. 大規模な研究の提出はDiscordで調整してください。
報告を受け付けると内容を確認し、ベンチマークの検証中に状況をお知らせします。
最終更新日 2026年10月2日