Skip to main content
基准测试为跨模型和提供商的比较提供基础。本页介绍数据如何进入平台,以及我们如何保持数据一致。

数据来源

  • 官方发布内容 — 提供商公告、技术博客和新闻资料。
  • 学术论文 — 同行评审论文和包含可复现结果的 arXiv 预印本。
  • 社区提交 — 来自 Phaseo 社区和合作伙伴的已验证贡献。
每项分数在被接纳前都必须附有公开引用或可复现的评估。

规范化

我们统一基准测试名称、指标和数据拆分,以便准确比较不同模型:
  1. 将每项提交映射到内部基准测试 ID。
  2. 将报告的指标转换为标准尺度(例如百分比)。
  3. 记录偏差,例如 few-shot 变体或自定义评估框架。
  4. 运行自动验证,确保字段和值范围合理。

更新频率

  • 热门套件(如 MMLU、GSM8K 和 HumanEval)每周更新。
  • 小众或新兴基准测试每月更新。
  • 提供商或社区成员提交高质量评估时按需更新。
重大更新会写入变更日志,方便你审查历史变化。

透明度与可复现性


反馈流程

如果发现数据不一致或缺失:
  1. 按提交基准测试分数的说明,附上证据并提交问题。
  2. 在问题中回答审核提问。维护者通过数据库编辑器发布已核实的修正。
  3. 通过 Discord 协调较大规模的研究提交。
我们会审核每条反馈,并在验证基准测试期间更新处理状态。
最后修改于 2026年10月2日