Skip to main content
基准测试是 Phaseo 衡量模型质量与进步的核心方式。 它们提供客观、可重复的指标,帮助你比较模型在不同任务、领域和提供商上的表现,涵盖推理、编程、语言理解和图像识别。

什么是基准测试?

基准测试是用于评估模型在特定任务上表现的数据集或评测。 通过在同一数据集上运行多个模型,我们可以衡量它们各自的优势和不足。 常见示例包括:
  • 🧠 MMLU (Massive Multitask Language Understanding) — 测试通识知识和推理能力。
  • 🔢 GSM8K — 测试数学推理和问题解决能力。
  • 💬 HellaSwag — 评估常识和上下文理解能力。
  • 🧮 ARC-Challenge — 衡量科学推理和逻辑能力。
  • 💡 HumanEval — 评估编程和代码生成能力。

Phaseo 如何处理基准测试

Phaseo 从多个公开来源和官方报告收集基准测试数据,再将其标准化为统一格式。 每个模型的基准测试部分都包含:
  • 分数值 — 通常以百分比或标准化尺度表示。
  • 数据集来源 — 例如 MMLU、GSM8K 等。
  • 评估方法 — 说明分数的来源(官方报告、第三方评测或社区提交)。
  • 最后更新 — 显示基准测试数据最近一次刷新的时间。

基准测试页面示例


基准测试类别

基准测试按所评估的能力类别分组:

如何解读分数

请注意,有些基准测试采用不同的评分体系。 Phaseo 会在可能的情况下对其进行标准化,让比较更有意义。

在 Phaseo 上查看基准测试图表

基准测试结果通过以下方式可视化:
  • 📊 用于比较同一数据集内模型的柱状图。
  • 📈 展示模型随时间改进情况的趋势图。
  • 🧮 汇总多个数据集表现的综合分数。
Phaseo 上的每个基准测试数据集都包含以下筛选条件:
  • 模型类型(聊天、代码、嵌入等)
  • 提供商
  • 发布年份
  • 数据集类别
这样你就能快速发现规律,例如哪些模型系列在推理或编程任务中领先。

数据来源与方法

Phaseo 汇总以下来源的基准测试数据:
  • 官方研究论文和模型报告。
  • 提供商 的评测页面(OpenAI Evals、Anthropic Reports 等)。
  • 开放的社区数据集(例如 Hugging Face 排行榜)。
  • 用户通过 GitHub 直接提交的内容。
所有数据都会经过标准化和验证后再发布。 详情请参阅研究与方法 → 基准测试方法。

使用场景示例


贡献基准测试数据

在 GitHub 提交问题,并附上新增或修正基准测试分数的证据。 每项提交都会经过审核,以确保一致性和准确性。

贡献基准测试数据

了解基准测试问题应包含哪些证据。

后续步骤

了解基准测试数据的运作方式后,你可以探索那些通过编程方式提供这些模型的 API 提供商。

探索 API 提供商

查看模型的托管位置、定价方式和访问途径。
最后修改于 2026年10月2日