什么是基准测试?
基准测试是用于评估模型在特定任务上表现的数据集或评测。 通过在同一数据集上运行多个模型,我们可以衡量它们各自的优势和不足。 常见示例包括:- 🧠 MMLU (Massive Multitask Language Understanding) — 测试通识知识和推理能力。
- 🔢 GSM8K — 测试数学推理和问题解决能力。
- 💬 HellaSwag — 评估常识和上下文理解能力。
- 🧮 ARC-Challenge — 衡量科学推理和逻辑能力。
- 💡 HumanEval — 评估编程和代码生成能力。
Phaseo 如何处理基准测试
Phaseo 从多个公开来源和官方报告收集基准测试数据,再将其标准化为统一格式。 每个模型的基准测试部分都包含:- 分数值 — 通常以百分比或标准化尺度表示。
- 数据集来源 — 例如 MMLU、GSM8K 等。
- 评估方法 — 说明分数的来源(官方报告、第三方评测或社区提交)。
- 最后更新 — 显示基准测试数据最近一次刷新的时间。
基准测试页面示例
基准测试类别
基准测试按所评估的能力类别分组:如何解读分数
请注意,有些基准测试采用不同的评分体系。
Phaseo 会在可能的情况下对其进行标准化,让比较更有意义。
在 Phaseo 上查看基准测试图表
基准测试结果通过以下方式可视化:- 📊 用于比较同一数据集内模型的柱状图。
- 📈 展示模型随时间改进情况的趋势图。
- 🧮 汇总多个数据集表现的综合分数。
- 模型类型(聊天、代码、嵌入等)
- 提供商
- 发布年份
- 数据集类别
数据来源与方法
Phaseo 汇总以下来源的基准测试数据:- 官方研究论文和模型报告。
- 提供商 的评测页面(OpenAI Evals、Anthropic Reports 等)。
- 开放的社区数据集(例如 Hugging Face 排行榜)。
- 用户通过 GitHub 直接提交的内容。
使用场景示例
贡献基准测试数据
在 GitHub 提交问题,并附上新增或修正基准测试分数的证据。 每项提交都会经过审核,以确保一致性和准确性。贡献基准测试数据
了解基准测试问题应包含哪些证据。
后续步骤
了解基准测试数据的运作方式后,你可以探索那些通过编程方式提供这些模型的 API 提供商。探索 API 提供商
查看模型的托管位置、定价方式和访问途径。