> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 探索基准测试

> 了解 Phaseo 如何收集、标准化和可视化 AI 模型基准测试。

基准测试是 Phaseo 衡量模型质量与进步的核心方式。
它们提供**客观、可重复的指标**，帮助你比较模型在不同任务、领域和提供商上的表现，涵盖推理、编程、语言理解和图像识别。

***

## 什么是基准测试？

**基准测试**是用于评估模型在特定任务上表现的数据集或评测。
通过在同一数据集上运行多个模型，我们可以衡量它们各自的优势和不足。

常见示例包括：

* 🧠 **MMLU (Massive Multitask Language Understanding)** — 测试通识知识和推理能力。
* 🔢 **GSM8K** — 测试数学推理和问题解决能力。
* 💬 **HellaSwag** — 评估常识和上下文理解能力。
* 🧮 **ARC-Challenge** — 衡量科学推理和逻辑能力。
* 💡 **HumanEval** — 评估编程和代码生成能力。

***

## Phaseo 如何处理基准测试

Phaseo 从**多个公开来源**和**官方报告**收集基准测试数据，再将其标准化为统一格式。

每个模型的基准测试部分都包含：

* **分数值** — 通常以百分比或标准化尺度表示。
* **数据集来源** — 例如 MMLU、GSM8K 等。
* **评估方法** — 说明分数的来源（官方报告、第三方评测或社区提交）。
* **最后更新** — 显示基准测试数据最近一次刷新的时间。

***

## 基准测试页面示例

***

## 基准测试类别

基准测试按所评估的能力类别分组：

| 类别 | 示例 | 说明 |
| - | - | - |
| **推理** | MMLU, GSM8K, ARC | 测试通用逻辑、多步推理和问题解决能力。 |
| **语言理解** | HellaSwag, BoolQ, PIQA | 衡量阅读理解、常识和语言能力。 |
| **代码生成** | HumanEval, MBPP | 评估编程和代码合成的准确性。 |
| **数学与科学** | GSM8K, MATH, SciQ | 侧重于数值推理和科学推理。 |
| **多模态** | MathVista, MMMU | 结合文本和视觉理解任务。 |

***

## 如何解读分数

| 数值范围 | 解读 |
| - | - |
| **90-100%** | 卓越 — 接近最先进水平的表现。 |
| **80-89%** | 优秀 — 适用于大多数生产场景。 |
| **60-79%** | 良好 — 通用任务表现可靠，但在边缘场景中可能遇到困难。 |
| **\< 60%** | 发展中 — 更适合实验或研究场景。 |

请注意，有些基准测试采用**不同的评分体系**。
Phaseo 会在可能的情况下对其进行标准化，让比较更有意义。

***

## 在 Phaseo 上查看基准测试图表

基准测试结果通过以下方式可视化：

* 📊 用于比较同一数据集内模型的**柱状图**。
* 📈 展示模型随时间改进情况的**趋势图**。
* 🧮 汇总多个数据集表现的**综合分数**。

Phaseo 上的每个基准测试数据集都包含以下筛选条件：

* 模型类型（聊天、代码、嵌入等）
* 提供商
* 发布年份
* 数据集类别

这样你就能快速发现规律，例如哪些模型系列在推理或编程任务中领先。

***

## 数据来源与方法

Phaseo 汇总以下来源的基准测试数据：

* 官方研究论文和模型报告。
* 提供商 的评测页面（OpenAI Evals、Anthropic Reports 等）。
* 开放的社区数据集（例如 Hugging Face 排行榜）。
* 用户通过 GitHub 直接提交的内容。

所有数据都会经过标准化和验证后再发布。
详情请参阅[研究与方法 → 基准测试方法](../research/benchmark-methodology.mdx)。

***

## 使用场景示例

| 目标 | 示例 |
| - | - |
| 比较推理模型 | “哪个模型在 GSM8K 上的分数最高？” |
| 评估成本与性能的权衡 | “与 Claude 3.5 Sonnet 相比，GPT-4o 更高的成本是否值得？” |
| 跟踪年度进展 | “自 2022 年以来，MMLU 准确率提高了多少？” |
| 按类别研究基准测试 | “哪些模型在多模态推理方面领先？” |

***

## 贡献基准测试数据

在 GitHub 提交问题，并附上新增或修正基准测试分数的证据。
每项提交都会经过审核，以确保一致性和准确性。

<Card title="贡献基准测试数据" icon="github" href="../research/submitting-scores.mdx" horizontal>
  了解基准测试问题应包含哪些证据。
</Card>

***

## 后续步骤

了解基准测试数据的运作方式后，你可以探索那些通过编程方式提供这些模型的 **API 提供商**。

<Card title="探索 API 提供商" icon="network" href="./api-providers.mdx" horizontal>
  查看模型的托管位置、定价方式和访问途径。
</Card>


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.