> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 选择量化策略

> 根据工作负载选择 BF16/FP8/INT8/INT4 变体的实用框架。

按照以下流程安全地选择量化变体。

如需在 Phaseo Gateway 中强制应用此选择，请发送兼容 OpenRouter 的路由筛选器：

```json theme={null}
{
  "model": "meta/llama-3.3-70b-instruct",
  "messages": [{ "role": "user", "content": "Hello" }],
  "provider": {
    "quantizations": ["FP8"]
  }
}
```

该筛选器应用于供应商提供的具体模型，而不仅是供应商名称。匹配不区分大小写，并支持明确的别名，例如 `FP8` 对应 `float8`、`BF16` 对应 `bfloat16`。缺少量化元数据的模型不符合条件。如果没有符合条件的模型，请求会失败并返回路由诊断；Phaseo 不会回退到未经验证的量化形式。也支持等效的 `routing.quantizations` 结构。

## 步骤 1：定义成功标准

选择量化形式之前：

* 设置质量阈值（任务准确率、通过率、结构化输出的有效性）。
* 设置延迟和成本目标。
* 定义不可接受的故障模式。

## 步骤 2：选择高质量基线

先使用精度较高的基线（通常为 `BF16` 或 `FP16`），并测量：

* 输出质量
* 中位数和尾延迟
* Token/成本情况

以此作为对照基线。

## 步骤 3：逐步降低精度

逐步评估精度较低的格式：

1. `FP8` or `INT8`
2. 仅在需要降低成本或提高吞吐量时使用 `FP4` 或 `INT4`。

除非已有充分证据表明最小变体适用于你的工作负载，否则不要直接跳到该变体。

## 步骤 4：评估真实工作负载

使用接近生产环境的提示词：

* 长提示词
* 多步推理
* 工具调用
* 支持工单中的边界情况

## 步骤 5：按端点或用例选择

不必让一种量化形式适用于所有场景。

例如：

* 客户支持和关键决策：采用较高精度。
* 大批量分类或摘要：较低精度可能也可以接受。

## 建议的起点

| 工作负载类型 | 建议的起始量化形式 |
| - | - |
| 对质量要求高的推理 | `BF16` / `FP16` |
| 平衡成本与质量 | `FP8` / `INT8` |
| 高吞吐量、成本敏感型 | `INT4` / `FP4`（验证后） |

## 部署策略

* 配置备用模型或量化方案。
* 部署后监控质量漂移。
* 供应商运行时或模型版本变化时重新测试。


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.