> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 量化格式

> BF16、FP16、FP8、FP4、INT8、INT4，以及每种格式在实践中的含义。

本指南介绍模型变体和推理运行环境中常见的精度格式。

## 快速参考

| 格式 | 常见用途 | 主要优势 | 主要风险 |
| - | - | - | - |
| `FP32` | 基准/全精度 | 数值稳定性最高 | 内存和计算成本最高 |
| `BF16` | 训练和高质量推理 | 质量出色，效率优于 `FP32` | 仍比 8 位/4 位格式更占资源 |
| `FP16` | 常见推理/训练流程 | 速度快且减少内存占用 | 动态范围小于 `BF16` |
| `FP8` | 面向吞吐量的推理/训练 | 速度和内存效率显著提升 | 复杂提示词下质量下降明显 |
| `FP4` | 激进的效率模式 | 密度很高且成本低 | 输出质量下降风险更高 |
| `INT8` | 支持范围广的推理量化 | 效率高，对质量影响适中 | 某些模型存在校准/敏感性问题 |
| `INT4` | 成本敏感型部署 | 内存占用极低、吞吐量高 | 质量和稳健性方面的权衡更大 |

## `BF16` 与 `FP16`

* `BF16` 保留了更大的指数范围，有助于提高稳定性。
* `FP16` 仍很常见且通常速度较快，但在某些工作负载下稳定性可能较差。
* 在质量要求高的生产流程中，如果可用，`BF16` 通常是更安全的默认选择。

## `FP8` 和 `FP4`

* `FP8` 通常能显著提升效率，同时在许多任务中保持可用的质量。
* `FP4` 能进一步提升效率，但更容易降低质量，尤其是在细致推理、长上下文和严格结构化输出场景中。

## 整数格式（`INT8` / `INT4`）

* 通常针对推理吞吐量和内存占用进行优化。
* 质量很大程度上取决于量化方法、校准和模型架构。
* 通常，`INT8` 比 `INT4` 更容易安全部署。

## 查看模型标签

你可能会看到以下标签：

* `bf16`, `fp16`, `fp8`, `int8`, `q4`, `4bit`, `8bit`

不同供应商的命名并未完全统一。请务必查阅模型或供应商文档，确认具体变体的详细信息。


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.