Skip to main content
本指南介绍模型变体和推理运行环境中常见的精度格式。

快速参考

BF16 与 FP16

  • BF16 保留了更大的指数范围,有助于提高稳定性。
  • FP16 仍很常见且通常速度较快,但在某些工作负载下稳定性可能较差。
  • 在质量要求高的生产流程中,如果可用,BF16 通常是更安全的默认选择。

FP8 和 FP4

  • FP8 通常能显著提升效率,同时在许多任务中保持可用的质量。
  • FP4 能进一步提升效率,但更容易降低质量,尤其是在细致推理、长上下文和严格结构化输出场景中。

整数格式(INT8 / INT4)

  • 通常针对推理吞吐量和内存占用进行优化。
  • 质量很大程度上取决于量化方法、校准和模型架构。
  • 通常,INT8 比 INT4 更容易安全部署。

查看模型标签

你可能会看到以下标签:
  • bf16, fp16, fp8, int8, q4, 4bit, 8bit
不同供应商的命名并未完全统一。请务必查阅模型或供应商文档,确认具体变体的详细信息。
最后修改于 2026年10月2日