Skip to main content
量化决定模型行为的一半。
另一半由推理参数决定。

核心参数

需要留意的相互作用

  • temperature 和 top_p 都会影响随机性。调优时一次只改一个参数。
  • 激进的低比特量化与高随机性叠加,可能会放大输出的不稳定。
  • max_tokens 过低时,回答被截断可能看起来像模型出错。

建议的起始值

  • temperature:根据所需的创意程度设为 0.2 到 0.7
  • top_p:0.9 到 1.0
  • max_tokens:根据预期输出长度设置,不要对所有情况都使用很大的值

调优流程

  1. 先固定量化方式。
  2. 固定一组评估数据。
  3. 每次只调整一个参数。
  4. 比较质量、延迟和 token 用量。
  5. 针对不同端点和使用场景使用不同的预设。
最后修改于 2026年10月2日