> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 推理参数

> 核心请求参数如何影响质量、确定性、延迟和成本。

量化决定模型行为的一半。\
另一半由推理参数决定。

## 核心参数

| 参数 | 控制内容 | 常见影响 |
| - | - | - |
| `temperature` | 选择 token 时的随机性 | 值越高，输出越有创意且变化越大；值越低，输出越确定 |
| `top_p` | 核采样阈值 | 值越低，输出越稳妥、越聚焦 |
| `top_k` | 候选 token 池大小（受支持时） | 值越低，候选范围越窄，输出越可预测 |
| `max_tokens` / `max_output_tokens` | 生成内容的最大长度 | 限制成本和延迟，但可能截断回答 |
| `stop` | 显式停止序列 | 改善输出格式和解析器的可靠性 |
| `seed` | 随机种子（受支持时） | 提高调试和测试时的可复现性 |

## 需要留意的相互作用

* `temperature` 和 `top_p` 都会影响随机性。调优时一次只改一个参数。
* 激进的低比特量化与高随机性叠加，可能会放大输出的不稳定。
* `max_tokens` 过低时，回答被截断可能看起来像模型出错。

## 建议的起始值

* `temperature`：根据所需的创意程度设为 `0.2` 到 `0.7`
* `top_p`：`0.9` 到 `1.0`
* `max_tokens`：根据预期输出长度设置，不要对所有情况都使用很大的值

## 调优流程

1. 先固定量化方式。
2. 固定一组评估数据。
3. 每次只调整一个参数。
4. 比较质量、延迟和 token 用量。
5. 针对不同端点和使用场景使用不同的预设。


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.