另一半由推理参数决定。
核心参数
需要留意的相互作用
temperature和top_p都会影响随机性。调优时一次只改一个参数。- 激进的低比特量化与高随机性叠加,可能会放大输出的不稳定。
max_tokens过低时,回答被截断可能看起来像模型出错。
建议的起始值
temperature:根据所需的创意程度设为0.2到0.7top_p:0.9到1.0max_tokens:根据预期输出长度设置,不要对所有情况都使用很大的值
调优流程
- 先固定量化方式。
- 固定一组评估数据。
- 每次只调整一个参数。
- 比较质量、延迟和 token 用量。
- 针对不同端点和使用场景使用不同的预设。