> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 推論パラメーター

> 主要なリクエストパラメーターが品質、決定性、レイテンシ、コストに与える影響を説明します。

量子化はモデルの挙動を決める要素の半分です。\
もう半分は推論パラメーターです。

## 主なパラメーター

| パラメーター | 制御する内容 | 一般的な影響 |
| - | - | - |
| `temperature` | トークン選択のランダム性 | 高いほど創造的で変化に富み、低いほど決定的な出力になる |
| `top_p` | nucleus sampling のしきい値 | 低いほど安全で焦点の定まった出力になる |
| `top_k` | 候補トークン集合の大きさ（対応する場合） | 低いほど候補が絞られ、予測しやすくなる |
| `max_tokens` / `max_output_tokens` | 生成する出力の最大長 | コストとレイテンシを抑える一方、応答が途中で切れる場合がある |
| `stop` | 明示的な停止シーケンス | 出力の区切り方とパーサーの信頼性を高める |
| `seed` | 乱数シード（対応する場合） | デバッグやテストの再現性を高める |

## 組み合わせで注意する点

* `temperature` と `top_p` はどちらもランダム性に影響します。調整時は一度に一方だけ変更します。
* 低ビットの強い量子化と高いランダム性を組み合わせると、出力が不安定になりやすくなります。
* `max_tokens` が小さいと、単なる出力の切り詰めがモデルの失敗に見えることがあります。

## 推奨する初期値

* `temperature`: 必要な創造性に応じて `0.2`～`0.7`
* `top_p`: `0.9`～`1.0`
* `max_tokens`: 一律に大きな値を使わず、想定する出力の種類に合わせて設定します

## 調整の手順

1. 最初に量子化を決めます。
2. 評価セットを固定します。
3. 一度に一つのパラメーターだけを変えます。
4. 品質、レイテンシ、トークン使用量を比較します。
5. エンドポイントや用途ごとに別のプリセットを用意します。


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.