Skip to main content
モデルは変えずに、1 回のリクエストでプロバイダーの候補順位を変えたい場合に使います。

目的

  • 1 回のリクエストで最安のプロバイダーを優先する。
  • 対話型の処理では最も低レイテンシのプロバイダーを優先する。
  • 大量の生成では、スループットが最も高いプロバイダーを優先してください。

1. リクエストに provider.sort を追加する

テキストリクエストでは、provider オブジェクトに希望する並べ替え方法を直接指定します。
このフローでサポートされるルーティングの並べ替え方法:
  • price
  • latency
  • throughput

2. ワークロードに合った並べ替え方法を選ぶ

次のように使います。
  • コストをテールレイテンシより重視する場合は price
  • チャット、コパイロット、人が関与するツールでは latency
  • 大量生成やバックフィルには throughput

3. ゲートウェイが比較する内容を理解する

リクエスト単位で並べ替え方法を明示すると、ゲートウェイは通常の均衡型重み付きシャッフルではなく、決定的な方法で候補を順位付けします。 テキストモデルの場合:
  • price は対象プロバイダー間で共通の価格基準を比較します
  • 共通のテキスト課金項目がある場合、ゲートウェイは input_text_tokens と output_text_tokens が一致するものを優先します
  • latency はプロバイダーの最新レイテンシデータを使います
  • throughput は最新のスループット測定値を使います

4. 現実的なプロバイダー候補群を維持する

必要に応じて候補を絞り込んでから並べ替えると、より効果的です。 たとえば、承認済みプロバイダーの候補内だけで並べ替えます。

5. 順位付けの結果を確認する

デバッグ時はGateway -> 使用状況でリクエストを確認し、次を探します:
  • 検討されたプロバイダー
  • 順位付けされたプロバイダー
  • 価格、レイテンシ、スループットに関するルーティングスコア要因
これにより、ゲートウェイが想定どおりに並べ替えたか簡単に確認できます。

関連ガイド

最終更新日 2026年10月2日