Skip to main content
Méthode : client.generate_response() (diffusez les fragments analysés avec client.stream_responses()).

Exemple

Diffusion en continu

Paramètres clés

  • model (obligatoire) : ID du modèle cible.
  • input (obligatoire) : tableau ordonné d’éléments d’entrée (messages, appels d’outils, etc.).
  • temperature (0–2) : plus la valeur est élevée, plus le résultat est aléatoire.
  • top_p (0–1) / top_k (>=1) : contrôles d’échantillonnage par noyau et des k meilleurs candidats.
  • max_output_tokens (entier) : nombre maximal de tokens générés par réponse.
  • Outils : tools (définitions), tool_choice (auto/none/spécifique), max_tool_calls (entier), parallel_tool_calls (booléen).
  • Logprobs : logprobs (booléen), top_logprobs (0–20) pour renvoyer les logprobs par token.
  • Sortie : response_format (json/text), service_tier, store (booléen), stream (booléen).
  • Métadonnées : metadata (objet transmis), reasoning (objet indiquant le niveau d’effort).
  • Options de la passerelle : usage (booléen pour demander les données d’utilisation), meta (booléen pour inclure le bloc meta).

Retour

ResponsesResponse
Ou des trames SSE délimitées par des retours à la ligne lorsque stream: true :
Dernière modification le 2 octobre 2026