Skip to main content
Método: client.generate_response() (transmita partes processadas com client.stream_responses()).

Exemplo

Transmissão contínua

Parâmetros principais

  • model (obrigatório): ID do modelo de destino.
  • input (obrigatório): matriz ordenada de itens de entrada (mensagens, chamadas de ferramentas etc.).
  • temperature (0–2): quanto maior o valor, mais aleatório será o resultado.
  • top_p (0–1) / top_k (>=1): controles de amostragem por núcleo e dos k melhores candidatos.
  • max_output_tokens (inteiro): limite máximo de tokens gerados por resposta.
  • Ferramentas: tools (definições), tool_choice (auto/none/específica), max_tool_calls (inteiro), parallel_tool_calls (booleano).
  • Logprobs: logprobs (booleano), top_logprobs (0–20) para retornar logprobs por token.
  • Saída: response_format (json/text), service_tier, store (booleano), stream (booleano).
  • Metadados: metadata (objeto repassado), reasoning (objeto com indicações de esforço).
  • Extras do gateway: usage (booleano para solicitar o uso), meta (booleano para incluir o bloco meta).

Retorna

ResponsesResponse
Ou quadros SSE delimitados por quebras de linha quando stream: true:
Última modificação em 2 de outubro de 2026