Skip to main content
Método: client.generate_response() (transmite fragmentos procesados con client.stream_responses()).

Ejemplo

Transmisión

Parámetros clave

  • model (obligatorio): ID del modelo de destino.
  • input (obligatorio): matriz ordenada de elementos de entrada (mensajes, llamadas a herramientas, etc.).
  • temperature (0–2): cuanto mayor sea el valor, más aleatorio será el resultado.
  • top_p (0–1) / top_k (>=1): controles de muestreo por núcleo y de los k mejores candidatos.
  • max_output_tokens (entero): límite máximo de tokens generados por respuesta.
  • Herramientas: tools (definiciones), tool_choice (auto/none/específica), max_tool_calls (entero), parallel_tool_calls (booleano).
  • Logprobs: logprobs (booleano), top_logprobs (0–20) para devolver logprobs por token.
  • Salida: response_format (json/text), service_tier, store (booleano), stream (booleano).
  • Metadatos: metadata (objeto transferido), reasoning (objeto con indicaciones de esfuerzo).
  • Extras del gateway: usage (booleano para solicitar el uso), meta (booleano para incluir el bloque meta).

Devuelve

ResponsesResponse
O tramas SSE delimitadas por salto de línea cuando stream: true:
Última modificación el 2 de octubre de 2026