> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Contexto y presupuesto de tokens

> Cómo distribuir los tokens de entrada y salida para equilibrar calidad, velocidad y coste.

La gestión del presupuesto de tokens es una habilidad esencial para producción. Afecta directamente a la latencia, el gasto y la fiabilidad.

## Componentes del presupuesto de tokens

La carga total de una solicitud suele incluir:

* Instrucciones del sistema o del desarrollador
* Prompt o entrada del usuario
* Contexto recuperado (RAG, documentación y herramientas)
* Esquemas de herramientas o definiciones de funciones
* Tokens de salida del modelo

## Por qué importan los presupuestos

* Los prompts más largos aumentan la latencia y el coste.
* Los prompts demasiado largos pueden reducir la relevancia cuando la calidad del contexto es baja.
* Un presupuesto de salida demasiado pequeño puede truncar la respuesta y generar salidas estructuradas no válidas.

El razonamiento puede consumir el presupuesto de salida antes de que el modelo genere una respuesta. Estas
respuestas devuelven HTTP 200 con el razonamiento generado, sin inventar
una respuesta. Chat Completions conserva `reasoning_content` y `finish_reason: "length"`
al alcanzar el límite de salida. Responses conserva el elemento de salida de razonamiento e
informa de `status: "incomplete"`. Una finalización normal del proveedor sigue siendo `stop` o `completed`.

## Estrategia de presupuestación

1. Define un objetivo máximo de tokens de entrada para cada ruta.
2. Reserva margen de salida para las respuestas más largas previstas.
3. Elimina de forma agresiva el contexto de poco valor.
4. Supervisa a lo largo del tiempo la distribución real del uso de tokens.

## Medidas de protección prácticas

* Aplica límites estrictos a los tokens de entrada y salida.
* Añade reglas previas para truncar o resumir contextos extensos.
* Usa límites específicos para cada ruta (respuesta de búsqueda frente a generación extensa).
* Valida que las salidas no tengan marcadores de truncamiento ni JSON parcial.

## Errores habituales

* Copiar el mismo límite de tokens en todos los endpoints.
* Mantener prompts de sistema extensos para todos los tipos de solicitud.
* No tener en cuenta los tokens adicionales de los esquemas de herramientas.

## Recomendación

Trata los presupuestos de tokens como una configuración que requiere supervisión continua, no como una tarea que se hace una sola vez.


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.