Skip to main content
Esta guía explica los formatos de precisión habituales que encontrarás en las variantes de modelos y los entornos de inferencia.

Referencia rápida

BF16 frente a FP16

  • BF16 conserva un rango de exponentes mayor, lo que ayuda a la estabilidad.
  • FP16 sigue siendo habitual y suele ser rápido, pero puede ser menos estable en algunas cargas de trabajo.
  • En producción donde la calidad sea crítica, BF16 suele ser la opción predeterminada más segura cuando está disponible.

FP8 y FP4

  • FP8 suele mejorar bastante la eficiencia y conserva una calidad útil para muchas tareas.
  • FP4 aumenta aún más la eficiencia, pero es más probable que degrade la calidad, sobre todo en razonamiento matizado, contextos largos y salidas estructuradas estrictas.

Formatos enteros (INT8 / INT4)

  • Suelen optimizarse para el rendimiento de inferencia y el uso de memoria.
  • La calidad depende en gran medida del método de cuantización, la calibración y la arquitectura del modelo.
  • Por lo general, INT8 es más fácil de implementar de forma segura que INT4.

Interpretar las etiquetas de los modelos

Puedes encontrar etiquetas como:
  • bf16, fp16, fp8, int8, q4, 4bit, 8bit
Los nombres no están totalmente estandarizados entre proveedores. Consulta siempre la documentación del modelo o proveedor para confirmar los detalles exactos de cada variante.
Última modificación el 2 de octubre de 2026