Esta guía explica los formatos de precisión habituales que encontrarás en las variantes de modelos y los entornos de inferencia.
Referencia rápida
BF16 frente a FP16
BF16 conserva un rango de exponentes mayor, lo que ayuda a la estabilidad.
FP16 sigue siendo habitual y suele ser rápido, pero puede ser menos estable en algunas cargas de trabajo.
- En producción donde la calidad sea crítica,
BF16 suele ser la opción predeterminada más segura cuando está disponible.
FP8 y FP4
FP8 suele mejorar bastante la eficiencia y conserva una calidad útil para muchas tareas.
FP4 aumenta aún más la eficiencia, pero es más probable que degrade la calidad, sobre todo en razonamiento matizado, contextos largos y salidas estructuradas estrictas.
- Suelen optimizarse para el rendimiento de inferencia y el uso de memoria.
- La calidad depende en gran medida del método de cuantización, la calibración y la arquitectura del modelo.
- Por lo general,
INT8 es más fácil de implementar de forma segura que INT4.
Interpretar las etiquetas de los modelos
Puedes encontrar etiquetas como:
bf16, fp16, fp8, int8, q4, 4bit, 8bit
Los nombres no están totalmente estandarizados entre proveedores. Consulta siempre la documentación del modelo o proveedor para confirmar los detalles exactos de cada variante. Última modificación el 2 de octubre de 2026