Este guia explica os formatos de precisão comuns em variantes de modelos e ambientes de inferência.
Referência rápida
BF16 versus FP16
BF16 mantém uma faixa de expoentes maior, o que ajuda na estabilidade.
FP16 ainda é comum e costuma ser rápido, mas pode ser menos estável em algumas cargas de trabalho.
- Em fluxos de produção que exigem qualidade,
BF16 costuma ser a opção padrão mais segura quando disponível.
FP8 e FP4
FP8 costuma trazer um bom ganho de eficiência e manter uma qualidade útil em muitas tarefas.
FP4 aumenta ainda mais a eficiência, mas torna a degradação da qualidade mais provável, especialmente em raciocínios sutis, contextos longos e saídas estruturadas rígidas.
- Geralmente otimizados para vazão de inferência e uso de memória.
- A qualidade depende bastante do método de quantização, da calibração e da arquitetura do modelo.
- Em geral,
INT8 é mais fácil de implantar com segurança que INT4.
Interpretar rótulos de modelos
Você pode encontrar rótulos como:
bf16, fp16, fp8, int8, q4, 4bit, 8bit
Os nomes não são totalmente padronizados entre provedores. Sempre confira os detalhes exatos da variante na documentação do modelo ou do provedor. Última modificação em 2 de outubro de 2026