Skip to main content
Este guia explica os formatos de precisão comuns em variantes de modelos e ambientes de inferência.

Referência rápida

BF16 versus FP16

  • BF16 mantém uma faixa de expoentes maior, o que ajuda na estabilidade.
  • FP16 ainda é comum e costuma ser rápido, mas pode ser menos estável em algumas cargas de trabalho.
  • Em fluxos de produção que exigem qualidade, BF16 costuma ser a opção padrão mais segura quando disponível.

FP8 e FP4

  • FP8 costuma trazer um bom ganho de eficiência e manter uma qualidade útil em muitas tarefas.
  • FP4 aumenta ainda mais a eficiência, mas torna a degradação da qualidade mais provável, especialmente em raciocínios sutis, contextos longos e saídas estruturadas rígidas.

Formatos inteiros (INT8 / INT4)

  • Geralmente otimizados para vazão de inferência e uso de memória.
  • A qualidade depende bastante do método de quantização, da calibração e da arquitetura do modelo.
  • Em geral, INT8 é mais fácil de implantar com segurança que INT4.

Interpretar rótulos de modelos

Você pode encontrar rótulos como:
  • bf16, fp16, fp8, int8, q4, 4bit, 8bit
Os nomes não são totalmente padronizados entre provedores. Sempre confira os detalhes exatos da variante na documentação do modelo ou do provedor.
Última modificação em 2 de outubro de 2026