Os benchmarks servem de base para comparar modelos e provedores. Esta página explica como os dados chegam à plataforma e como mantemos a consistência.
Fontes de dados
- Lançamentos oficiais — Anúncios de provedores, blogs técnicos e materiais de imprensa.
- Artigos acadêmicos — Publicações revisadas por pares e preprints do arXiv com resultados reproduzíveis.
- Contribuições da comunidade — Contribuições verificadas da comunidade Phaseo e de parceiros.
Toda pontuação precisa incluir uma referência pública ou uma avaliação reproduzível antes de ser aceita.
Normalização
Padronizamos nomes, métricas e divisões dos benchmarks para tornar precisas as comparações entre modelos:
- Associe cada envio a um ID interno de benchmark.
- Converta as métricas informadas para uma escala canônica (por exemplo, porcentagens).
- Registre desvios, como variantes few-shot ou sistemas de avaliação personalizados.
- Execute uma validação automatizada para verificar se os campos e intervalos são coerentes.
Frequência das atualizações
- Semanalmente para conjuntos populares como MMLU, GSM8K e HumanEval.
- Mensalmente para benchmarks de nicho ou emergentes.
- Sob demanda, quando provedores ou membros da comunidade enviam avaliações de alta qualidade.
Atualizações grandes geram entradas no changelog para que você possa acompanhar as mudanças históricas.
Transparência e reprodutibilidade
Ciclo de feedback
Se encontrar divergências ou dados ausentes:
- Abra uma issue com as evidências descritas em Enviar resultados de benchmarks.
- Responda às perguntas de revisão na issue. Os mantenedores publicam correções verificadas pelo editor do banco de dados.
- Entre em contato pelo Discord para coordenar pesquisas maiores.
Analisamos todos os relatos e fornecemos atualizações de status enquanto o benchmark é verificado. Última modificação em 2 de outubro de 2026