O que são benchmarks?
Um benchmark é um conjunto de dados ou uma avaliação criada para testar o desempenho de um modelo em uma tarefa específica. Ao executar vários modelos no mesmo conjunto de dados, podemos medir seus pontos fortes e fracos relativos. Exemplos comuns:- 🧠 MMLU (Massive Multitask Language Understanding) — avalia conhecimentos gerais e raciocínio.
- 🔢 GSM8K — avalia raciocínio matemático e resolução de problemas.
- 💬 HellaSwag — avalia bom senso e compreensão contextual.
- 🧮 ARC-Challenge — mede raciocínio científico e lógica.
- 💡 HumanEval — avalia habilidades de programação e geração de código.
Como o Phaseo lida com benchmarks
O Phaseo coleta dados de benchmarks de várias fontes públicas e relatórios oficiais e os padroniza em um formato consistente. A seção de benchmarks de cada modelo inclui:- Valor da pontuação — normalmente expresso como porcentagem ou em uma escala padronizada.
- Fonte do conjunto de dados — por exemplo, MMLU, GSM8K etc.
- Método de avaliação — indica como a pontuação foi calculada (relatório oficial, avaliação de terceiros ou contribuição da comunidade).
- Última atualização — mostra quando os dados do benchmark foram atualizados pela última vez.
Exemplo de página de benchmark
Categorias de benchmarks
Os benchmarks são agrupados em categorias que representam a habilidade testada:Como interpretar as pontuações
Lembre-se de que alguns benchmarks usam sistemas de pontuação diferentes.
O Phaseo os padroniza sempre que possível para tornar as comparações mais úteis.
Visualizando benchmarks no Phaseo
Os resultados dos benchmarks são visualizados com:- 📊 Gráficos de barras para comparar modelos no mesmo conjunto de dados.
- 📈 Gráficos de tendência que mostram a evolução dos modelos ao longo do tempo.
- 🧮 Pontuações agregadas para resumir o desempenho em vários conjuntos de dados.
- Tipo de modelo (chat, código, embeddings etc.)
- Provedor
- Ano de lançamento
- Categoria do conjunto de dados
Fontes de dados e metodologia
O Phaseo reúne dados de benchmarks provenientes de:- Artigos de pesquisa e relatórios oficiais de modelos.
- Páginas de avaliação de provedores (OpenAI Evals, Anthropic Reports etc.).
- Conjuntos de dados abertos da comunidade (por exemplo, rankings do Hugging Face).
- Envios diretos de usuários pelo GitHub.
Exemplos de uso
Contribuir com dados de benchmarks
Abra uma issue no GitHub com evidências de resultados de benchmarks novos ou corrigidos. Cada envio é revisado antes da inclusão para garantir consistência e precisão.Contribuir com dados de benchmarks
Saiba quais evidências incluir em uma issue de benchmark.
Próximas etapas
Depois de entender como os dados de benchmarks funcionam, você pode explorar os provedores de API que disponibilizam esses modelos por meio de programação.Explorar provedores de API
Veja onde e como os modelos são hospedados, precificados e acessados.