Skip to main content
Os benchmarks são fundamentais para medir a qualidade e a evolução dos modelos no Phaseo. Eles fornecem métricas objetivas e reproduzíveis para comparar o desempenho dos modelos em diferentes tarefas, domínios e provedores, de raciocínio e programação a compreensão de linguagem e reconhecimento de imagens.

O que são benchmarks?

Um benchmark é um conjunto de dados ou uma avaliação criada para testar o desempenho de um modelo em uma tarefa específica. Ao executar vários modelos no mesmo conjunto de dados, podemos medir seus pontos fortes e fracos relativos. Exemplos comuns:
  • 🧠 MMLU (Massive Multitask Language Understanding) — avalia conhecimentos gerais e raciocínio.
  • 🔢 GSM8K — avalia raciocínio matemático e resolução de problemas.
  • 💬 HellaSwag — avalia bom senso e compreensão contextual.
  • 🧮 ARC-Challenge — mede raciocínio científico e lógica.
  • 💡 HumanEval — avalia habilidades de programação e geração de código.

Como o Phaseo lida com benchmarks

O Phaseo coleta dados de benchmarks de várias fontes públicas e relatórios oficiais e os padroniza em um formato consistente. A seção de benchmarks de cada modelo inclui:
  • Valor da pontuação — normalmente expresso como porcentagem ou em uma escala padronizada.
  • Fonte do conjunto de dados — por exemplo, MMLU, GSM8K etc.
  • Método de avaliação — indica como a pontuação foi calculada (relatório oficial, avaliação de terceiros ou contribuição da comunidade).
  • Última atualização — mostra quando os dados do benchmark foram atualizados pela última vez.

Exemplo de página de benchmark


Categorias de benchmarks

Os benchmarks são agrupados em categorias que representam a habilidade testada:

Como interpretar as pontuações

Lembre-se de que alguns benchmarks usam sistemas de pontuação diferentes. O Phaseo os padroniza sempre que possível para tornar as comparações mais úteis.

Visualizando benchmarks no Phaseo

Os resultados dos benchmarks são visualizados com:
  • 📊 Gráficos de barras para comparar modelos no mesmo conjunto de dados.
  • 📈 Gráficos de tendência que mostram a evolução dos modelos ao longo do tempo.
  • 🧮 Pontuações agregadas para resumir o desempenho em vários conjuntos de dados.
Cada conjunto de dados de benchmark no Phaseo inclui filtros para:
  • Tipo de modelo (chat, código, embeddings etc.)
  • Provedor
  • Ano de lançamento
  • Categoria do conjunto de dados
Isso permite identificar padrões rapidamente, como quais famílias se destacam em tarefas de raciocínio ou programação.

Fontes de dados e metodologia

O Phaseo reúne dados de benchmarks provenientes de:
  • Artigos de pesquisa e relatórios oficiais de modelos.
  • Páginas de avaliação de provedores (OpenAI Evals, Anthropic Reports etc.).
  • Conjuntos de dados abertos da comunidade (por exemplo, rankings do Hugging Face).
  • Envios diretos de usuários pelo GitHub.
Todos os dados são padronizados e verificados antes da publicação. Consulte Pesquisa e metodologia → Metodologia de benchmarks para ver todos os detalhes.

Exemplos de uso


Contribuir com dados de benchmarks

Abra uma issue no GitHub com evidências de resultados de benchmarks novos ou corrigidos. Cada envio é revisado antes da inclusão para garantir consistência e precisão.

Contribuir com dados de benchmarks

Saiba quais evidências incluir em uma issue de benchmark.

Próximas etapas

Depois de entender como os dados de benchmarks funcionam, você pode explorar os provedores de API que disponibilizam esses modelos por meio de programação.

Explorar provedores de API

Veja onde e como os modelos são hospedados, precificados e acessados.
Última modificação em 2 de outubro de 2026