Skip to main content
Les benchmarks sont au cœur de la mesure de la qualité et des progrès des modèles sur Phaseo. Ils fournissent des mesures objectives et reproductibles pour comparer les performances des modèles selon les tâches, les domaines et les fournisseurs, du raisonnement et du code à la compréhension du langage et à la reconnaissance d’images.

Que sont les benchmarks ?

Un benchmark est un jeu de données ou une évaluation conçu pour tester les performances d’un modèle sur une tâche précise. En évaluant plusieurs modèles sur le même jeu de données, nous pouvons mesurer leurs forces et leurs faiblesses respectives. Exemples courants :
  • 🧠 MMLU (Massive Multitask Language Understanding) — évalue les connaissances générales et le raisonnement.
  • 🔢 GSM8K — évalue le raisonnement mathématique et la résolution de problèmes.
  • 💬 HellaSwag — évalue le bon sens et la compréhension du contexte.
  • 🧮 ARC-Challenge — mesure le raisonnement scientifique et la logique.
  • 💡 HumanEval — évalue les compétences en programmation et en génération de code.

Comment Phaseo gère les benchmarks

Phaseo collecte des données de benchmark à partir de plusieurs sources publiques et de rapports officiels, puis les normalise dans un format cohérent. La section des benchmarks de chaque modèle comprend :
  • Valeur du score — généralement exprimée en pourcentage ou sur une échelle normalisée.
  • Source du jeu de données — par exemple MMLU, GSM8K, etc.
  • Méthode d’évaluation — indique comment le score a été obtenu (rapport officiel, évaluation tierce ou contribution de la communauté).
  • Dernière mise à jour — indique la date de la dernière actualisation des données du benchmark.

Exemple de page de benchmark


Catégories de benchmarks

Les benchmarks sont regroupés en catégories correspondant à la compétence évaluée :

Comment interpréter les scores

N’oubliez pas que certains benchmarks utilisent des systèmes de notation différents. Phaseo les normalise lorsque c’est possible afin de rendre les comparaisons plus pertinentes.

Visualiser les benchmarks sur Phaseo

Les résultats des benchmarks sont visualisés à l’aide de :
  • 📊 Graphiques à barres pour comparer des modèles sur un même jeu de données.
  • 📈 Graphiques de tendance montrant l’évolution des modèles au fil du temps.
  • 🧮 Scores agrégés pour résumer les performances sur plusieurs jeux de données.
Chaque jeu de données de benchmark sur Phaseo comporte des filtres pour :
  • Type de modèle (chat, code, embeddings, etc.)
  • Fournisseur
  • Année de sortie
  • Catégorie du jeu de données
Vous pouvez ainsi repérer rapidement des tendances, par exemple les familles qui dominent les tâches de raisonnement ou de programmation.

Sources des données et méthodologie

Phaseo rassemble des données de benchmark issues de :
  • Articles de recherche et rapports de modèles officiels.
  • Pages d’évaluation des fournisseurs (OpenAI Evals, Anthropic Reports, etc.).
  • Jeux de données communautaires ouverts (par exemple les classements Hugging Face).
  • Contributions directes des utilisateurs via GitHub.
Toutes les données sont normalisées et vérifiées avant leur publication. Consultez Recherche et méthodologie → Méthodologie des benchmarks pour plus de détails.

Exemples d’utilisation


Contribuer aux données de benchmark

Ouvrez une issue GitHub avec des preuves pour les scores de benchmark nouveaux ou corrigés. Chaque contribution est vérifiée avant son ajout afin de garantir la cohérence et l’exactitude.

Contribuer aux données de benchmark

Découvrez les preuves à inclure dans une issue de benchmark.

Étapes suivantes

Une fois que vous comprenez le fonctionnement des données de benchmark, vous pouvez découvrir les fournisseurs d’API qui rendent ces modèles accessibles par programmation.

Explorer les fournisseurs d’API

Découvrez où et comment les modèles sont hébergés, tarifés et accessibles.
Dernière modification le 2 octobre 2026