Que sont les benchmarks ?
Un benchmark est un jeu de données ou une évaluation conçu pour tester les performances d’un modèle sur une tâche précise. En évaluant plusieurs modèles sur le même jeu de données, nous pouvons mesurer leurs forces et leurs faiblesses respectives. Exemples courants :- 🧠MMLU (Massive Multitask Language Understanding) — évalue les connaissances générales et le raisonnement.
- 🔢 GSM8K — évalue le raisonnement mathématique et la résolution de problèmes.
- 💬 HellaSwag — évalue le bon sens et la compréhension du contexte.
- 🧮 ARC-Challenge — mesure le raisonnement scientifique et la logique.
- 💡 HumanEval — évalue les compétences en programmation et en génération de code.
Comment Phaseo gère les benchmarks
Phaseo collecte des données de benchmark à partir de plusieurs sources publiques et de rapports officiels, puis les normalise dans un format cohérent. La section des benchmarks de chaque modèle comprend :- Valeur du score — généralement exprimée en pourcentage ou sur une échelle normalisée.
- Source du jeu de données — par exemple MMLU, GSM8K, etc.
- Méthode d’évaluation — indique comment le score a été obtenu (rapport officiel, évaluation tierce ou contribution de la communauté).
- Dernière mise à jour — indique la date de la dernière actualisation des données du benchmark.
Exemple de page de benchmark
Catégories de benchmarks
Les benchmarks sont regroupés en catégories correspondant à la compétence évaluée :Comment interpréter les scores
N’oubliez pas que certains benchmarks utilisent des systèmes de notation différents.
Phaseo les normalise lorsque c’est possible afin de rendre les comparaisons plus pertinentes.
Visualiser les benchmarks sur Phaseo
Les résultats des benchmarks sont visualisés à l’aide de :- 📊 Graphiques à barres pour comparer des modèles sur un même jeu de données.
- 📈 Graphiques de tendance montrant l’évolution des modèles au fil du temps.
- 🧮 Scores agrégés pour résumer les performances sur plusieurs jeux de données.
- Type de modèle (chat, code, embeddings, etc.)
- Fournisseur
- Année de sortie
- Catégorie du jeu de données
Sources des données et méthodologie
Phaseo rassemble des données de benchmark issues de :- Articles de recherche et rapports de modèles officiels.
- Pages d’évaluation des fournisseurs (OpenAI Evals, Anthropic Reports, etc.).
- Jeux de données communautaires ouverts (par exemple les classements Hugging Face).
- Contributions directes des utilisateurs via GitHub.
Exemples d’utilisation
Contribuer aux données de benchmark
Ouvrez une issue GitHub avec des preuves pour les scores de benchmark nouveaux ou corrigés. Chaque contribution est vérifiée avant son ajout afin de garantir la cohérence et l’exactitude.Contribuer aux données de benchmark
Découvrez les preuves à inclure dans une issue de benchmark.
Étapes suivantes
Une fois que vous comprenez le fonctionnement des données de benchmark, vous pouvez découvrir les fournisseurs d’API qui rendent ces modèles accessibles par programmation.Explorer les fournisseurs d’API
Découvrez où et comment les modèles sont hébergés, tarifés et accessibles.