Sources des données
- Sources officielles — Annonces des fournisseurs, blogs techniques et dossiers de presse.
- Articles universitaires — Publications évaluées par des pairs et prépublications arXiv avec des résultats reproductibles.
- Contributions de la communauté — Contributions vérifiées de la communauté Phaseo et de ses partenaires.
Normalisation
Nous harmonisons les noms, métriques et partitions des benchmarks afin de rendre les comparaisons entre modèles précises :- Associer chaque contribution à un ID de benchmark interne.
- Convertir les métriques publiées sur une échelle canonique (par exemple, en pourcentages).
- Signaler les écarts, tels que les variantes few-shot ou les systèmes d’évaluation personnalisés.
- Exécuter une validation automatisée pour vérifier la cohérence des champs et des plages de valeurs.
Fréquence des mises à jour
- Chaque semaine pour les suites populaires telles que MMLU, GSM8K et HumanEval.
- Chaque mois pour les benchmarks spécialisés ou émergents.
- À la demande, lorsque des fournisseurs ou membres de la communauté soumettent des évaluations de qualité.
Transparence et reproductibilité
Boucle de retour
Si vous constatez des écarts ou des données manquantes :- Ouvrez une issue avec les preuves décrites dans Soumettre des scores de benchmark.
- Répondez aux questions de révision dans l’issue. Les responsables publient les corrections vérifiées dans l’éditeur de base de données.
- Contactez-nous sur Discord pour coordonner des soumissions de recherche plus importantes.