Benchmarks bilden die Grundlage für Vergleiche zwischen Modellen und Anbietern. Diese Seite erklärt, wie Daten in die Plattform gelangen und wie wir für einheitliche Angaben sorgen.
Datenquellen
- Offizielle Veröffentlichungen — Ankündigungen von Anbietern, technische Blogs und Presseinformationen.
- Wissenschaftliche Arbeiten — Peer-reviewte Veröffentlichungen und arXiv-Preprints mit reproduzierbaren Ergebnissen.
- Beiträge aus der Community — Verifizierte Beiträge aus der Phaseo-Community und von Partnern.
Jeder Score muss vor der Annahme eine öffentliche Quelle oder eine reproduzierbare Evaluierung enthalten.
Normalisierung
Wir vereinheitlichen Benchmark-Namen, Metriken und Splits, damit Vergleiche zwischen Modellen aussagekräftig sind:
- Ordne jeden Beitrag einer internen Benchmark-ID zu.
- Überführe gemeldete Metriken in eine einheitliche Skala (zum Beispiel Prozentwerte).
- Vermerke Abweichungen wie Few-Shot-Varianten oder benutzerdefinierte Evaluierungs-Harnesses.
- Führe eine automatische Validierung aus, um Felder und Wertebereiche auf Plausibilität zu prüfen.
Aktualisierungsrhythmus
- Wöchentlich für verbreitete Suites wie MMLU, GSM8K und HumanEval.
- Monatlich für Nischen- oder neue Benchmarks.
- Bei Bedarf, wenn Anbieter oder Community-Mitglieder hochwertige Evaluierungen einreichen.
Größere Aktualisierungen führen zu Changelog-Einträgen, damit du historische Änderungen nachvollziehen kannst.
Transparenz und Reproduzierbarkeit
Feedbackschleife
Wenn dir Abweichungen oder fehlende Daten auffallen:
- Erstelle ein Issue mit den unter Benchmark-Ergebnisse einreichen beschriebenen Belegen.
- Beantworte Rückfragen im Issue. Verifizierte Korrekturen werden im Datenbankeditor veröffentlicht.
- Stimme größere Forschungseinreichungen über Discord ab.
Wir prüfen jeden Bericht und halten dich mit Statusmeldungen auf dem Laufenden, während der Benchmark überprüft wird. Zuletzt geändert am 2. Oktober 2026