Was sind Benchmarks?
Ein Benchmark ist ein Datensatz oder eine Auswertung, mit der die Leistung eines Modells bei einer bestimmten Aufgabe getestet wird. Indem wir mehrere Modelle mit demselben Datensatz ausführen, können wir ihre relativen Stärken und Schwächen messen. Häufige Beispiele sind:- 🧠MMLU (Massive Multitask Language Understanding) – prüft Allgemeinwissen und logisches Schlussfolgern.
- 🔢 GSM8K – prüft mathematisches Denken und Problemlösungsfähigkeiten.
- 💬 HellaSwag – bewertet Alltagswissen und Kontextverständnis.
- 🧮 ARC-Challenge – misst wissenschaftliches Denken und Logik.
- 💡 HumanEval – bewertet Programmier- und Codegenerierungsfähigkeiten.
So geht Phaseo mit Benchmarks um
Phaseo sammelt Benchmark-Daten aus mehreren öffentlichen Quellen und offiziellen Berichten und bringt sie anschließend in ein einheitliches Format. Der Benchmark-Abschnitt jedes Modells enthält:- Punktzahl – meist als Prozentwert oder auf einer normalisierten Skala angegeben.
- Datensatzquelle – z. B. MMLU, GSM8K usw.
- Evaluierungsmethode – gibt an, wie die Punktzahl ermittelt wurde (offizieller Bericht, Bewertung durch Dritte oder Community-Beitrag).
- Zuletzt aktualisiert – zeigt, wann die Benchmark-Daten zuletzt aktualisiert wurden.
Beispiel für eine Benchmark-Seite
Benchmark-Kategorien
Benchmarks werden nach der geprüften Fähigkeit kategorisiert:Punktzahlen interpretieren
Beachte, dass manche Benchmarks unterschiedliche Bewertungssysteme verwenden.
Phaseo normalisiert diese nach Möglichkeit, damit Vergleiche aussagekräftiger sind.
Benchmarks auf Phaseo visualisieren
Benchmark-Ergebnisse werden wie folgt visualisiert:- 📊 Balkendiagramme zum Vergleich von Modellen innerhalb desselben Datensatzes.
- 📈 Trenddiagramme zeigen, wie sich Modelle im Laufe der Zeit verbessern.
- 🧮 Gesamtpunktzahlen fassen die Leistung über mehrere Datensätze hinweg zusammen.
- Modelltyp (Chat, Code, Embeddings usw.)
- Anbieter
- Veröffentlichungsjahr
- Datensatzkategorie
Datenquellen und Methodik
Phaseo führt Benchmark-Daten aus folgenden Quellen zusammen:- Offizielle Forschungsarbeiten und Modellberichte.
- Evaluierungsseiten von Anbietern (OpenAI Evals, Anthropic Reports usw.).
- Offene Community-Datensätze (z. B. Hugging-Face-Bestenlisten).
- Direkte Einreichungen von Nutzern über GitHub.
Beispiele für Anwendungsfälle
Benchmark-Daten beitragen
Erstelle ein GitHub-Issue mit Belegen für neue oder korrigierte Benchmark-Ergebnisse. Jede Einreichung wird vor der Aufnahme auf Einheitlichkeit und Genauigkeit geprüft.Benchmark-Daten beitragen
Erfahre, welche Belege ein Benchmark-Issue enthalten sollte.
Nächste Schritte
Wenn du die Benchmark-Daten verstanden hast, kannst du die API-Anbieter erkunden, über die diese Modelle programmatisch verfügbar sind.API-Anbieter erkunden
Sieh dir an, wo und wie Modelle gehostet, bepreist und bereitgestellt werden.