> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Benchmarks erkunden

> Erfahre, wie KI-Modellbenchmarks auf Phaseo gesammelt, vereinheitlicht und visualisiert werden.

Benchmarks sind ein zentraler Bestandteil davon, wie Phaseo ModellqualitÃ¤t und Fortschritt misst.
Sie liefern **objektive, reproduzierbare Messwerte**, mit denen du Modellleistungen Ã¼ber Aufgaben, Bereiche und Anbieter hinweg vergleichen kannst â€“ von Schlussfolgern und Programmierung bis zu SprachverstÃ¤ndnis und Bilderkennung.

***

## Was sind Benchmarks?

Ein **Benchmark** ist ein Datensatz oder eine Auswertung, mit der die Leistung eines Modells bei einer bestimmten Aufgabe getestet wird.
Indem wir mehrere Modelle mit demselben Datensatz ausfÃ¼hren, kÃ¶nnen wir ihre relativen StÃ¤rken und SchwÃ¤chen messen.

HÃ¤ufige Beispiele sind:

* ðŸ§  **MMLU (Massive Multitask Language Understanding)** â€“ prÃ¼ft Allgemeinwissen und logisches Schlussfolgern.
* ðŸ”¢ **GSM8K** â€“ prÃ¼ft mathematisches Denken und ProblemlÃ¶sungsfÃ¤higkeiten.
* ðŸ’¬ **HellaSwag** â€“ bewertet Alltagswissen und KontextverstÃ¤ndnis.
* ðŸ§® **ARC-Challenge** â€“ misst wissenschaftliches Denken und Logik.
* ðŸ’¡ **HumanEval** â€“ bewertet Programmier- und CodegenerierungsfÃ¤higkeiten.

***

## So geht Phaseo mit Benchmarks um

Phaseo sammelt Benchmark-Daten aus **mehreren Ã¶ffentlichen Quellen** und **offiziellen Berichten** und bringt sie anschlieÃŸend in ein einheitliches Format.

Der Benchmark-Abschnitt jedes Modells enthÃ¤lt:

* **Punktzahl** â€“ meist als Prozentwert oder auf einer normalisierten Skala angegeben.
* **Datensatzquelle** â€“ z. B. MMLU, GSM8K usw.
* **Evaluierungsmethode** â€“ gibt an, wie die Punktzahl ermittelt wurde (offizieller Bericht, Bewertung durch Dritte oder Community-Beitrag).
* **Zuletzt aktualisiert** â€“ zeigt, wann die Benchmark-Daten zuletzt aktualisiert wurden.

***

## Beispiel fÃ¼r eine Benchmark-Seite

***

## Benchmark-Kategorien

Benchmarks werden nach der geprÃ¼ften FÃ¤higkeit kategorisiert:

| Kategorie | Beispiele | Beschreibung |
| - | - | - |
| **Schlussfolgern** | MMLU, GSM8K, ARC | PrÃ¼ft allgemeine Logik, mehrstufiges Schlussfolgern und ProblemlÃ¶sung. |
| **SprachverstÃ¤ndnis** | HellaSwag, BoolQ, PIQA | Misst LeseverstÃ¤ndnis, Allgemeinwissen und SprachfÃ¤higkeit. |
| **Codegenerierung** | HumanEval, MBPP | Bewertet Programmierung und Genauigkeit bei der Codesynthese. |
| **Mathematik und Naturwissenschaften** | GSM8K, MATH, SciQ | Konzentriert sich auf numerisches und wissenschaftliches Denken. |
| **Multimodal** | MathVista, MMMU | Kombiniert Aufgaben zum VerstÃ¤ndnis von Text und Bild. |

***

## Punktzahlen interpretieren

| Wertebereich | Interpretation |
| - | - |
| **90-100%** | AuÃŸergewÃ¶hnlich â€“ nahezu Spitzenleistung. |
| **80-89%** | Hervorragend â€“ fÃ¼r die meisten Produktionsanwendungen geeignet. |
| **60-79%** | Gut â€“ zuverlÃ¤ssig bei allgemeinen Aufgaben, kann aber bei SonderfÃ¤llen Schwierigkeiten haben. |
| **\< 60%** | In Entwicklung â€“ am besten fÃ¼r Experimente oder Forschung geeignet. |

Beachte, dass manche Benchmarks **unterschiedliche Bewertungssysteme** verwenden.
Phaseo normalisiert diese nach MÃ¶glichkeit, damit Vergleiche aussagekrÃ¤ftiger sind.

***

## Benchmarks auf Phaseo visualisieren

Benchmark-Ergebnisse werden wie folgt visualisiert:

* ðŸ“Š **Balkendiagramme** zum Vergleich von Modellen innerhalb desselben Datensatzes.
* ðŸ“ˆ **Trenddiagramme** zeigen, wie sich Modelle im Laufe der Zeit verbessern.
* ðŸ§® **Gesamtpunktzahlen** fassen die Leistung Ã¼ber mehrere DatensÃ¤tze hinweg zusammen.

Jeder Benchmark-Datensatz auf Phaseo bietet Filter fÃ¼r:

* Modelltyp (Chat, Code, Embeddings usw.)
* Anbieter
* VerÃ¶ffentlichungsjahr
* Datensatzkategorie

So erkennst du schnell Muster, etwa welche Modellfamilien bei Reasoning- oder Programmieraufgaben fÃ¼hrend sind.

***

## Datenquellen und Methodik

Phaseo fÃ¼hrt Benchmark-Daten aus folgenden Quellen zusammen:

* Offizielle Forschungsarbeiten und Modellberichte.
* Evaluierungsseiten von Anbietern (OpenAI Evals, Anthropic Reports usw.).
* Offene Community-DatensÃ¤tze (z. B. Hugging-Face-Bestenlisten).
* Direkte Einreichungen von Nutzern Ã¼ber GitHub.

Alle Daten werden vor der VerÃ¶ffentlichung vereinheitlicht und geprÃ¼ft.
Weitere Informationen findest du unter [Forschung und Methodik â†’ Benchmark-Methodik](../research/benchmark-methodology.mdx).

***

## Beispiele fÃ¼r AnwendungsfÃ¤lle

| Ziel | Beispiel |
| - | - |
| Reasoning-Modelle vergleichen | â€žWelches Modell erzielt bei GSM8K die hÃ¶chste Punktzahl?â€œ |
| Kosten und Leistung gegeneinander abwÃ¤gen | â€žRechtfertigt GPT-4o die hÃ¶heren Kosten im Vergleich zu Claude 3.5 Sonnet?â€œ |
| JÃ¤hrliche Fortschritte verfolgen | â€žWie stark hat sich die Genauigkeit bei MMLU seit 2022 verbessert?â€œ |
| Benchmarks nach Kategorie untersuchen | â€žWelche Modelle sind beim multimodalen Reasoning fÃ¼hrend?â€œ |

***

## Benchmark-Daten beitragen

Erstelle ein GitHub-Issue mit Belegen fÃ¼r neue oder korrigierte Benchmark-Ergebnisse.
Jede Einreichung wird vor der Aufnahme auf Einheitlichkeit und Genauigkeit geprÃ¼ft.

<Card title="Benchmark-Daten beitragen" icon="github" href="../research/submitting-scores.mdx" horizontal>
  Erfahre, welche Belege ein Benchmark-Issue enthalten sollte.
</Card>

***

## NÃ¤chste Schritte

Wenn du die Benchmark-Daten verstanden hast, kannst du die **API-Anbieter** erkunden, Ã¼ber die diese Modelle programmatisch verfÃ¼gbar sind.

<Card title="API-Anbieter erkunden" icon="network" href="./api-providers.mdx" horizontal>
  Sieh dir an, wo und wie Modelle gehostet, bepreist und bereitgestellt werden.
</Card>


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.