Docs
Search
Ctrl K
Models
Chat
Compare
Providers
Apps
Rankings
Multilingual MMLU Benchmark Leaderboard | Phaseo
Multilingual MMLU
Multilingual MMLU
AI benchmark results and model performance
Summary
▼
Summary
▼
Type: percentage
General
Recorded Results
2
Average Score
65%
Score Range
49.30% - 80.70%
Leading Model (lowest score)
49.30% - Phi 4 Mini
Scores Over Time
Individual benchmark scores plotted by date.
Models Using This Benchmark
Organisation
Model
Reported
Top Score
Info
Self Reported
Source
Microsoft
Phi 4 Mini
01 Feb 2025
49.30%
-
Yes
Source
OpenAI
o3 mini
30 Jan 2025
80.70%
-
Yes
Source
Sign Up
Sign Up