MMLU-Pro
12,000 harder, ten-option multiple-choice questions across 14 academic subjects.
Gemini 3.1 Pro Preview
#1 right now
91.2%
Accuracy
100
Models ranked
Mar 11, 2026
Board published
Ranking
Best variant per model, as published. Higher is better.
- 191.2%
Gemini 3.1 Pro Preview
as “Gemini-3.1-Pro” - 290.1%
Gemini 3 Pro
as “Gemini-3-Pro(11/25)” - 389.3%
o1
as “GPT-o1” - 489.1%
Claude Opus 4.6
as “Claude-4.6-Opus(Thinking)” - 588.6%
Gemini 3 Flash
as “Gemini-3-Flash(12/25)” - 688.0%
MiniMax M2.1
as “MiniMax-M2.1” - 787.8%
Qwen3.5 397B A17B
as “Qwen3.5-397B-A17B” - 887.7%
Seed2.0 Lite
as “Seed2.0-Lite” - 987.5%
- 1087.4%
Claude Sonnet 4.5
as “Claude-4.5-Sonnet(Thinking)” - 1087.4%
- 1287.3%
Claude Opus 4
as “Claude-4-Opus-Thinking” - 1287.3%
Claude Opus 4.5
as “Claude-4.5-Opus(Thinking)” - 1287.3%
Claude Sonnet 4.6
as “Claude-4.6-Sonnet(Thinking)” - 1587.2%
Hunyuan T1
as “Hunyuan-T1” - 1687.1%
GPT-5
as “GPT-5(high)” - 16K2.5 1t A32B87.1%as “K2.5-1T-A32B”
- 1887.0%
Grok 4
as “Grok-4” - 1887.0%
Seed V1.5
as “Seed-Thinking-v1.5” - 1887.0%
Seed2.0 Pro
as “Seed2.0-Pro” - 2186.7%
Qwen3.5 122B A10B
as “Qwen3.5-122B-A10B” - 2286.6%
Seed1.6
as “Seed1.6-Thinking” - 2286.6%
Seed1.6 Base
as “Seed1.6-Base” - 2486.4%
- 2486.4%
Seed1.6 Ada
as “Seed1.6-Ada-Thinking”
Rank over time
History builds with every daily capture. One capture so far.
Other reasoning boards
AA Intelligence
#1 Claude Opus 5.5
HLE
#1 GPT-6 Astra
GPQA Diamond
#1 GPT-6 Astra
Epoch ECI
#1 GPT-6 Astra
ARC-AGI-2
#1 GPT-6 Astra
LiveBench
#1 Claude Fable 5.1
Open LLM LB
#1 none
Scores as published by TIGER-Lab on the capture date (2026-09-24). Source: TIGER-Lab results.csv on Hugging Face.