Benchmarks for what frontier AI hasn't solved
All Models
Sep 03, 2026
GPT-6 Astra
Leads Terminal-Bench 4.0 and Agents' Last Exam, strong at agentic coding.
RANK BY BENCHMARK
Agentic Coding 2.0
47.6%
#1/11
Agents’ Last Exam
34.2%
#1/40
SnorkelFinance 2.0
11.6%
#7/11
SnorkelLegal
20.9%
#10/10
SnorkelManufacturing
10%
#6/11
Sep 02, 2026
Gemini Flash 3.8
Mid-pack across most boards, best showing on SnorkelLegal.
RANK BY BENCHMARK
Agentic Coding 2.0
32.6%
#5/11
SnorkelFinance 2.0
5.4%
#10/11
SnorkelLegal
25.3%
#9/10
SnorkelManufacturing
7.1%
#10/11
SnorkelRevOps
5.4%
#11/11
Sep 02, 2026
Muse Spark 1.3
Second on SnorkelLegal and Agents' Last Exam, weak on coding benchmarks.
RANK BY BENCHMARK
Agentic Coding 2.0
25%
#7/11
Agents’ Last Exam
32.2%
#2/40
SnorkelFinance 2.0
10%
#8/11
SnorkelLegal
36.5%
#3/10
SnorkelManufacturing
10.5%
#4/11
Sep 01, 2026
Fable 5.1
Tops SWE-bench CLI, Terminal-Bench-Science, and Senior SWE-Bench.
RANK BY BENCHMARK
Agentic Coding 2.0
39.6%
#2/11
Senior SWE-Bench
34.7%
#1/18
SnorkelFinance 2.0
19.6%
#3/11
SnorkelLegal
35.9%
#5/10
SnorkelManufacturing
11.3%
#3/11
All benchmarks
All Benchmarks
Sort: Newest
Benchmark Type: All
Knowledge Work
Proprietary
WorkplaceAgents
Evaluates AI agents on economically valuable professional work and verifiable workplace deliverables.
By pass@1
1
Muse Spark 1.3
17.7%
2
Grok 4.6
17.1%
3
Fable 5.1
15.8%
Knowledge Work
Open Benchmarks Grants
Agents’ Last Exam
Evaluating AI agents on long-horizon, economically valuable professional workflows with verifiable outcomes.
By Binary Accuracy
1
GPT-6 Astra
34.2
2
Muse Spark 1.3
32.2%
3
Opus 5
31.6%
View archived benchmarks

