Berkeley Function Calling Leaderboard
Function and tool calling: single, parallel, multi-turn, web search and memory, v4.
Claude Opus 4.5
#1 right now
77.5%
Overall accuracy
81
Models ranked
Apr 12, 2026
Board published
Ranking
Best variant per model, as published. Higher is better.
- 177.5%
Claude Opus 4.5
as “Claude-Opus-4-5-20251101 (FC)” - 273.2%
Claude Sonnet 4.5
as “Claude-Sonnet-4-5-20250929 (FC)” - 372.5%
Gemini 3 Pro
as “Gemini-3-Pro-Preview (Prompt)” - 472.4%
GLM 4.6
as “GLM-4.6 (FC thinking)” - 569.6%
Grok 4 1 Fast
as “Grok-4-1-fast-reasoning (FC)” - 668.7%
Claude 4.5 Haiku
as “Claude-Haiku-4-5-20251001 (FC)” - 763.0%
o3
as “o3-2025-04-16 (Prompt)” - 863.0%
Grok 4
as “Grok-4-0709 (Prompt)” - 959.1%
Moonshotai Kimi K2
as “Moonshotai-Kimi-K2-Instruct (FC)” - 1058.3%
Grok 4 1 Fast Non
as “Grok-4-1-fast-non-reasoning (FC)” - 1157.1%
Command A+
as “Command A Reasoning (FC)” - 1256.7%
DeepSeek-V3.2
as “DeepSeek-V3.2-Exp (Prompt + Thinking)” - 1356.2%
Gemini 2.5 Flash (Sep 2025)
as “Gemini-2.5-Flash (FC)” - 1455.9%
GPT-5.2
as “GPT-5.2-2025-12-11 (FC)” - 1555.5%
GPT-5 mini
as “GPT-5-mini-2025-08-07 (FC)” - 16Xlam 2 32b Fc R54.7%as “xLAM-2-32b-fc-r (FC)”
- 1754.0%
GPT 4.1
as “GPT-4.1-2025-04-14 (FC)” - 1853.2%
o4-mini
as “o4-mini-2025-04-16 (FC)” - 19Xlam 2 70b Fc R53.1%as “xLAM-2-70b-fc-r (FC)”
- 2052.1%
Qwen3-235B-A22B-Thinking (Jul 2025)
as “Qwen3-235B-A22B-Instruct-2507 (Prompt)” - 2151.5%
GPT 5 nano
as “GPT-5-nano-2025-08-07 (FC)” - 22Nanbeige4 3b51.4%as “Nanbeige4-3B-Thinking-2511 (FC)”
- 2350.5%
GPT 4.1 mini
as “GPT-4.1-mini-2025-04-14 (FC)” - 2448.7%
Qwen3 32b
as “Qwen3-32B (FC)” - 25Nanbeige3.5 Pro47.7%as “Nanbeige3.5-Pro-Thinking (FC)”
Rank over time
History builds with every daily capture. One capture so far.
Other agents and tools boards
Scores as published by UC Berkeley Gorilla on the capture date (2026-09-24). Source: gorilla.cs.berkeley.edu data_overall.csv.