Skip to content

Berkeley Function Calling Leaderboard

Function and tool calling: single, parallel, multi-turn, web search and memory, v4.
UC Berkeley Gorilla
Claude Opus 4.5
#1 right now
77.5%
Overall accuracy
81
Models ranked
Apr 12, 2026
Board published

Ranking

Best variant per model, as published. Higher is better.

  1. 1
    Claude Opus 4.5
    as “Claude-Opus-4-5-20251101 (FC)
    77.5%
  2. 2
    Claude Sonnet 4.5
    as “Claude-Sonnet-4-5-20250929 (FC)
    73.2%
  3. 3
    Gemini 3 Pro
    as “Gemini-3-Pro-Preview (Prompt)
    72.5%
  4. 4
    GLM 4.6
    as “GLM-4.6 (FC thinking)
    72.4%
  5. 5
    Grok 4 1 Fast
    as “Grok-4-1-fast-reasoning (FC)
    69.6%
  6. 6
    Claude 4.5 Haiku
    as “Claude-Haiku-4-5-20251001 (FC)
    68.7%
  7. 7
    o3
    as “o3-2025-04-16 (Prompt)
    63.0%
  8. 8
    Grok 4
    as “Grok-4-0709 (Prompt)
    63.0%
  9. 9
    Moonshotai Kimi K2
    as “Moonshotai-Kimi-K2-Instruct (FC)
    59.1%
  10. 10
    Grok 4 1 Fast Non
    as “Grok-4-1-fast-non-reasoning (FC)
    58.3%
  11. 11
    Command A+
    as “Command A Reasoning (FC)
    57.1%
  12. 12
    DeepSeek-V3.2
    as “DeepSeek-V3.2-Exp (Prompt + Thinking)
    56.7%
  13. 13
    Gemini 2.5 Flash (Sep 2025)
    as “Gemini-2.5-Flash (FC)
    56.2%
  14. 14
    GPT-5.2
    as “GPT-5.2-2025-12-11 (FC)
    55.9%
  15. 15
    GPT-5 mini
    as “GPT-5-mini-2025-08-07 (FC)
    55.5%
  16. 16
    Xlam 2 32b Fc R
    as “xLAM-2-32b-fc-r (FC)
    54.7%
  17. 17
    GPT 4.1
    as “GPT-4.1-2025-04-14 (FC)
    54.0%
  18. 18
    o4-mini
    as “o4-mini-2025-04-16 (FC)
    53.2%
  19. 19
    Xlam 2 70b Fc R
    as “xLAM-2-70b-fc-r (FC)
    53.1%
  20. 20
    Qwen3-235B-A22B-Thinking (Jul 2025)
    as “Qwen3-235B-A22B-Instruct-2507 (Prompt)
    52.1%
  21. 21
    GPT 5 nano
    as “GPT-5-nano-2025-08-07 (FC)
    51.5%
  22. 22
    Nanbeige4 3b
    as “Nanbeige4-3B-Thinking-2511 (FC)
    51.4%
  23. 23
    GPT 4.1 mini
    as “GPT-4.1-mini-2025-04-14 (FC)
    50.5%
  24. 24
    Qwen3 32b
    as “Qwen3-32B (FC)
    48.7%
  25. 25
    Nanbeige3.5 Pro
    as “Nanbeige3.5-Pro-Thinking (FC)
    47.7%

Rank over time

History builds with every daily capture. One capture so far.

Other agents and tools boards

Scores as published by UC Berkeley Gorilla on the capture date (2026-09-24). Source: gorilla.cs.berkeley.edu data_overall.csv.

gorilla.cs.berkeley.edu/leaderboard.html

Weekly: the AI leaderboards with a new #1, Saturday mornings.