Home / Evidence / BANKING77

BANKING77: 22 models on real customer messages

400 human-written banking messages, 77 intents, exact-match grading, the same instructions for every model. Measured on 2026-09-28.

ModelCorrect of 40095% intervalInvalidPer 1,000p50Confidence signal
Claude Opus 5.535485.0%–91.3%0$4.033,018 msno
Gemini 3.8 Flash33178.7%–86.1%0$1.042,774 msno
GPT-6 Sol33078.5%–85.9%0$1.111,509 msno
gpt-oss-120b32978.2%–85.7%2$0.02291,280 msyes
MiMo-V2.6-Flash32677.4%–85.0%1$0.02992,790 msno
Kimi K2.632376.6%–84.3%1$0.0847719 msyes
GLM 5.3 Flash32075.8%–83.6%1$0.09951,687 msyes
GPT-6 Luna32075.8%–83.6%0$0.0556902 msno
DeepSeek V4.1 Flash31674.7%–82.7%0$0.0471,021 msyes
MiniMax M331674.7%–82.7%1$0.141,529 msyes
Qwen3.8 Flash31674.7%–82.7%0$0.04661,041 msyes
gpt-oss-20b31373.9%–82.0%1$0.0141,355 msyes
Claude Sonnet 530872.6%–80.9%0$1.892,375 msno
Gemini 3.5 Flash Lite30571.8%–80.2%0$0.211830 msno
Llama 3.3 70B Instruct30571.8%–80.2%1$0.0676946 msyes
Gemma 4 31B30471.6%–79.9%1$0.0381791 msyes
Claude Haiku 4.530170.8%–79.2%2$0.691986 msno
DeepSeek V4 Flash 073129870.0%–78.5%1$0.01011,035 msyes
Llama 4 Maverick29469.0%–77.6%1$0.1011,154 msyes
Qwen3.7 Flash28666.9%–75.7%6$0.0112650 msyes
Qwen3.8 27B26461.2%–70.5%82$0.161,634 msyes
Nemotron 3.5 Lightning25558.9%–68.3%9$0.0245934 msyes

Could a cheap model replace the frontier model?

  • GPT-6 Sol: 16 answers worse and 15 better on 400 fresh messages, 98.0% cheaper. not confirmed
  • Gemini 3.8 Flash: 21 answers worse and 16 better on 400 fresh messages, 97.8% cheaper. not confirmed

On these messages the best cheap model got the same number right as GPT-6 Sol and Gemini 3.8 Flash, but on different messages. Our rule allows at most three answers made worse, so neither route shipped. Run twice, GPT-6 Sol changed only 7 of 400 answers, so the rule is reachable.

Limits: public dataset since 2020, so models may have seen it; some labels are ambiguous; single-label classification only.