Leaderboard

综合榜单

名次 模型 机构 分数 来源
1 Llama 4 Maverick Meta 92.3 来源 ↗
2 o3-mini OpenAI 92.0 来源 ↗
3 Claude 3.5 Sonnet Anthropic 91.6 来源 ↗
4 Claude 3.5 Sonnet Anthropic 91.6 来源 ↗
5 Llama 3.3 70B Instruct Meta 91.1 来源 ↗
6 o1-preview OpenAI 90.8 来源 ↗
7 Claude 3 Opus Anthropic 90.7 来源 ↗
8 Llama 4 Scout Meta 90.6 来源 ↗
9 GPT-4o OpenAI 90.5 来源 ↗
10 o1 OpenAI 89.3 来源 ↗
11 GPT-4 Turbo OpenAI 88.5 来源 ↗
12 Gemini 1.5 Pro Google 87.5 来源 ↗
13 GPT-4o mini OpenAI 87.0 来源 ↗
14 Llama 3.2 90B Instruct Meta 86.9 来源 ↗
15 Claude 3.5 Haiku Anthropic 85.6 来源 ↗
16 Qwen3 235B A22B Alibaba Cloud / Qwen Team 83.5 来源 ↗
17 Claude 3 Sonnet Anthropic 83.5 来源 ↗
18 Gemini 1.5 Flash Google 82.6 来源 ↗
19 Phi 4 Microsoft 80.6 来源 ↗
20 Claude 3 Haiku Anthropic 75.1 来源 ↗
21 GPT-4 OpenAI 74.5 来源 ↗
22 Llama 3.2 11B Instruct Meta 68.9 来源 ↗
23 Gemma 3n E4B Instructed Google 67.0 来源 ↗
24 Phi 4 Mini Microsoft 63.9 来源 ↗
25 Gemma 3n E4B Instructed LiteRT Preview Google 60.7 来源 ↗
26 Phi-3.5-MoE-instruct Microsoft 58.7 来源 ↗
27 Llama 3.2 3B Instruct Meta 58.2 来源 ↗
28 GPT-3.5 Turbo OpenAI 56.3 来源 ↗
29 Gemma 3n E2B Instructed LiteRT (Preview) Google 53.1 来源 ↗
30 Gemma 3n E2B Instructed Google 53.1 来源 ↗
31 Phi-3.5-mini-instruct Microsoft 47.9 来源 ↗

全部榜单

agent

audio

chemistry

code

communication

creativity

economics

finance

frontend_development

general

healthcare

image-to-text

language

legal

long_context

math

multimodal

physics

psychology

reasoning

roleplay

safety

search

spatial_reasoning

speech-to-text

summarization

text-to-image

video

vision

writing