Benchmark

LiveBench

math reasoning general text

LiveBench is a challenging, contamination-limited LLM benchmark that addresses test set contamination by releasing new questions monthly based on recently-released datasets, arXiv papers, news articles, and IMDb movie synopses. It comprises tasks across math, coding, reasoning, language, instruction following, and data analysis with verifiable, objective ground-truth answers.

语言EN
满分1
参评模型13

模型排名

名次 模型 机构 分数 来源
1 o3-mini OpenAI 84.6 来源 ↗
2 Qwen3 235B A22B Alibaba Cloud / Qwen Team 77.1 来源 ↗
3 Kimi K2 Instruct Moonshot AI 76.4 来源 ↗
4 Kimi K2-Instruct-0905 Moonshot AI 76.4 来源 ↗
5 Qwen3 32B Alibaba Cloud / Qwen Team 74.9 来源 ↗
6 Qwen3 30B A3B Alibaba Cloud / Qwen Team 74.3 来源 ↗
7 QwQ-32B Alibaba Cloud / Qwen Team 73.1 来源 ↗
8 o1 OpenAI 67.0 来源 ↗
9 o1-preview OpenAI 52.3 来源 ↗
10 Qwen2.5 72B Instruct Alibaba Cloud / Qwen Team 52.3 来源 ↗
11 Phi 4 Microsoft 47.6 来源 ↗
12 Qwen2.5 7B Instruct Alibaba Cloud / Qwen Team 35.9 来源 ↗
13 Qwen2.5-Omni-7B Alibaba Cloud / Qwen Team 29.6 来源 ↗