Leaderboard
综合榜单
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 52.8 | 来源 ↗ |
全部榜单
agent
Agents' Last Exam Finance Agent FinanceAgent Terminal Bench 2.0 Toolathlon Toolathlon-Verified
audio
Common Voice 15 CoVoST2 CoVoST2 en-zh GiantSteps Tempo MMAU MMAU Music MMAU Sound MMAU Speech MusicCaps OmniBench Music VocalSound
chemistry
GPQA Chemistry MMLU-STEM OpenAI MMLU SciCode SuperGPQA
code
Aider Aider-Polyglot Aider-Polyglot Edit Artificial Analysis Coding Agent Index Artificial Analysis Coding Index CFEval Codegolf v2.2 DeepSWE EvalPlus FrontierCode FrontierSWE Gorilla Benchmark API Bench HumanEval HumanEval Plus Kimi Code Bench LiveCodeBench LiveCodeBench Pro MBPP Plus Multi-SWE-Bench RepoBench RepoQA SciCode SWE-Atlas Codebase QnA SWE-Atlas Refactoring SWE-Atlas Test Writing SWE-bench Multilingual SWE-Bench Pro SWE-Bench Verified SWE-bench Verified (Agentic Coding) SWE-Lancer SWE-Lancer (IC-Diamond subset) Terminal-Bench Terminal-Bench 2.1 Terminal-Bench Hard Terminus
communication
MM-MT-Bench MT-Bench Multi-Challenge Multi-IF Scale MultiChallenge TAU-bench Airline TAU-bench Retail Tau2 Airline Tau2 Retail Tau2 Telecom VoiceBench Avg WritingBench
creativity
AlpacaEval 2.0 Arena Hard Arena-Hard v2 Creative Writing v3 WritingBench
economics
finance
FinQA OpenAI MMLU SuperGPQA TheoremQA TruthfulQA
frontend_development
MM-Mind2Web MobileMiniWob++_SR SWE-Bench Verified SWE-Dev VisualWebBench
general
AA-Index ACEBench AGIEval AI2 Reasoning Challenge (ARC) Aider-Polyglot Aider-Polyglot Edit AlignBench AlpacaEval 2.0 AndroidWorld_SR Arc ARC-AGI-1 ARC-AGI-2 ARC-C ARC-E Arena Hard Arena-Hard v2 Artificial Analysis Intelligence Index AutomationBench BFCL BFCL v2 BFCL_v3_MultiTurn BFCL-v3 BIG-Bench Extra Hard BigCodeBench BigCodeBench-Full BigCodeBench-Hard C-Eval CharXiv Reasoning Claw-eval ClawEval CMMLU CSimpleQA CTI-REALM DS-FIM-Eval FORTE French MMLU GDPval GDPval-AA GeneBench Global-MMLU Global-MMLU-Lite GPQA GPQA Biology GPQA Diamond HumanEvalFIM-Average Humanity's Last Exam Humanity's Last Exam IF IFBench IFEval Include Instruct HumanEval Internal API instruction following (hard) JobBench Kimi Claw 24/7 Bench LiveBench LiveBench 20241125 LiveCodeBench LiveCodeBench v5 LiveCodeBench v5 24.12-25.2 LiveCodeBench v6 LiveCodeBench(01-09) Long Context Reasoning LongBench v2 LongFact Concepts LongFact Objects LSAT MBPP MBPP ++ base version MBPP EvalPlus MBPP EvalPlus (base) MBPP pass@1 MBPP+ MCP Atlas MCP Mark Verified MLS Bench Lite MLVU-M MME-RealWorld MMLU MMLU (CoT) MMLU Chat MMLU French MMLU-Base MMLU-Pro MMLU-ProX MMLU-Redux MMLU-redux-2.0 MMMLU MMMU MMMU (val) MMMU (validation) MMMU-Pro MMMUval MMStar MMT-Bench MMVet MMVetGPT4Turbo MRCR MRCR 1M MRCR 1M (pointwise) MRCR v2 MRCR v2 (8-needle) MRCRv2 MT-Bench MultiLF Multilingual MMLU MultiPL-E Multipl-E HumanEval Multipl-E MBPP Natural Questions Natural2Code Nexus NL2Repo NMOS NQ OpenAI MMLU OpenBookQA OSWorld OSWorld Extended OSWorld Screenshot-only OSWorld-Verified PhiBench PIQA PopQA Program Bench Scale MultiChallenge SimpleQA SuperGLUE SuperGPQA SWE-bench Verified (Agentless) Tau-bench TriviaQA TruthfulQA Vibe-Eval VoiceBench Avg Wild Bench τ²-Bench Telecom τ3 Banking
healthcare
CheXpert CXR CRPErelation DermMCQA HealthBench HealthBench Hard MedXpertQA MIMIC CXR OpenAI MMLU PathMCQA SlakeVQA SuperGPQA TruthfulQA VQA-Rad
image-to-text
OCRBench OCRBench_V2 OCRBench-V2 (en) OCRBench-V2 (zh) TextVQA
language
AlignBench BBH BIG-Bench BIG-Bench Extra Hard BIG-Bench Hard BoolQ CharadesSTA CLUEWSC CMMLU COLLIE Common Voice 15 CommonSenseQA CoVoST2 CoVoST2 en-zh CSimpleQA ECLeKTic FLEURS French MMLU Global-MMLU Global-MMLU-Lite MEGA MLQA MEGA TyDi QA MEGA UDPOS MEGA XCOPA MEGA XStoryCloze MMLU MMLU (CoT) MMLU Chat MMLU French MMLU-Base MMLU-Pro MMLU-ProX MMLU-Redux MMLU-redux-2.0 MMMLU Multi-IF MultiChallenge (o3-mini grader) Multilingual MMLU MultiPL-E Multipl-E HumanEval Open-rewrite Spider SQuALITY SuperGLUE TLDR9+ (test) Translation en→Set1 COMET22 Translation en→Set1 spBleu Translation Set1→en COMET22 Translation Set1→en spBleu TydiQA VATEX VQAv2 (val) Winogrande WMT23 WMT24++ XLSum English
legal
LSAT OpenAI MMLU SuperGPQA TruthfulQA Uniform Bar Exam
long_context
ComplexFuncBench EgoSchema FlenQA GovReport Graphwalks BFS >128k Graphwalks parents >128k InfiniteBench/En.MC InfiniteBench/En.QA LongBench v2 LongVideoBench LVBench MLVU MRCR MRCR 1M MRCR 1M (pointwise) MRCR v2 MRCR v2 (8-needle) NIH/Multi-needle OpenAI-MRCR: 2 needle 128k OpenAI-MRCR: 2 needle 1M OpenAI-MRCR: 2 needle 256k Qasper QMSum RepoQA RULER SQuALITY SummScreenFD
math
AGIEval AIME AIME 2024 AIME 2025 AlignBench AMC_2022_23 BBH BIG-Bench BIG-Bench Hard CBNSL CNMO 2024 CodeForces DROP FinQA FrontierMath FunctionalMATH GSM-8K (CoT) GSM8k GSM8K Chat HiddenMath HLE HMMT 2025 HMMT25 InterGPS LiveBench LiveBench 20241125 MATH MATH (CoT) MATH-500 MathVision MathVista MathVista-Mini MGSM MMLU MMLU (CoT) MMLU Chat MMLU French MMLU-Base MMLU-Pro MMLU-ProX MMLU-Redux MMLU-redux-2.0 MMLU-STEM MMMLU MMVet MMVetGPT4Turbo Multilingual MGSM (CoT) OlympiadBench OmniMath OpenAI MMLU PhiBench PhysicsFinals PolyMATH PolyMath-en SAT Math SciCode ScienceQA STEM SuperGPQA TheoremQA USAMO25
multimodal
AI2D AITZ_EM Android Control High_EM Android Control Low_EM AndroidWorld_SR BLINK CC-OCR CharadesSTA ChartQA CharXiv-D CharXiv-R DocVQA DocVQAtest GroundUI-1K InfographicsQA InfoVQA InfoVQAtest LongVideoBench LVBench MathVision MathVista MathVista-Mini MedXpertQA Meld MIMIC CXR MLVU MM IF-Eval MM-Mind2Web MM-MT-Bench MMAU MMAU Music MMAU Sound MMAU Speech MMBench MMBench_test MMBench-V1.1 MMBench-Video MME MME-RealWorld MMMU MMMU (val) MMMU (validation) MMMU-Pro MMMUval MMStar MMT-Bench MMVet MMVetGPT4Turbo MobileMiniWob++_SR MTVQA MuirBench MusicCaps MVBench OlympiadBench OmniBench OmniBench Music OSWorld OSWorld Extended OSWorld Screenshot-only PathMCQA PerceptionTest PointGrounding PolyMATH POPE ScienceQA ScienceQA Visual ScreenSpot ScreenSpot Pro SlakeVQA STEM TempCompass TextVQA VATEX Vibe-Eval Video-MME Video-MME (long, no subtitles) Video-MMEw sub VideoMME w sub. VideoMME w/o sub. VideoMMMU VisualWebBench VQA-Rad VQAv2 VQAv2 (test) VQAv2 (val)
physics
GPQA Physics MMLU-STEM OlympiadBench OpenAI MMLU PerceptionTest PhysicsFinals PIQA SciCode SuperGPQA TheoremQA
psychology
reasoning
ACEBench AGIEval AI2 Reasoning Challenge (ARC) AI2D Aider AIME AIME 2024 AIME 2025 AITZ_EM AlignBench AlpacaEval 2.0 AMC_2022_23 Android Control High_EM Android Control Low_EM AndroidWorld_SR API-Bank Arc ARC-AGI ARC-AGI v2 ARC-C ARC-E Arena Hard Arena-Hard v2 AutoLogi BBH BFCL BFCL v2 BFCL_v3_MultiTurn BFCL-v3 BIG-Bench BIG-Bench Extra Hard BIG-Bench Hard BigCodeBench BigCodeBench-Full BigCodeBench-Hard Bird-SQL (dev) BLINK BoolQ BrowseComp BrowseComp Long Context 128k BrowseComp Long Context 256k BrowseComp-zh C-Eval CBNSL ChartQA CharXiv-D CharXiv-R CLUEWSC CMMLU CodeForces COLLIE CommonSenseQA ComplexFuncBench CRAG CRPErelation CRUX-O CRUXEval-Input-CoT CruxEval-O CRUXEval-Output-CoT DROP DS-Arena-Code ECLeKTic EgoSchema ERQA EvalPlus FACTS Grounding FActScore FinQA FlenQA FRAMES French MMLU FrontierMath FunctionalMATH Global-MMLU Global-MMLU-Lite Gorilla Benchmark API Bench GPQA GPQA Biology GPQA Chemistry GPQA Physics Graphwalks BFS <128k Graphwalks BFS >128k Graphwalks parents <128k Graphwalks parents >128k GSM-8K (CoT) GSM8k GSM8K Chat Hallusion Bench HellaSwag HiddenMath HLE HumanEval HumanEval Plus HumanEval-Average HumanEval-ER HumanEval-Mul HumanEval+ LBPP (v2) LiveBench LiveBench 20241125 LiveCodeBench LiveCodeBench v5 LiveCodeBench v5 24.12-25.2 LiveCodeBench v6 LiveCodeBench(01-09) LongBench v2 LongFact Concepts LongFact Objects LSAT MATH MATH (CoT) MATH-500 MBPP MBPP ++ base version MBPP EvalPlus MBPP EvalPlus (base) MBPP pass@1 MBPP Plus MBPP+ MedXpertQA MEGA MLQA MEGA TyDi QA MEGA XCOPA MEGA XStoryCloze MGSM MM IF-Eval MM-Mind2Web MMAU MMAU Music MMAU Sound MMAU Speech MMBench MMBench_test MMBench-V1.1 MMBench-Video MME MMLU MMLU (CoT) MMLU Chat MMLU French MMLU-Base MMLU-Pro MMLU-ProX MMLU-Redux MMLU-redux-2.0 MMLU-STEM MMMLU MMMU MMMU (val) MMMU (validation) MMMU-Pro MMMUval MMStar MMT-Bench MMVet MMVetGPT4Turbo MRCR MRCR 1M MRCR 1M (pointwise) MRCR v2 MRCR v2 (8-needle) MT-Bench MuirBench Multi-Challenge Multi-IF Multi-SWE-Bench MultiChallenge (o3-mini grader) Multilingual MGSM (CoT) Multilingual MMLU Multipl-E MBPP MuSR MVBench Natural Questions Natural2Code NQ OJBench OlympiadBench OmniBench OmniMath OpenAI MMLU OpenAI-MRCR: 2 needle 128k OpenAI-MRCR: 2 needle 1M OpenAI-MRCR: 2 needle 256k OpenBookQA OSWorld Extended PathMCQA PerceptionTest PhiBench PhysicsFinals PIQA PolyMATH PolyMath-en PopQA Qasper RepoBench RepoQA RULER SAT Math Scale MultiChallenge SciCode ScienceQA ScienceQA Visual SimpleQA SlakeVQA Social IQa Spider STEM SuperGLUE SuperGPQA SWE-bench Multilingual SWE-Bench Verified SWE-bench Verified (Agentic Coding) SWE-bench Verified (Agentless) SWE-bench Verified (Multiple Attempts) SWE-Lancer SWE-Lancer (IC-Diamond subset) Tau-bench TAU-bench Airline TAU-bench Retail Tau2 Airline Tau2 Retail Tau2 Telecom TempCompass Terminal-Bench Terminus TheoremQA TriviaQA TruthfulQA TydiQA Uniform Bar Exam USAMO25 VCR_en_easy Video-MME Video-MMEw sub VideoMMMU VoiceBench Avg VQAv2 VQAv2 (test) VQAv2 (val) Wild Bench Winogrande ZebraLogic
roleplay
safety
AttaQ Cybersecurity CTFs POPE VoiceBench Avg XSTest
search
BrowseComp BrowseComp Long Context 128k BrowseComp Long Context 256k BrowseComp-zh CRAG FRAMES Natural Questions
spatial_reasoning
ARC-AGI ARC-AGI v2 ERQA Graphwalks BFS <128k Graphwalks BFS >128k Graphwalks parents <128k Graphwalks parents >128k InterGPS MMVet MMVetGPT4Turbo MVBench PerceptionTest PointGrounding PolyMATH RealWorldQA ScreenSpot ScreenSpot Pro
speech-to-text
Common Voice 15 CoVoST2 CoVoST2 en-zh FLEURS MMAU Speech
summarization
GovReport QMSum SQuALITY SummScreenFD TLDR9+ (test) XLSum English
text-to-image
video
ActivityNet CharadesSTA MLVU MMBench-Video MVBench PerceptionTest VATEX Video-MME (long, no subtitles) VideoMME w sub. VideoMME w/o sub.
vision
ActivityNet AI2D ARC-AGI ARC-AGI v2 BabyVision BLINK CC-OCR ChartQA CharXiv-D CharXiv-R CheXpert CXR DocVQA DocVQAtest EgoSchema ERQA GroundUI-1K Hallusion Bench InfographicsQA InfoVQA InfoVQAtest LMArena Text-to-Video Arena LongVideoBench LVBench MathVision MathVista MathVista-Mini MIMIC CXR MMBench MMBench_test MMBench-V1.1 MME MME-RealWorld MMMU (val) MMMU (validation) MMMU-Pro MMMUval MMStar MMT-Bench MMVet MMVetGPT4Turbo MTVQA MuirBench MVBench OCRBench OCRBench_V2 OCRBench-V2 (en) OCRBench-V2 (zh) ODinW OSWorld OSWorld Screenshot-only PathMCQA PointGrounding PolyMATH POPE RealWorldQA ScienceQA Visual ScreenSpot ScreenSpot Pro SlakeVQA TempCompass TextVQA VCR_en_easy Vibe-Eval Video-MME Video-MME (long, no subtitles) Video-MMEw sub VideoMME w sub. VideoMME w/o sub. VideoMMMU VisualWebBench VQA-Rad VQAv2 VQAv2 (test) VQAv2 (val)