Benchmark

Android Control Low_EM

multimodal reasoning multimodal

Android control benchmark evaluating autonomous agents on mobile device interaction tasks with low exact match scoring criteria

语言EN
满分1
参评模型3

模型排名

名次 模型 机构 分数 来源
1 Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team 93.7 来源 ↗
2 Qwen2.5 VL 32B Instruct Alibaba Cloud / Qwen Team 93.3 来源 ↗
3 Qwen2.5 VL 7B Instruct Alibaba Cloud / Qwen Team 91.4 来源 ↗