ScreenSpot-Pro

高分辨率专业 GUI 定位基准(1581 条指令)

基本信息

类别
多模态
官网 / 数据集
https://huggingface.co/meta-models/Muse-Glimmer-30B
论文
https://arxiv.org/abs/2504.07981

30 秒看懂

1,581 条指令、覆盖 23 个专业应用的高分辨率 GUI 元素定位基准,点击命中目标才算对,定位成功率越高越好;论文发布时最佳模型仅 18.9%,远未饱和。

采用格局:Meta Muse 引用

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 5 场模型发布(收录 6 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-08-10 Meta / Llama·国际

Muse Glimmer 30B

参数29.6B(dense)+ 1.8B ViT模态文本·图像

Muse Glimmer 30B 被 Meta 定位为可在消费级设备上运行的开源代理模型(Apache 2.0,由 Muse Spark 蒸馏,24-32GB 显存可跑)。评测覆盖通用代理、代理编码、多模态与安全:MCP Atlas 75.5%、SWE-bench Verified 76.0%、AIME 2026 94.7%;另提供 K-Quant 量化档与 DFlash 投机解码加速。

开源权重端侧可运行代理增强多模态

查看模型变体与证据

ScreenSpot-Pro 75.4%
2026-08-03 Alibaba / Qwen·国内

Qwen3.8-Max

参数2.4T(激活 95B)模态文本·图像·视频

通义将 Qwen3.8-Max 定位为当前 Qwen 家族最强大的模型,基于 Qwen 3.5 架构将参数规模扩展至 2.4 万亿(激活参数 95B),在编程、办公、科研与长周期任务上全面提升,并成为首个开源权重的 Qwen-Max 级模型(权重于下周发布)。已收录评测覆盖智能体编码与办公、多模态理解与操作、视频理解及长上下文等领域,Terminal-Bench 2.1 86.6、PaperBench 93。

开源权重(预告)多模态智能体长周期任务编程与办公

查看模型变体与证据

ScreenSpot-Pro 84.5
2026-04-16 Anthropic·国际

Claude Opus 4.7 / Claude Opus 4.7 (fast)

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 将 Claude Opus 4.7 定位为在高级软件工程上较 Opus 4.6 显著提升、最难任务上增益尤为明显的旗舰模型,同时大幅增强视觉分辨率;这也是首个按 Project Glasswing 分级防护方案发布的模型。已收录评测覆盖智能体编码与终端、长上下文检索、计算机操作、网络安全与多学科推理等领域,SWE-bench Verified 87.6、GPQA Diamond 94.2。

智能体编码高分辨率视觉推理档位控制分级网络安全防护

查看模型变体与证据

Claude Opus 4.7 · High resolution 79.5 (no tools) / 87.6 (with tools)Claude Opus 4.7 · Low resolution 69.0 (no tools) / 85.9 (with tools)
2025
2025-12-17 Google DeepMind / Gemini·国际

Gemini 3 Flash

上下文1M价格$0.5/$3 每百万 tokens模态文本·图像·视频

Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。

速度优先多模态1M 长上下文编码与 Agent

查看模型变体与证据

no tools unless specified 69.1%
2025-11-18 Google DeepMind / Gemini·国际

Gemini 3 Pro / Gemini 3 Deep Think

本发布含 2 个变体,各变体规格见模型详情。

Gemini 3 发布以「智能新纪元」为题呈现,Gemini 3 Pro 为旗舰型号(发布时 preview)。已收录评测横跨推理、代码、多模态与 Agent:亮点 LMArena 1501 Elo、AIME 2025(带代码执行)100%。

旗舰多模态1M 长上下文Agent

查看模型变体与证据

Gemini 3 Pro · ScreenSpot-Pro 72.7%

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。