BabyVision

剥离语言先验的前语言视觉推理评测

基本信息

类别
多模态
官网 / 数据集
https://seed.bytedance.com/en/blog/seed2-1-officially-released-advancing-ai-productivity
论文
https://arxiv.org/abs/2601.06521

30 秒看懂

388 题剥离语言先验的前语言视觉推理(22 子类),与人类对照:成人平均 94.1,而最强模型 Gemini3-Pro 仅 49.7、落后 6 岁儿童——分数远低于人类说明多模态旗舰仍缺基础视觉原语。

采用格局:字节 Seed/GLM 引用;与 3-12 岁儿童对照

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 7 场模型发布(收录 8 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-08-26 Z.ai / 智谱 GLM·国内

GLM-5.3-Flash

参数320B-A18B MoE模态文本·图像·视频

GLM-5.3-Flash 以「Frontier Intelligence, Flash Cost」为定位发布,是 GLM-5 系列首个原生多模态模型(320B 总参/18B 激活,发布前以 ox-alpha 匿名测试)。已收录 16 项评测集中于终端编码、Agent 工具使用与视觉理解:亮点 Terminal-Bench 2.1 84.3、GDPval-AA v2 Elo 1773。

开源权重原生多模态高性价比编码与 Agent

查看模型变体与证据

BabyVision 53.4
2026-08-03 Alibaba / Qwen·国内

Qwen3.8-Max

参数2.4T(激活 95B)模态文本·图像·视频

通义将 Qwen3.8-Max 定位为当前 Qwen 家族最强大的模型,基于 Qwen 3.5 架构将参数规模扩展至 2.4 万亿(激活参数 95B),在编程、办公、科研与长周期任务上全面提升,并成为首个开源权重的 Qwen-Max 级模型(权重于下周发布)。已收录评测覆盖智能体编码与办公、多模态理解与操作、视频理解及长上下文等领域,Terminal-Bench 2.1 86.6、PaperBench 93。

开源权重(预告)多模态智能体长周期任务编程与办公

查看模型变体与证据

Without CI / With CI dual (footnote 1) 82.0 / 91.3
2026-07-09 Meta / Llama·国际

Muse Spark 1.1

上下文1M模态文本·图像

Meta 将 Muse Spark 1.1 定位为可主动管理自身 1M token 上下文窗口的智能体基础模型,随发布同步上线 Meta Model API 公测,并已在 Meta AI 应用与 meta.ai 的 Thinking 模式可用。已收录评测覆盖智能体编码与工具调用、计算机操作、网络安全及生物/化学安全评估等领域,Terminal-Bench 2.1 80.0%、OSWorld Verified 80.8%。

智能体基础1M 上下文公测 API安全评估覆盖

查看模型变体与证据

BabyVision 76.3%
2026-07 Moonshot AI / Kimi·国内

Kimi K3

上下文1M模态文本·图像

Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。

开源权重推理增强1M 长上下文Agentic

查看模型变体与证据

w/ python 85.7
2026-06-23 ByteDance Seed / 豆包·国内

Seed2.1 Pro / Seed2.1 Turbo / Seed2.1 Preview

本发布含 3 个变体,各变体规格见模型详情。

字节 Seed2.1 发布将 Pro 定位为系列最高档,官方称评估优先考察真实工作流表现而非静态榜单分数。已收录评测横跨通用 Agent、编码、多模态与视频理解:亮点 GDPval 87.9、OSWorld 78.8。

Pro 档Agent 向多模态视频理解

查看模型变体与证据

Seed2.1 Pro · BabyVision 73.7
2026-04-20 Moonshot AI / Kimi·国内

Kimi K2.6

上下文256K模态文本·图像

Kimi K2.6 是月之暗面的开源编码旗舰(Advancing Open-Source Coding),主打长程编码与代理蜂群(300 子代理 / 4000 步)。评测横跨编码、代理、数学与视觉:SWE-bench Verified 80.2、SWE-Bench Pro 58.6、Terminal-Bench 2.0(Terminus-2)66.7、HLE-Full w/ tools 54.0。

开源权重编码增强代理蜂群多模态

查看模型变体与证据

BabyVision 39.8w/ python 68.5
2026-03-10 ByteDance Seed / 豆包·国内

Seed 2.0-Lite

模态文本·图像·音频·视频

字节 Seed 系列页将 Seed2.0 Lite 定位为 Seed 基础模型系列首个全模态(omni-modal)理解模型,原生支持视频、图像、音频与文本的统一理解,并升级 Agent、Coding 与 GUI 能力,兼顾输出质量与响应速度,适合通用生产级场景。已收录评测覆盖文本智能体与编码、多模态理解、GUI 操作及视频与音频理解等领域,GPQA Diamond 88.4%、OSWorld Verified 64.4%。

全模态理解生产级通用GUI 操作智能体

查看模型变体与证据

Perception 64.7

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。