Chartography

Surge AI 专业图表理解评测(100 题专家编制)

基本信息

类别
多模态
官网 / 数据集
https://surgehq.ai/benchmarks/chartography
论文
https://arxiv.org/abs/2608.10677

30 秒看懂

Surge AI 的专业图表理解评测:100 道专家编制题(Kaplan-Meier、K 线、等高线、桑基图、Bode 图等),每模型 20 次取平均 pass@1;前沿模型全部不超过 45%(榜首 45%)——专业图表识读远未解决。

采用格局:DeepSeek/GLM 引用;Surge AI 发布

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 4 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-28 Anthropic·国际

Claude Sonnet 5.5

价格$2/$10 每百万 tokens · 缓存读取 $0.20/百万 token

面向日常任务、缺陷修复与文档、幻灯片、表格制作的更快更省的 Sonnet 模型,官方称比 Sonnet 5 快 30% 以上、多数任务成本最多低 30%。收录的 9 项评测以智能体编码与知识工作为主,如 Terminal-Bench 4.0 70.6%、GDPval-AA v2.1 1844。

速度更快成本更低日常编码文档与表格

查看模型变体与证据

Chartography, no tools 61.6%
2026-09-22 Anthropic·国际

Claude Opus 5.5

价格$4/$20 每百万 tokens

面向代码、计算机操作和知识工作的模型。官方表格提供不同任务的分数,但协议与回退模型影响比较范围。

代码计算机操作知识工作

查看模型变体与证据

Chartography with tools 89.0%
2026-08-26 Z.ai / 智谱 GLM·国内

GLM-5.3-Flash

参数320B-A18B MoE模态文本·图像·视频

GLM-5.3-Flash 以「Frontier Intelligence, Flash Cost」为定位发布,是 GLM-5 系列首个原生多模态模型(320B 总参/18B 激活,发布前以 ox-alpha 匿名测试)。已收录 16 项评测集中于终端编码、Agent 工具使用与视觉理解:亮点 Terminal-Bench 2.1 84.3、GDPval-AA v2 Elo 1773。

开源权重原生多模态高性价比编码与 Agent

查看模型变体与证据

w/ Tools 78.0
2026-08-21 DeepSeek·国内

DeepSeek-V4-Flash-Vision-Exp

模态文本·图像

DeepSeek 将 V4-Flash-Vision-Exp 定位为开启多模态 API 服务的实验性多模态模型,官方称其纯文本能力与 V4-Flash 持平、向 Opus-4.8 收敛多模态 Agent 差距。已收录 11 项评测(文本 Agent 与多模态 Agent 两组):亮点 Terminal-Bench 2.1 83.9、CyberGym 75.3。

实验性多模态API 模型Agent 增强

查看模型变体与证据

Chartography 64.3

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。