DeepSWE

Datacurve 出品的抗污染编码 Agent 基准:113 道原创长程工程任务(91 仓库 / 5 语言),手写 verifier 判分且任务不回流上游

基本信息

类别
代码与工程
官网 / 数据集
https://deepswe.datacurve.ai/
论文
https://arxiv.org/abs/2607.07946

30 秒看懂

独立 LLM 复审与 DeepSWE verifier 的分歧率 1.4%,而与 SWE-Bench Pro 继承测试分歧 32.4%;参考解触及代码量约为 SWE-Bench Pro 的 5.5 倍——分数更能区分旗舰 Agent 的真实长程能力。

采用格局:证据账本中 17 次引用;注意与 Agentica/Together 的同名编码模型 DeepSWE-Preview 区分——本实体是 Datacurve 的基准

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 27 场模型发布(收录 40 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-30 Google DeepMind / Gemini·国际

Gemini 4 Argon

价格$2/$10 每百万 tokens · 介绍期价格,缓存输入价比输入价低 95%;介绍期结束后为输入 $4、输出 $20

Google 的新前沿模型,面向真实软件工程、法律与金融等企业知识工作和网络安全防御,输出 token 上限提升到 1M。收录的 7 项评测以编码、智能体与安全为主,如 DeepSWE v1.1 77.9%、LVBench 91.7%;目前仅向可信网络防御者开放。

前沿模型网络安全防御1M 输出上限分阶段开放

查看模型变体与证据

DeepSWE v1.1 77.9%
2026-09-29 OpenAI·国际

GPT-6.1 Sol

价格$2/$10 每百万 tokens · 缓存输入 $0.10/百万 token

GPT-6 Sol 的升级版,定位是在智能体编程、计算机使用和专业工作上更接近 GPT-6 Astra,而标准价格仅为 Astra 的五分之一。收录的 7 项评测中 5 项为图表行(数值未读出),正文明示的事实错误率为 4.1%。

智能体编码计算机使用专业工作价格为 Astra 的五分之一

查看模型变体与证据

DeepSWE v1.1 图表尚无可读数值
2026-09-22 OpenAI·国际

GPT-6 Sol / GPT-6 Luna

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 GPT-6 Sol 定位为日常复杂高价值任务的旗舰级高性价比工作马,以 GPT-5.6 Sol 一半的价格提供接近 Astra 的智能;收录评测覆盖企业自动化、软件工程、计算机操作与专业考试,AutomationBench 达 33.2%、DeepSWE 达 68.8%。

高性价比工作马长程自主代理软件工程GUI计算机操作

查看模型变体与证据

GPT-6 Sol · 1.1 68.8%GPT-6 Luna · 1.1 66.6%
2026-09-22 Xiaomi / 小米·国内

MiMo-V2.6-Pro / MiMo-V2.6-Flash / MiMo-V2.6-Pro-UltraSpeed

本发布含 3 个变体,各变体规格见模型详情。

小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。

开源权重1.02T MoE1M 上下文原生全模态

查看模型变体与证据

MiMo-V2.6-Pro · 1.1 71.9MiMo-V2.6-Flash · 1.1 67.9MiMo-V2.6-Pro · 1.1 RL held-out endpoint 72.57MiMo-V2.6-Flash · 1.1 RL held-out endpoint 65.68
2026-09-21 xAI / Grok·国际

Grok 4.7

参数2.1T上下文500K价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·代码·图像

xAI 发布的最新旗舰编码与知识工作模型,基于 2.1T 参数底座与长程强化学习,在 CursorBench 4.0 (46.3%)、DeepSWE v1.1 (71.0%) 与 Terminal-Bench 4.0 (38.0%) 等多小时自主长程任务上展现出更强的自我检验与 500K 上下文管理能力。

2.1T 参数500K 上下文长程自主任务强化自我检验

查看模型变体与证据

1.1 71.0%
2026-09-19 StepFun / 阶跃星辰·国内

Step 5 Preview

参数600B total / 27B active MoE上下文1M模态文本·图像

阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。

稀疏 MoE 600B/27B1M 上下文视觉输入Agentic 长程任务

查看模型变体与证据

v1.1 67.7%
2026-09-10 DeepSeek·国内

DeepSeek-V4.1-Flash

参数552B (8B prefill / 16B decode active)上下文1M价格$0.15/$0.3 每百万 tokens · 高峰时段 $0.15/$0.30 每百万 tokens,闲时(00:30-08:30 UTC)减半至 $0.075/$0.15,缓存命中 $0.003-$0.006模态文本·图像·代码

DeepSeek 新一代非对称 Causal-Encoder-Decoder (CED) 架构的首款多模态 MoE 模型,总参 552B 仅激活 8B 输入与 16B 输出,KV Cache 显存缩减至 1/4;在 Terminal-Bench 2.1 达到 90.6%、GPQA Diamond 90.9%、DeepSWE v1.1 74.2% 与 CyberGym 88.1%,全面替代并下线 V4-Pro。

因果编解码器CED架构超高KV Cache压缩原生多模态视觉峰谷定价策略

查看模型变体与证据

1.1 74.2%
2026-09-02 Meta / Llama·国际

Muse Spark 1.3

上下文1M价格$1.25/$4.25 每百万 tokens · Meta Model API / OpenRouter 定价:输入 $1.25 / 输出 $4.25 每百万 tokens模态文本·代码·多模态

Meta 专为长程软件工程与智能体工具循环优化的前沿多模态大模型,相较 1.2 版本减少 20% 工具调用与 25% 输出 token;在 DeepSWE v1.1 达到 75.4%、Terminal-Bench 2.1 88.8%、SWE-Atlas Codebase QnA 59.4% 以及 1M 上下文 MRCR 98.1%,支持 max 与 xhigh 双推理档位。

长程代理编码工具调用效率优化1M 上下文Cursor 集成

查看模型变体与证据

1.1 75.4%
2026-08-28 Tencent / 腾讯混元·国内

Hy4 preview

参数770B-A49B MoE上下文1M模态文本

发布文将 Hy4 preview 定位为 770B 总参/49B 激活、1M 上下文、Apache 2.0 开源的旗舰预览版(各模型均按最高推理档评测)。46 项评测集中于智能体编码与搜索、工作智能体及 STEM 推理,亮点为 Terminal-Bench 2.1 85.4 与 SWE-bench Multilingual 82.9。

开源权重长上下文智能体

查看模型变体与证据

DeepSWE 64.3
2026-08-26 Z.ai / 智谱 GLM·国内

GLM-5.3-Flash

参数320B-A18B MoE模态文本·图像·视频

GLM-5.3-Flash 以「Frontier Intelligence, Flash Cost」为定位发布,是 GLM-5 系列首个原生多模态模型(320B 总参/18B 激活,发布前以 ox-alpha 匿名测试)。已收录 16 项评测集中于终端编码、Agent 工具使用与视觉理解:亮点 Terminal-Bench 2.1 84.3、GDPval-AA v2 Elo 1773。

开源权重原生多模态高性价比编码与 Agent

查看模型变体与证据

v1.1 63.4
2026-08-26 OpenAI·国际

GPT-5.6 Sol / GPT-5.6 Terra / GPT-5.6 Luna

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。

旗舰多档努力智能体安全防护

查看模型变体与证据

GPT-5.6 Sol · v1.1 72.7%GPT-5.6 Terra · v1.1 69.6%GPT-5.6 Luna · v1.1 67.2%gpt-5-5 · v1.1 67%claude-fable-5 · v1.1 69.7%claude-opus-4-8 · v1.1 59%gemini-3-1-pro · v1.1 11.8%
2026-08-26 Alibaba / Qwen·国内

Qwen3.8-Flash-Next / Qwen3.8-Flash-Next-Base

本发布含 2 个变体,各变体规格见模型详情。

Qwen3.8-Flash-Next 被发布文定位为迈向极致性价比的全新架构预览(GDN+QSA 混合注意力、N-gram Embedding、Muon 优化器),为 Qwen4 架构探路。评测覆盖代理编码/办公、多模态代理与通用推理:SWE-bench Pro 62.5、CoWorkBench 73.9、Toolathlon Verified 73.5、AndroidWorld 84.5。

MoE 稀疏激活原生 256K 上下文多模态架构预览

查看模型变体与证据

Qwen3.8-Flash-Next · 1.1 58.7
2026-08-21 DeepSeek·国内

DeepSeek-V4-Flash-Vision-Exp

模态文本·图像

DeepSeek 将 V4-Flash-Vision-Exp 定位为开启多模态 API 服务的实验性多模态模型,官方称其纯文本能力与 V4-Flash 持平、向 Opus-4.8 收敛多模态 Agent 差距。已收录 11 项评测(文本 Agent 与多模态 Agent 两组):亮点 Terminal-Bench 2.1 83.9、CyberGym 75.3。

实验性多模态API 模型Agent 增强

查看模型变体与证据

DeepSWE 59.3
2026-08-13 DeepSeek·国内

DeepSeek V4 Pro

模态文本

DeepSeek 发布 V4 Pro 正式版,同步上线 APP/网页端/API(API 模型名不变),官方定位为正式版增强了 Agent 能力、在生产环境中的性能表现提升尤为显著。本发布收录的 10 项评测全部为 Agent 向(编码智能体、网络安全、工具调用、数据科学与自动化智能体),官方以单张对比图给出与 GLM-5.2 / Kimi-K3 / Opus-4.8 / Fable 5 的对比,数值以人工读图确认前不计入公开计数。

正式版 GAAgent 能力增强Responses API 原生支持三档思考强度

查看模型变体与证据

GA 快照 0813 图表尚无可读数值
2026-08-13 Google DeepMind / Gemini·国际

Gemini 3.7 Flash

价格$0.75/$3.75 每百万 tokens · 促销价(原 3.6 Flash 半价),2026-12-31 到期;2027-01-01 起 $1.50/$7.50模态文本·图像·视频

Gemini 3.7 Flash 被定位为面向编码与代理的旗舰 workhorse 模型(most intelligent workhorse model for coding and agents)。评测聚焦编码与代理工作流并延伸到文档/视频理解:DeepSWE v1.1 65.3%、Terminal-bench 2.1 85.8%、WebDev Arena 1588 Elo、GDP.pdf 34.0%。

多模态代理编码文档理解

查看模型变体与证据

v1.1 65.3%
2026-08-12 xAI / Grok·国际

Grok 4.6

价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·图像

发布文称 Grok 4.6 在 Grok 4.5 基础上聚焦长时间运行的智能体与更具野心的交互和视觉任务。10 项评测覆盖智能体编码、知识与法律工作,亮点为 Artificial Analysis Intelligence Index 61(自述追平 GPT-5.6 Sol)与 GDPval-AA v2 1753 Elo。

长程智能体编码视觉任务

查看模型变体与证据

v1.1 65.9%
2026-08-05 Meta / Llama·国际

Muse Spark 1.2 / Muse Code

本发布含 2 个变体,各变体规格见模型详情。

Meta 将 Muse Spark 1.2 定位为 Muse Spark 1.1 的编码向升级版,与 Muse Code 终端代理协同训练,经 Muse Code、Meta Model API、OpenRouter 提供。已收录 5 项评测集中于终端与软件工程 Agent:亮点 Terminal-Bench 2.1 82.9、DeepSWE 1.1 59.3,另含 GDPval-AA v2 与 MCP Atlas 第三方条目(未录数值)。

编码专精与 Muse Code 协同训练长程任务

查看模型变体与证据

Muse Spark 1.2 · 1.1 59.3
2026-08-03 Alibaba / Qwen·国内

Qwen3.8-Max

参数2.4T(激活 95B)模态文本·图像·视频

通义将 Qwen3.8-Max 定位为当前 Qwen 家族最强大的模型,基于 Qwen 3.5 架构将参数规模扩展至 2.4 万亿(激活参数 95B),在编程、办公、科研与长周期任务上全面提升,并成为首个开源权重的 Qwen-Max 级模型(权重于下周发布)。已收录评测覆盖智能体编码与办公、多模态理解与操作、视频理解及长上下文等领域,Terminal-Bench 2.1 86.6、PaperBench 93。

开源权重(预告)多模态智能体长周期任务编程与办公

查看模型变体与证据

1.1 56.6
2026-08 Z.ai / 智谱 GLM·国内

GLM-5.3

模态文本

GLM-5.3 以「Frontier Coding with Emergent Cyber Capabilities」为定位发布(API thinking 档 low/high/max、默认 max 且不再支持关闭思考;权重承诺发布两周内开源)。已收录 22 项评测集中于编码与网络安全攻防:亮点 Terminal-Bench 2.1 88.2、CyberGym 84.5。

开源权重思考默认开启编码专精网络安全

查看模型变体与证据

v1.1 66.9
2026-07-24 Anthropic·国际

Claude Opus 5

模态文本·图像

Anthropic 发布 Claude Opus 5,effort 分档 high/xhigh/max 并提供 Fast 模式;页面数值多为图表与对比性表述(含大量内部评测)。已收录 18 项评测覆盖前沿编码、Agent 操作与法律/健康/生物专业域:亮点 DeepSWE v1.1 68.8、BrowseComp 90.8。

旗舰effort 分档Fast 模式编码与 Agent

查看模型变体与证据

v1.1 68.8
2026-07-21 Google DeepMind / Gemini·国际

Gemini 3.6 Flash / Gemini 3.5 Flash-Lite / Gemini 3.5 Flash Cyber

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Flash 系列定位为以效率、时延与可靠性支撑规模化 AI 智能体的主力款,3.6 Flash 在 3.5 Flash 基础上提升编码与知识工作且输出 token 减少 17%。4 项评测集中于代码、机器学习工程与计算机使用,亮点为 OSWorld-Verified 83.0% 与 MLE-Bench 63.9%。

高效智能体编码性价比

查看模型变体与证据

Gemini 3.6 Flash · v1.1 49%
2026-07-16 xAI / Grok·国际

Grok 4.5

价格$2/$6 每百万 tokens模态文本

xAI 发布 Grok 4.5,定位为面向编码、智能体任务与知识工作的最强模型,并与 Cursor 联合训练。评测集中于智能体编码,亮点如 DeepSWE 1.0 62.0%、Terminal-Bench 2.1 83.3%,并称平均输出 tokens 约为 Opus 4.8 (max) 的 1/4.2。

编码智能体知识工作高输出效率

查看模型变体与证据

1.0 (Datacurve eval, run by AA with each provider's harness) 62.0%1.1 (mini-swe-agent harness, run by Datacurve) 53%
2026-07-09 Meta / Llama·国际

Muse Spark 1.1

上下文1M模态文本·图像

Meta 将 Muse Spark 1.1 定位为可主动管理自身 1M token 上下文窗口的智能体基础模型,随发布同步上线 Meta Model API 公测,并已在 Meta AI 应用与 meta.ai 的 Thinking 模式可用。已收录评测覆盖智能体编码与工具调用、计算机操作、网络安全及生物/化学安全评估等领域,Terminal-Bench 2.1 80.0%、OSWorld Verified 80.8%。

智能体基础1M 上下文公测 API安全评估覆盖

查看模型变体与证据

DeepSWE 官方未公布数值1.1 53.3%
2026-07-06 Tencent / 腾讯混元·国内

Hy3

参数295B-A21B MoE上下文256K价格¥1/¥4 每百万 tokens · 页面原文为 1/4/0.25 元/百万 tokens 三档报价,第三档含义未标注模态文本

腾讯发布混元 Hy3:295B 总参/21B 激活 MoE、256K 上下文、三种思考模式,Apache 2.0 开源。评测覆盖编码、智能体搜索与推理,亮点如 SWE-bench Verified 78%、BrowseComp 84.2%。

开源权重长上下文三档思考智能体

查看模型变体与证据

DeepSWE 28
2026-07 Moonshot AI / Kimi·国内

Kimi K3

上下文1M模态文本·图像

Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。

开源权重推理增强1M 长上下文Agentic

查看模型变体与证据

v1.1 67.3v1.1 67.5
2026-06-23 ByteDance Seed / 豆包·国内

Seed2.1 Pro / Seed2.1 Turbo / Seed2.1 Preview

本发布含 3 个变体,各变体规格见模型详情。

字节 Seed2.1 发布将 Pro 定位为系列最高档,官方称评估优先考察真实工作流表现而非静态榜单分数。已收录评测横跨通用 Agent、编码、多模态与视频理解:亮点 GDPval 87.9、OSWorld 78.8。

Pro 档Agent 向多模态视频理解

查看模型变体与证据

Seed2.1 Pro · DeepSWE 32.7
2026-06-16 Z.ai / 智谱 GLM·国内

GLM-5.2

上下文1M模态文本

智谱将 GLM-5.2 定位为面向长周期任务构建的模型,提供稳固支撑长程工作的 1M 上下文与更强编码能力(High/Max 档位控制),权重以 MIT 协议完全开源。已收录评测聚焦智能体编码与工具调用、长程软件工程与数学推理等领域,AIME 2026 99.2、Terminal-Bench 2.1(Terminus-2)81。

开源权重1M 长上下文推理档位控制智能体编码

查看模型变体与证据

DeepSWE 46.2

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。