Multi-SWE-Bench

多语言真实 GitHub issue 修复评测(Java/C++/Go 等)

基本信息

类别
代码与工程
官网 / 数据集
https://huggingface.co/moonshotai/Kimi-K2-Instruct-0905

30 秒看懂

SWE-bench 的多语言扩展:换 6-8 种语言的真实仓库修 bug,考语言面广的工程能力。

采用格局:Kimi/MiniMax/豆包/Qwen 多家引用;另有写法 Multi-SWE-bench

评分协议

agent 产出 patch,按官方测试通过判定

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 7 场模型发布(收录 8 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-03-18 MiniMax·国内

MiniMax-M2.7

模态文本

MiniMax 发布 M2.7「Early Echoes of Self-Evolution」,定位为首个深度参与自身进化的 M 系列模型,支持 Agent Teams、复杂 Skills 与动态工具搜索。评测集中在智能体与编码,亮点如 SWE-Bench Pro 56.2%、MLE-Bench Lite 66.6%。

开源权重智能体自我进化办公

查看模型变体与证据

Multi-SWE-Bench 52.7
2026-02-12 MiniMax·国内

MiniMax-M2.5

价格$0.15/$1.2 每百万 tokens · M2.5 为 50 TPS 档、价格为 M2.5-Lightning(100 TPS,$0.3/$2.4 每百万 tokens)的一半模态文本

MiniMax 将 M2.5 定位为「为真实生产力打造」,披露 20 万+ 真实环境 RL 训练与 Forge 智能体原生框架,并随附同能力 2 倍速的 M2.5-Lightning 档。已收录 22 项评测集中于编码、搜索与 Agent 工具调用:亮点 SWE-bench Verified 80.2%、tau2-Bench Telecom 97.8%。

开源权重Agent RL 训练高效编码

查看模型变体与证据

Multi-SWE-Bench 51.3%
2025
2025-12 ByteDance Seed / 豆包·国内

Seed1.8 / Seed1.8 Thinking / Seed1.5-VL

本发布含 3 个变体,各变体规格见模型详情。

Seed1.8 被发布文定位为通用化 Agentic 模型,覆盖 GUI/浏览器/移动操作、代理搜索、代理编码与经济价值领域任务,并提供三种思考模式。评测横跨代理、数学、STEM、知识、多模态与长视频等约 13 组:GAIA 87.4、BrowseComp-zh 81.3、AIME-25 94.3。

通用代理多模态三档思考模式

查看模型变体与证据

Seed1.8 · Multi-SWE-Bench 42
2025-11-06 Moonshot AI / Kimi·国内

Kimi K2 Thinking

上下文256K模态文本

月之暗面将 Kimi K2 Thinking 定位为思考型智能体(thinking agent),通过同时扩展思考 token 与工具调用步数推进测试时扩展前沿,可跨数百步规划、推理、执行与调整,全部评测结果以 INT4 QAT 精度报告。已收录评测覆盖通用推理、数学、智能体检索、编码与终端等领域,HLE 带工具 44.9(Heavy Mode 51.0)、SWE-bench Verified 71.3。

思考型智能体INT4 QAT开源权重工具调用扩展

查看模型变体与证据

Multi-SWE-Bench 41.9
2025-10-27 MiniMax·国内

MiniMax-M2

价格$0.3/$1.2 每百万 tokens · 页面同时给出人民币定价:输入 ¥2.1、输出 ¥8.4 每百万 tokens;另载限时免费试用至 2025-11-07模态文本

发布文以“简中之巧(Ingenious in Simplicity)”为题,将 M2 定位为 agent 优先的开源权重模型,价格约为 Claude Sonnet 的 8%、速度约 2 倍。9 项评测集中于智能体编码、工具调用与搜索,亮点为 GAIA(纯文本)75.7 与 τ²-Bench 77.2。

开源权重智能体优先高性价比

查看模型变体与证据

Multi-SWE-Bench 36.2
2025-09-05 Moonshot AI / Kimi·国内

Kimi-K2-Instruct-0905

参数1T-A32B MoE上下文256K模态文本

Moonshot 通过 Hugging Face 官方模型卡发布 Kimi-K2-Instruct-0905:K2 权重更新,上下文 128K→256K,强化智能体编码。评测集中于编码与智能体任务,亮点如 SWE-Bench Verified 69.2%、SWE-Dev 66.6%(五次全量重跑均值±标准差)。

开源权重智能体编码长上下文

查看模型变体与证据

Multi-SWE-Bench 33.5 +/- 0.28
2025-07-22 Alibaba / Qwen·国内

Qwen3-Coder-480B-A35B-Instruct

参数480B-A35B MoE上下文256K(YaRN 可扩至 1M)模态文本

Qwen3-Coder-480B-A35B-Instruct 以「Agentic Coding in the World」为定位发布,480B MoE/35B 激活,原生 256K 上下文(YaRN 可扩至 1M)。已收录 15 项评测集中于代码仓库、终端与浏览器/工具 Agent:亮点 SWE-bench Verified(OpenHands 500 turns)69.6、Terminal-Bench 37.5。

开源权重代码专精Agentic Coding长上下文

查看模型变体与证据

mini 25.8flash 27

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。