SWE-Dev(Kimi)

Kimi K2 模型卡中的软件工程开发评测

基本信息

类别
代码与工程
官网 / 数据集
https://huggingface.co/moonshotai/Kimi-K2-Instruct-0905

30 秒看懂

月之暗面自建的软件工程开发评测(Kimi K2 模型卡披露),数值为厂商自报,公开足迹未检索到;主要用于其代际模型纵向对比,跨厂商可比性未知。

采用格局:公开足迹未检索到,按月之暗面内部评测处理

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 1 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20

2025
2025-09-05 Moonshot AI / Kimi·国内

Kimi-K2-Instruct-0905

参数1T-A32B MoE上下文256K模态文本

Moonshot 通过 Hugging Face 官方模型卡发布 Kimi-K2-Instruct-0905:K2 权重更新,上下文 128K→256K,强化智能体编码。评测集中于编码与智能体任务,亮点如 SWE-Bench Verified 69.2%、SWE-Dev 66.6%(五次全量重跑均值±标准差)。

开源权重智能体编码长上下文

查看模型变体与证据

SWE-Dev(Kimi) 66.6 +/- 0.72

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。