Kimi-K2-Instruct-0905
Moonshot AI / Kimi · 2025-09-05 · 类别未确认
官方发布来源 · 按需求选型 · 查看覆盖缺口 · 归档与转录记录
Kimi-K2-Instruct-0905
Moonshot 通过 Hugging Face 官方模型卡发布 Kimi-K2-Instruct-0905:K2 权重更新,上下文 128K→256K,强化智能体编码。评测集中于编码与智能体任务,亮点如 SWE-Bench Verified 69.2%、SWE-Dev 66.6%(五次全量重跑均值±标准差)。
- 输入模态
- 文本
- 上下文
- 256K
- 参数
- 1T-A32B MoE
- 价格(每百万 tokens)
- 无此口径报价;不等于免费
本变体的评测证据
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: SWE-Bench verified
{
"harness": "in-house SWE-agent-derived harness (clamped Bash/Edit context windows)",
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": 5,
"aggregation": "mean +/- std over 5 independent full-test-set runs",
"judge": null
}Competitor cells: K2-Instruct-0711 65.8, Qwen3-Coder-480B 69.6*, GLM-4.5 64.2*, DeepSeek-V3.1 66.0*, Sonnet-4 72.7*, Opus-4 72.5*.
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: SWE-Bench Multilingual
{
"harness": null,
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": 5,
"aggregation": "mean +/- std over 5 runs",
"judge": null
}new-benchmark: swebench-multilingual already introduced by prior batches, still not in data/benchmarks/. Competitor cells: K2-0711 47.3, Qwen3-Coder 54.7*, GLM-4.5 52.7, DS-V3.1 54.5*, Sonnet-4 53.3*.
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: Multi-SWE-Bench
{
"harness": null,
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": 5,
"aggregation": "mean +/- std over 5 runs",
"judge": null
}new-benchmark: multi-swe-bench already introduced by prior batches. Competitor cells: K2-0711 31.3, Qwen3-Coder 32.7, GLM-4.5 31.7, DS-V3.1 29.0, Sonnet-4 35.7.
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: Terminal-Bench
{
"harness": "Terminus-2",
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": 5,
"aggregation": "mean +/- std over 5 runs",
"judge": null
}Version not printed (2025-era page). Competitor cells: K2-0711 37.5, Qwen3-Coder 37.5*, GLM-4.5 39.9*, DS-V3.1 31.3*, Sonnet-4 36.4*, Opus-4 43.2*.
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: SWE-Dev
{
"harness": "in-house SWE-agent-derived harness + SWE-Dev hardening (original repo files overwritten; test files exercising target functions deleted)",
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": 5,
"aggregation": "mean +/- std over 5 runs",
"judge": null
}new-benchmark: swe-dev not yet in data/benchmarks/. Anti-leakage protocol disclosed: deletion of test files eliminates indirect hints. Competitor cells: K2-0711 61.9, Qwen3-Coder 64.7, GLM-4.5 63.2, DS-V3.1 53.3, Sonnet-4 67.1.