← 模型目录

Kimi-K2-Instruct-0905

Moonshot AI / Kimi · 2025-09-05 · 类别未确认

官方发布来源 · 按需求选型 · 查看覆盖缺口 · 归档与转录记录

Kimi-K2-Instruct-0905

Moonshot 通过 Hugging Face 官方模型卡发布 Kimi-K2-Instruct-0905:K2 权重更新,上下文 128K→256K,强化智能体编码。评测集中于编码与智能体任务,亮点如 SWE-Bench Verified 69.2%、SWE-Dev 66.6%(五次全量重跑均值±标准差)。

输入模态
文本
上下文
256K
参数
1T-A32B MoE
价格(每百万 tokens)
无此口径报价;不等于免费

本变体的评测证据

swebench 69.2 +/- 0.63 模型 kimi-k2-instruct-0905 · 版本 Verified · 指标 resolved_rate · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-08-31 · 距快照 34 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: SWE-Bench verified

{
  "harness": "in-house SWE-agent-derived harness (clamped Bash/Edit context windows)",
  "tools": null,
  "shots": null,
  "reasoning_effort": null,
  "temperature": null,
  "top_p": null,
  "token_budget": null,
  "turn_limit": null,
  "time_limit": null,
  "run_count": 5,
  "aggregation": "mean +/- std over 5 independent full-test-set runs",
  "judge": null
}

Competitor cells: K2-Instruct-0711 65.8, Qwen3-Coder-480B 69.6*, GLM-4.5 64.2*, DeepSeek-V3.1 66.0*, Sonnet-4 72.7*, Opus-4 72.5*.

打开官方来源

swebench-multilingual 55.9 +/- 0.72 模型 kimi-k2-instruct-0905 · 版本 未说明 · 指标 resolved_rate · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-08-31 · 距快照 34 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: SWE-Bench Multilingual

{
  "harness": null,
  "tools": null,
  "shots": null,
  "reasoning_effort": null,
  "temperature": null,
  "top_p": null,
  "token_budget": null,
  "turn_limit": null,
  "time_limit": null,
  "run_count": 5,
  "aggregation": "mean +/- std over 5 runs",
  "judge": null
}

new-benchmark: swebench-multilingual already introduced by prior batches, still not in data/benchmarks/. Competitor cells: K2-0711 47.3, Qwen3-Coder 54.7*, GLM-4.5 52.7, DS-V3.1 54.5*, Sonnet-4 53.3*.

打开官方来源

multi-swe-bench 33.5 +/- 0.28 模型 kimi-k2-instruct-0905 · 版本 未说明 · 指标 resolved_rate · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-08-31 · 距快照 34 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: Multi-SWE-Bench

{
  "harness": null,
  "tools": null,
  "shots": null,
  "reasoning_effort": null,
  "temperature": null,
  "top_p": null,
  "token_budget": null,
  "turn_limit": null,
  "time_limit": null,
  "run_count": 5,
  "aggregation": "mean +/- std over 5 runs",
  "judge": null
}

new-benchmark: multi-swe-bench already introduced by prior batches. Competitor cells: K2-0711 31.3, Qwen3-Coder 32.7, GLM-4.5 31.7, DS-V3.1 29.0, Sonnet-4 35.7.

打开官方来源

terminalbench 44.5 +/- 2.03 模型 kimi-k2-instruct-0905 · 版本 未说明 · 指标 pass_rate · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-08-31 · 距快照 34 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: Terminal-Bench

{
  "harness": "Terminus-2",
  "tools": null,
  "shots": null,
  "reasoning_effort": null,
  "temperature": null,
  "top_p": null,
  "token_budget": null,
  "turn_limit": null,
  "time_limit": null,
  "run_count": 5,
  "aggregation": "mean +/- std over 5 runs",
  "judge": null
}

Version not printed (2025-era page). Competitor cells: K2-0711 37.5, Qwen3-Coder 37.5*, GLM-4.5 39.9*, DS-V3.1 31.3*, Sonnet-4 36.4*, Opus-4 43.2*.

打开官方来源

swe-dev 66.6 +/- 0.72 模型 kimi-k2-instruct-0905 · 版本 未说明 · 指标 resolved_rate · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-08-31 · 距快照 34 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 3. Evaluation Results · table: HF model card Evaluation Results table (DOM, machine-readable) · row: SWE-Dev

{
  "harness": "in-house SWE-agent-derived harness + SWE-Dev hardening (original repo files overwritten; test files exercising target functions deleted)",
  "tools": null,
  "shots": null,
  "reasoning_effort": null,
  "temperature": null,
  "top_p": null,
  "token_budget": null,
  "turn_limit": null,
  "time_limit": null,
  "run_count": 5,
  "aggregation": "mean +/- std over 5 runs",
  "judge": null
}

new-benchmark: swe-dev not yet in data/benchmarks/. Anti-leakage protocol disclosed: deletion of test files eliminates indirect hints. Competitor cells: K2-0711 61.9, Qwen3-Coder 64.7, GLM-4.5 63.2, DS-V3.1 53.3, Sonnet-4 67.1.

打开官方来源