Longform Writing(Kimi)
月之暗面内部长文本写作评测
基本信息
30 秒看懂
月之暗面内部长文本写作评测,题量与评分器未公开;分数为厂商自报(写作质量打分口径),主要用于 K 系代际纵向对比,跨厂商可比性未知。
采用格局:厂商内部/未公开——Kimi K2.5 页自述评测长文写作
用于写作选型时怎么看
测什么:月之暗面内部长文本写作评测
不测什么:不能证明中文长文业务任务的整体质量;需用自己的文体、长度和事实要求复核。
语言与文体:当前账本未完整披露语言和文体分布
指标与单位:见逐条记录,未披露项不能比较 / 以原始来源为准
可比性:厂商内部题集与评分器未公开,禁止跨厂商排名。
说明日期:2026-08-31;具体分数的协议、来源等级和核对日期以每条发布记录为准。
进入写作需求选型
评分协议
这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。
可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。
模型发布采用时间轴
共收录 1 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20
2025
2025-11-06
Moonshot AI / Kimi·国内
上下文256K模态文本
月之暗面将 Kimi K2 Thinking 定位为思考型智能体(thinking agent),通过同时扩展思考 token 与工具调用步数推进测试时扩展前沿,可跨数百步规划、推理、执行与调整,全部评测结果以 INT4 QAT 精度报告。已收录评测覆盖通用推理、数学、智能体检索、编码与终端等领域,HLE 带工具 44.9(Heavy Mode 51.0)、SWE-bench Verified 71.3。
思考型智能体INT4 QAT开源权重工具调用扩展
查看模型变体与证据
no tools 73.8
数据缺口(本页暂未收录)
- 评测版本与子集(例如部分评测有 Diamond、Verified 等官方变体)以及数据集规模
- 各厂商使用的执行框架(harness / scaffold)与 Agent 工具配置
- 推理档位(reasoning effort)、采样参数(temperature / top-p)、运行次数与分数聚合方式
- 指标对应的随机猜测基线(chance baseline)与人类基线的实验条件
- 测试集污染检测结论,以及是否已饱和的结构化标注
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
复现入口
引用
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。