按任务选型 · 测评对照 · 试用建议

按任务直接对比与试用建议

选定具体任务,直接查看该任务核心测评维度的原始记录对照表与试用建议。严格遵循协议可比性原则,绝不把不同协议和单位的分数合成虚假总分。查看全部模型 · 覆盖状态

💡 文档写作 · 试用建议与依据

在文档写作任务下,各基准各有明确侧重点:

  • 格式约束与指令遵循:优先参考 IFEval 严格准确率(Prompt Strict Acc)。自动化规则判分且协议统一,适合首选过滤;
  • 中文表达与逻辑对齐:参考 AlignBench 与 Creative Writing v3,但厂商自报多采用不同裁判模型快照,禁止跨厂商排名;
  • 长文本连贯性:各家公布多为内部评测(如 Longform Writing / InsCtrl),仅作发布参考,无法横向比较。

试用建议:优先选用在 IFEval 上具备完整自报且严格得分领先的通用模型;篇章连贯与文风必须以自建业务样本进行盲测复核。

文档写作测评对照表

横向对比各模型在文档写作相关评测上的原始记录。标有 可比协议 的列可在同口径下排序;标有 仅作参考 的列仅作描述。

模型 厂商 上下文 Creative Writing v3
仅作参考
EQ-Bench 项目创意写作 v3 榜单
Longform Writing(Kimi)
仅作参考
月之暗面内部长文本写作评测
AlignBench
仅作参考
中文大模型多维对齐评测(LLM 评判)
InsCtrl(腾讯内部评测)
仅作参考
腾讯 Hunyuan 模型卡 Text Creation 组的指令控制评测行
LengthCtrl(腾讯内部评测)
仅作参考
腾讯 Hunyuan 模型卡 Text Creation 组的长度控制评测行
IFEval
可比协议
可验证指令遵循(字数/格式/关键词约束)
AlpacaEval 2.0
仅作参考
805 题 vs GPT-4 参考答案的胜率(LC 控制长度偏倚)
Chatbot Arena
仅作参考
真实人类盲评对战,Bradley-Terry Elo 排名,最接近用户感知
Arena Hard
仅作参考
从 Arena 真实难题中抽 500 道,LLM judge 离线复现
WildBench
仅作参考
真实用户难任务 1k 条,多 judge 聚合
MT-Bench
仅作参考
80 道多轮对话题,GPT-4 当裁判打分(1-10)
Qwen2.5-72B-Instruct Alibaba / Qwen 未说明 无记录无记录8.16无记录无记录84.1无记录无记录81.2无记录9.35
Grok 4.1 xAI / Grok 未说明 1721.9 Elo (normalized)无记录无记录无记录无记录无记录无记录1483 Elo (#1 overall) 1465 Elo (#2 overall)无记录无记录无记录
Hunyuan-A13B-Instruct Tencent / 腾讯混元 256K 无记录无记录无记录71.955.484.7无记录无记录无记录无记录无记录
Gemini 3.1 Flash-Lite Google DeepMind / Gemini 未说明 无记录无记录无记录无记录无记录无记录无记录1432 Elo无记录无记录无记录
Qwen3.7-Max Alibaba / Qwen 1M 无记录无记录无记录无记录无记录94.3无记录无记录无记录无记录无记录
Gemini 3 Flash Google DeepMind / Gemini 1M 无记录无记录无记录无记录无记录无记录无记录官方未公布数值无记录无记录无记录
Mistral Large 3 Mistral AI 未说明 无记录无记录无记录无记录无记录无记录无记录官方未公布数值无记录无记录无记录
Gemini 3 Pro Google DeepMind / Gemini 1M 无记录无记录无记录无记录无记录无记录无记录1501 Elo无记录无记录无记录
Kimi K2 Thinking Moonshot AI / Kimi 256K 无记录73.8无记录无记录无记录无记录无记录无记录无记录无记录无记录
Qwen3-Max-Instruct Alibaba / Qwen 1M 无记录无记录无记录无记录无记录无记录无记录1430无记录无记录无记录
Kimi-K2-Instruct Moonshot AI / Kimi 未说明 无记录无记录无记录无记录无记录89.8无记录无记录无记录无记录无记录
Qwen3-235B-A22B Alibaba / Qwen 未说明 无记录无记录无记录无记录无记录无记录无记录无记录95.6无记录无记录
Qwen3-30B-A3B Alibaba / Qwen 未说明 无记录无记录无记录无记录无记录无记录无记录无记录91无记录无记录
Llama 4 Maverick Meta / Llama 未说明 无记录无记录无记录无记录无记录无记录无记录1417 Elo无记录无记录无记录
Gemini 2.5 Pro Google DeepMind / Gemini 1M 无记录无记录无记录无记录无记录无记录无记录官方未公布数值无记录无记录无记录
Hunyuan T1 (混元-T1 正式版) Tencent / 腾讯混元 未说明 无记录无记录无记录无记录无记录无记录无记录无记录91.9无记录无记录
Grok 3 xAI / Grok 未说明 无记录无记录无记录无记录无记录无记录无记录1402 Elo无记录无记录无记录
Llama 3.1 405B Meta / Llama 128K 无记录无记录无记录无记录无记录88.6无记录无记录无记录无记录无记录
Llama 3.1 70B Meta / Llama 128K 无记录无记录无记录无记录无记录87.5无记录无记录无记录无记录无记录
Llama 3.1 8B Meta / Llama 128K 无记录无记录无记录无记录无记录80.4无记录无记录无记录无记录无记录
⚙️ 收窄候选与权重微调(可选进阶过滤)

有具体硬件模态、上下文窗口或成本上限时,可在下方设置硬约束过滤候选,或自定义各维度权重计算优先级。

解析仅识别关键词,维度与硬约束由你确认。不会调用付费 API。

确认维度与权重

0 表示不纳入本次需求,10 表示最重视。

硬约束

厂商所属区域不代表服务可用地区。部署、服务可用性、延迟未有完整证据;选定但无法确认的约束不视为通过。

选择候选模型(未勾选时检查全部)

当前无法客观推荐:所选维度缺少共同可比证据,或硬约束尚无法确认。

启用浏览器脚本后可计算需求结果;模型档案与原始来源始终可阅读。

怎么读这个结果

仅对有明确上下界且指标单位一致的读数线性映射至 0–100;Elo 无固定上下界,不归一化。归一化不是能力概率。

未提供样本、方差和独立重复运行信息时,无法计算置信区间;微小差距不能解释成统计显著。

推荐仅指下一轮试用顺序。营销标签、图中尚未转录的数值、厂商内部评测和协议缺失项不会被混成总分。缺失维度不填 0,也不自动重新分配权重。

下一步:用自己的业务任务复核

准备一组覆盖目标技术栈、文体风格、长文连贯、事实引用与格式约束的真实业务样本;固定提示词与评分标准,让异源评委或人工盲评,保留失败示例与成本。

建立测试集 · 设计评分标准 · 运行评估流水线