按任务选型 · 测评对照 · 试用建议
按任务直接对比与试用建议
选定具体任务,直接查看该任务核心测评维度的原始记录对照表与试用建议。严格遵循协议可比性原则,绝不把不同协议和单位的分数合成虚假总分。查看全部模型 · 覆盖状态
💡 文档写作 · 试用建议与依据
在文档写作任务下,各基准各有明确侧重点:
- 格式约束与指令遵循:优先参考 IFEval 严格准确率(Prompt Strict Acc)。自动化规则判分且协议统一,适合首选过滤;
- 中文表达与逻辑对齐:参考 AlignBench 与 Creative Writing v3,但厂商自报多采用不同裁判模型快照,禁止跨厂商排名;
- 长文本连贯性:各家公布多为内部评测(如 Longform Writing / InsCtrl),仅作发布参考,无法横向比较。
试用建议:优先选用在 IFEval 上具备完整自报且严格得分领先的通用模型;篇章连贯与文风必须以自建业务样本进行盲测复核。
文档写作测评对照表
横向对比各模型在文档写作相关评测上的原始记录。标有 可比协议 的列可在同口径下排序;标有 仅作参考 的列仅作描述。
| 模型 | 厂商 | 上下文 |
Creative Writing v3
仅作参考
EQ-Bench 项目创意写作 v3 榜单
|
Longform Writing(Kimi)
仅作参考
月之暗面内部长文本写作评测
|
AlignBench
仅作参考
中文大模型多维对齐评测(LLM 评判)
|
InsCtrl(腾讯内部评测)
仅作参考
腾讯 Hunyuan 模型卡 Text Creation 组的指令控制评测行
|
LengthCtrl(腾讯内部评测)
仅作参考
腾讯 Hunyuan 模型卡 Text Creation 组的长度控制评测行
|
IFEval
可比协议
可验证指令遵循(字数/格式/关键词约束)
|
AlpacaEval 2.0
仅作参考
805 题 vs GPT-4 参考答案的胜率(LC 控制长度偏倚)
|
Chatbot Arena
仅作参考
真实人类盲评对战,Bradley-Terry Elo 排名,最接近用户感知
|
Arena Hard
仅作参考
从 Arena 真实难题中抽 500 道,LLM judge 离线复现
|
WildBench
仅作参考
真实用户难任务 1k 条,多 judge 聚合
|
MT-Bench
仅作参考
80 道多轮对话题,GPT-4 当裁判打分(1-10)
|
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-72B-Instruct | Alibaba / Qwen | 未说明 | 无记录 | 无记录 | 8.16 | 无记录 | 无记录 | 84.1 | 无记录 | 无记录 | 81.2 | 无记录 | 9.35 |
| Grok 4.1 | xAI / Grok | 未说明 | 1721.9 Elo (normalized) | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 1483 Elo (#1 overall) 1465 Elo (#2 overall) | 无记录 | 无记录 | 无记录 |
| Hunyuan-A13B-Instruct | Tencent / 腾讯混元 | 256K | 无记录 | 无记录 | 无记录 | 71.9 | 55.4 | 84.7 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 |
| Gemini 3.1 Flash-Lite | Google DeepMind / Gemini | 未说明 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 1432 Elo | 无记录 | 无记录 | 无记录 |
| Qwen3.7-Max | Alibaba / Qwen | 1M | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 94.3 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 |
| Gemini 3 Flash | Google DeepMind / Gemini | 1M | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 官方未公布数值 | 无记录 | 无记录 | 无记录 |
| Mistral Large 3 | Mistral AI | 未说明 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 官方未公布数值 | 无记录 | 无记录 | 无记录 |
| Gemini 3 Pro | Google DeepMind / Gemini | 1M | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 1501 Elo | 无记录 | 无记录 | 无记录 |
| Kimi K2 Thinking | Moonshot AI / Kimi | 256K | 无记录 | 73.8 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 |
| Qwen3-Max-Instruct | Alibaba / Qwen | 1M | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 1430 | 无记录 | 无记录 | 无记录 |
| Kimi-K2-Instruct | Moonshot AI / Kimi | 未说明 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 89.8 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 |
| Qwen3-235B-A22B | Alibaba / Qwen | 未说明 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 95.6 | 无记录 | 无记录 |
| Qwen3-30B-A3B | Alibaba / Qwen | 未说明 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 91 | 无记录 | 无记录 |
| Llama 4 Maverick | Meta / Llama | 未说明 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 1417 Elo | 无记录 | 无记录 | 无记录 |
| Gemini 2.5 Pro | Google DeepMind / Gemini | 1M | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 官方未公布数值 | 无记录 | 无记录 | 无记录 |
| Hunyuan T1 (混元-T1 正式版) | Tencent / 腾讯混元 | 未说明 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 91.9 | 无记录 | 无记录 |
| Grok 3 | xAI / Grok | 未说明 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 1402 Elo | 无记录 | 无记录 | 无记录 |
| Llama 3.1 405B | Meta / Llama | 128K | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 88.6 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 |
| Llama 3.1 70B | Meta / Llama | 128K | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 87.5 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 |
| Llama 3.1 8B | Meta / Llama | 128K | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 | 80.4 | 无记录 | 无记录 | 无记录 | 无记录 | 无记录 |
⚙️ 收窄候选与权重微调(可选进阶过滤)
有具体硬件模态、上下文窗口或成本上限时,可在下方设置硬约束过滤候选,或自定义各维度权重计算优先级。
当前无法客观推荐:所选维度缺少共同可比证据,或硬约束尚无法确认。
启用浏览器脚本后可计算需求结果;模型档案与原始来源始终可阅读。
怎么读这个结果
仅对有明确上下界且指标单位一致的读数线性映射至 0–100;Elo 无固定上下界,不归一化。归一化不是能力概率。
未提供样本、方差和独立重复运行信息时,无法计算置信区间;微小差距不能解释成统计显著。
推荐仅指下一轮试用顺序。营销标签、图中尚未转录的数值、厂商内部评测和协议缺失项不会被混成总分。缺失维度不填 0,也不自动重新分配权重。
下一步:用自己的业务任务复核
准备一组覆盖目标技术栈、文体风格、长文连贯、事实引用与格式约束的真实业务样本;固定提示词与评分标准,让异源评委或人工盲评,保留失败示例与成本。
建立测试集 · 设计评分标准 · 运行评估流水线