Codeforces

Codeforces 竞赛编程平台的等级分(Elo)与题目通过率,被厂商用作算法编码能力的第三方锚点

基本信息

类别
代码与工程
官网 / 数据集
https://codeforces.com/

30 秒看懂

Codeforces 平台数据被厂商用作算法编码第三方锚点:Elo 等级分衡量与人类选手分布的相对位置(「超过 99% 人类选手」类说法即以该分布为参照),题目通过率则是百分比;两者都不是绝对能力分,跨榜只看相对位次。

采用格局:证据账本中 9 次引用;『超过 99% 人类选手』类叙事的原始出处

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 6 场模型发布(收录 15 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-04-24 DeepSeek·国内

DeepSeek-V4-Pro / DeepSeek-V4-Flash

本发布含 2 个变体,各变体规格见模型详情。

DeepSeek 发布 V4 预览版「迈入百万上下文普惠时代」,V4-Pro 为旗舰:1M 上下文、思考/非思考双模式、reasoning_effort high/max。评测覆盖推理、编码、智能体与百万级长上下文,亮点如 GPQA Diamond 90.1%、Codeforces 3206。

开源权重长上下文推理增强预览版

查看模型变体与证据

DeepSeek-V4-Pro · Pro, max effort 3206DeepSeek-V4-Flash · Flash, max effort 3052
2026-04-02 Google DeepMind / Gemini·国际

Gemma 4 E2B / Gemma 4 E4B / Gemma 4 26B MoE / Gemma 4 31B Dense

本发布含 4 个变体,各变体规格见模型详情。

面向本地运行的开放权重模型,支持推理与工具调用;本变体输入能力和上下文按官方发布页记录。

开放权重本地运行

查看模型变体与证据

Gemma 4 31B Dense · Codeforces ELO 2150Gemma 4 26B MoE · Codeforces ELO 1718Gemma 4 E4B · Codeforces ELO 940Gemma 4 E2B · Codeforces ELO 633
2025
2025-12-01 DeepSeek·国内

DeepSeek-V3.2 / DeepSeek-V3.2-Speciale

本发布含 2 个变体,各变体规格见模型详情。

DeepSeek 官方将 V3.2 正式版定位为「强化 Agent 能力、融入思考推理」,是 DeepSeek 首个将思考与工具调用融合的模型。已收录 26 项评测覆盖数学竞赛、代码、知识与工具/Agent 使用:亮点 AIME 2025(Thinking)93.1、Codeforces(Thinking)2386。

开源权重思考融合工具调用Agent 增强

查看模型变体与证据

DeepSeek-V3.2 · Thinking 2386DeepSeek-V3.2-Speciale · Speciale 2701
2025-09-29 DeepSeek·国内

DeepSeek-V3.2-Exp

模态文本

DeepSeek 将 V3.2-Exp 定位为引入 DeepSeek 稀疏注意力(DSA)、聚焦长上下文训练与推理提效的实验性版本,训练设置与 V3.1-Terminus 严格对齐、公开评测表现基本持平,API 价格同步下调超 50%(页面未给出具体单价)。已收录评测覆盖通用知识、数学推理、代码与中英文检索等领域,Codeforces Div1 2121、AIME 2025 89.3。

实验性版本稀疏注意力开源权重推理提效

查看模型变体与证据

Div1 2121
2025-04-29 Alibaba / Qwen·国内

Qwen3-235B-A22B / Qwen3-30B-A3B / Qwen3-32B / Qwen3-4B / Qwen3-14B / Qwen3-8B / Qwen3-1.7B / Qwen3-0.6B

本发布含 8 个变体,各变体规格见模型详情。

Qwen3 以「Think Deeper, Act Faster」发布,Qwen3-235B-A22B 为混合思考 MoE 旗舰。评测覆盖推理、编码与多语言,亮点如 ArenaHard 95.6%、AIME'24 85.7%。

开源权重混合思考推理多语言

查看模型变体与证据

Qwen3-235B-A22B · Codeforces 2056Qwen3-30B-A3B · Codeforces 1974
2025-04-16 OpenAI·国际

OpenAI o3 / OpenAI o4-mini

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 o3 定位为其最强推理模型,在编码、数学、科学与视觉感知等领域推进前沿,并支持以图思考(Thinking with images)。该发布已收录评测覆盖数学、编程竞赛、科学推理、软件工程与智能体工具使用等领域,AIME 2025 配 Python 工具 pass@1 98.4%、100% consensus@8。

推理旗舰以图思考智能体工具使用

查看模型变体与证据

OpenAI o3 · Codeforces 2706OpenAI o4-mini · Codeforces 2719o1 · Codeforces 1891o3-mini · Codeforces 2073

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。