← 模型目录

Step 5 Preview

StepFun / 阶跃星辰 · 2026-09-19 · 类别未确认

官方发布来源 · 按需求选型 · 查看覆盖缺口 · 归档与转录记录

Step 5 Preview

阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。

输入模态
文本 / 图像
上下文
1M
参数
600B total / 27B active MoE
价格(每百万 tokens)
无此口径报价;不等于免费

本变体的评测证据

gpqa 93.5% 模型 step-5-preview · 版本 Diamond · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 推理与知识 · row: GPQA Diamond · quote_snippet: 93.5%

{}

Step 5 Preview (High) 推理与知识分组 GPQA Diamond 行

打开官方来源

hlehle 46.5% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 推理与知识 · row: HLE · quote_snippet: 46.5%

{}

HLE 纯文本基线(非 w/ tools 子集)

打开官方来源

aa-lcr 88.3% 模型 step-5-preview · 版本 v1.1 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 推理与知识 · row: AA-LCR v1.1 · quote_snippet: 88.3%

{}

Artificial Analysis 长上下文检索 v1.1

打开官方来源

critpt 20.9% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 推理与知识 · row: CritPt · quote_snippet: 20.9%

{}

推理与知识分组 CritPt 行

打开官方来源

deepswe 67.7% 模型 step-5-preview · 版本 v1.1 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: DeepSWE v1.1 · quote_snippet: 67.7%

{
  "harness": "swe-agent",
  "tools": null,
  "shots": null,
  "reasoning_effort": null,
  "temperature": 1,
  "top_p": 0.95,
  "token_budget": null,
  "turn_limit": null,
  "time_limit": null,
  "run_count": null,
  "aggregation": null,
  "judge": null
}

页面脚注明示 DeepSWE v1.1 用 SWE-agent harness,temperature=1.0、top_p=0.95

打开官方来源

terminalbench 85.0% 模型 step-5-preview · 版本 2.1 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: Terminal-Bench v2.1 · quote_snippet: 85.0%

{}

Coding 分组 Terminal-Bench v2.1 行

打开官方来源

terminalbench 33.3% 模型 step-5-preview · 版本 4 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: Terminal-Bench v4 · quote_snippet: 33.3%

{}

Coding 分组 Terminal-Bench v4 行

打开官方来源

cybergym 84.7% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: CyberGym · quote_snippet: 84.7%

{}

Coding 分组 CyberGym 行

打开官方来源

scicode 58.9% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: SciCode · quote_snippet: 58.9%

{}

Coding 分组 SciCode 行

打开官方来源

roadmapbench 54.3% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: RoadmapBench · quote_snippet: 54.3%

{}

new-benchmark: RoadmapBench Coding 分组行,benchmark 主数据待补

打开官方来源

program-bench 80.5% 模型 step-5-preview · 版本 未说明 · 指标 pass_rate · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: ProgramBench (Pass Rate) · quote_snippet: 80.5%

{}

Coding 分组 ProgramBench Pass Rate 行;program-bench benchmark 主数据已存在

打开官方来源

swe-marathon 72.7% 模型 step-5-preview · 版本 v1.1 Partial Score · 指标 partial_score · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: SWE-Marathon v1.1 (Partial Score) · quote_snippet: 72.7%

{}

Coding 分组 SWE-Marathon v1.1 Partial Score 行

打开官方来源

mls-bench-lite 40.5% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: MLS-Bench-Lite · quote_snippet: 40.5%

{}

Coding 分组 MLS-Bench-Lite 行

打开官方来源

swe-atlas 63.6% 模型 step-5-preview · 版本 QnA · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: SWE-Atlas-QnA · quote_snippet: 63.6%

{}

Coding 分组 SWE-Atlas-QnA 行

打开官方来源

swe-atlas 50.8% 模型 step-5-preview · 版本 Test-writing · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: SWE-Atlas-Test-writing · quote_snippet: 50.8%

{}

Coding 分组 SWE-Atlas-Test-writing 行

打开官方来源

stepcodebench 49.0% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: StepCodeBench† · quote_snippet: 49.0%

{}

new-benchmark: 阶跃自研 StepCodeBench(avg@4 553 个独立代码仓库、9 类任务、20 个应用领域、33 种编程语言)

打开官方来源

stepcodebench 64.9% 模型 step-5-preview · 版本 Daily · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: StepCode-Bench-Daily† · quote_snippet: 64.9%

{}

new-benchmark: 阶跃自研 StepCodeBench 子集(Daily)

打开官方来源

stepcodebench 65.0% 模型 step-5-preview · 版本 General · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: Coding · row: StepCode-Bench-General† · quote_snippet: 65.0%

{}

new-benchmark: 阶跃自研 StepCodeBench 子集(General)

打开官方来源

gdpval-aa 1571 模型 step-5-preview · 版本 v2 · 指标 未说明 · 单位 index 来源等级 A · third_party_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: GDPval-AA v2 · quote_snippet: 1571

{}

GDPval-AA v2 数据采用 Artificial Analysis 截至 2026-09-19 公布的最新结果;按厂商脚注口径记 third_party_reported

打开官方来源

tau3-bench 42.5% 模型 step-5-preview · 版本 Banking · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: τ³-Banking · quote_snippet: 42.5%

{}

通用 Agent 分组 τ³-Banking 行;与 retail/airline 等子集共用 tau3-bench benchmark

打开官方来源

automationbench 51.0% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: AutomationBench-AA · quote_snippet: 51.0%

{}

通用 Agent 分组 AutomationBench-AA 行;与同页 AutomationBench (public) 行(44.0%)区分为同基准不同子集

打开官方来源

automationbench 44.0% 模型 step-5-preview · 版本 public · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: AutomationBench (public) · quote_snippet: 44.0%

{}

AutomationBench public 子集(与 AutomationBench-AA 同基准不同子集)

打开官方来源

aa-briefcase 1417 模型 step-5-preview · 版本 未说明 · 指标 未说明 · 单位 index 来源等级 A · third_party_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: AA-Briefcase · quote_snippet: 1417

{}

Artificial Analysis 提供的 briefcase 评测指数

打开官方来源

toolathlon 74.1% 模型 step-5-preview · 版本 Verified · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: Toolathlon-Verified · quote_snippet: 74.1%

{}

通用 Agent 分组 Toolathlon-Verified 行

打开官方来源

mcp-atlas 85.6% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: MCP-Atlas · quote_snippet: 85.6%

{}

通用 Agent 分组 MCP-Atlas 行

打开官方来源

present-bench 76.8% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: PresentBench · quote_snippet: 76.8%

{}

通用 Agent 分组 PresentBench 行;映射到 present-bench benchmark 主数据

打开官方来源

officeqa-pro 60.3% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: OfficeQA Pro · quote_snippet: 60.3%

{}

通用 Agent 分组 OfficeQA Pro 行

打开官方来源

spreadsheetbench 29.4% 模型 step-5-preview · 版本 v2 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: SpeadSheet v2 · quote_snippet: 29.4%

{}

通用 Agent 分组 Spreadsheet v2 行(页面拼写为 SpeadSheet v2);映射到 spreadsheetbench benchmark 主数据

打开官方来源

jobbench 59.0% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: JobBench · quote_snippet: 59.0%

{}

通用 Agent 分组 JobBench 行

打开官方来源

apex-agents 37.8% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: Apex-Agents · quote_snippet: 37.8%

{}

通用 Agent 分组 Apex-Agents 行

打开官方来源

draco 83.3% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: Draco · quote_snippet: 83.3%

{}

通用 Agent 分组 Draco 行

打开官方来源

browsecomp 88.7% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: BrowseComp · quote_snippet: 88.7%

{}

通用 Agent 分组 BrowseComp 行

打开官方来源

hlehle 59.4% 模型 step-5-preview · 版本 w. tool · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: HLE w/ tools‡ · quote_snippet: 59.4%

{
  "harness": null,
  "tools": [
    "browser",
    "code_execution"
  ],
  "shots": null,
  "reasoning_effort": null,
  "temperature": null,
  "top_p": null,
  "token_budget": null,
  "turn_limit": null,
  "time_limit": null,
  "run_count": null,
  "aggregation": null,
  "judge": null
}

页面脚注明示 HLE w/ tools 中 Step 5 Preview (High) 与 GLM-5.3 (Max) 在纯文本子集上评测,其余模型在完整数据集上评测——不同评测设置不直接可比

打开官方来源

finstepbench-livesearch 74.5% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: FinStepBench-LiveSearch† · quote_snippet: 74.5%

{}

new-benchmark: 阶跃自研 FinStepBench 子集(LiveSearch)

打开官方来源

finstepbench-corporatevaluation 60.6% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: FinStepBench-CorporateValuation† · quote_snippet: 60.6%

{}

new-benchmark: 阶跃自研 FinStepBench 子集(CorporateValuation)

打开官方来源

finstepbench-financedr 55.8% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: FinStepBench-FinanceDR† · quote_snippet: 55.8%

{}

new-benchmark: 阶跃自研 FinStepBench 子集(FinanceDR / DeepResearch)

打开官方来源

frontierfinance 66.4% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 通用 Agent · row: FrontierFinance · quote_snippet: 66.4%

{}

FrontierFinance(Samaya)外部评测,页面给出 220 道题、11,543 项评估标准

打开官方来源

agents-last-exam 29.5% 模型 step-5-preview · 版本 ALE-CLI · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 电脑操作 · row: Agents' Last Exam (ALE-CLI) · quote_snippet: 29.5%

{}

电脑操作分组 Agents' Last Exam CLI 子集行

打开官方来源

mmmu 76.0% 模型 step-5-preview · 版本 Pro · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 多模态与文档 · row: MMMU-Pro · quote_snippet: 76.0%

{}

多模态与文档分组 MMMU-Pro 行

打开官方来源

gdp-pdf 14.8% 模型 step-5-preview · 版本 未说明 · 指标 accuracy · 单位 percent 来源等级 A · vendor_reported · 核对日期 2026-09-20 · 距快照 14 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

heading: 更多评测结果 · table: 多模态与文档 · row: GDP.pdf · quote_snippet: 14.8%

{}

new-benchmark: 多模态与文档分组 GDP.pdf 行(GDPval 文档理解子集)

打开官方来源