Step 5 Preview
StepFun / 阶跃星辰 · 2026-09-19 · 类别未确认
官方发布来源 · 按需求选型 · 查看覆盖缺口 · 归档与转录记录
Step 5 Preview
阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。
- 输入模态
- 文本 / 图像
- 上下文
- 1M
- 参数
- 600B total / 27B active MoE
- 价格(每百万 tokens)
- 无此口径报价;不等于免费
本变体的评测证据
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 推理与知识 · row: GPQA Diamond · quote_snippet: 93.5%
{}Step 5 Preview (High) 推理与知识分组 GPQA Diamond 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 推理与知识 · row: HLE · quote_snippet: 46.5%
{}HLE 纯文本基线(非 w/ tools 子集)
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 推理与知识 · row: AA-LCR v1.1 · quote_snippet: 88.3%
{}Artificial Analysis 长上下文检索 v1.1
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 推理与知识 · row: CritPt · quote_snippet: 20.9%
{}推理与知识分组 CritPt 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: DeepSWE v1.1 · quote_snippet: 67.7%
{
"harness": "swe-agent",
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": 1,
"top_p": 0.95,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": null,
"aggregation": null,
"judge": null
}页面脚注明示 DeepSWE v1.1 用 SWE-agent harness,temperature=1.0、top_p=0.95
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: Terminal-Bench v2.1 · quote_snippet: 85.0%
{}Coding 分组 Terminal-Bench v2.1 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: Terminal-Bench v4 · quote_snippet: 33.3%
{}Coding 分组 Terminal-Bench v4 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: CyberGym · quote_snippet: 84.7%
{}Coding 分组 CyberGym 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: SciCode · quote_snippet: 58.9%
{}Coding 分组 SciCode 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: RoadmapBench · quote_snippet: 54.3%
{}new-benchmark: RoadmapBench Coding 分组行,benchmark 主数据待补
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: ProgramBench (Pass Rate) · quote_snippet: 80.5%
{}Coding 分组 ProgramBench Pass Rate 行;program-bench benchmark 主数据已存在
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: SWE-Marathon v1.1 (Partial Score) · quote_snippet: 72.7%
{}Coding 分组 SWE-Marathon v1.1 Partial Score 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: MLS-Bench-Lite · quote_snippet: 40.5%
{}Coding 分组 MLS-Bench-Lite 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: SWE-Atlas-QnA · quote_snippet: 63.6%
{}Coding 分组 SWE-Atlas-QnA 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: SWE-Atlas-Test-writing · quote_snippet: 50.8%
{}Coding 分组 SWE-Atlas-Test-writing 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: StepCodeBench† · quote_snippet: 49.0%
{}new-benchmark: 阶跃自研 StepCodeBench(avg@4 553 个独立代码仓库、9 类任务、20 个应用领域、33 种编程语言)
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: StepCode-Bench-Daily† · quote_snippet: 64.9%
{}new-benchmark: 阶跃自研 StepCodeBench 子集(Daily)
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: Coding · row: StepCode-Bench-General† · quote_snippet: 65.0%
{}new-benchmark: 阶跃自研 StepCodeBench 子集(General)
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: GDPval-AA v2 · quote_snippet: 1571
{}GDPval-AA v2 数据采用 Artificial Analysis 截至 2026-09-19 公布的最新结果;按厂商脚注口径记 third_party_reported
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: τ³-Banking · quote_snippet: 42.5%
{}通用 Agent 分组 τ³-Banking 行;与 retail/airline 等子集共用 tau3-bench benchmark
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: AutomationBench-AA · quote_snippet: 51.0%
{}通用 Agent 分组 AutomationBench-AA 行;与同页 AutomationBench (public) 行(44.0%)区分为同基准不同子集
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: AutomationBench (public) · quote_snippet: 44.0%
{}AutomationBench public 子集(与 AutomationBench-AA 同基准不同子集)
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: AA-Briefcase · quote_snippet: 1417
{}Artificial Analysis 提供的 briefcase 评测指数
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: Toolathlon-Verified · quote_snippet: 74.1%
{}通用 Agent 分组 Toolathlon-Verified 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: MCP-Atlas · quote_snippet: 85.6%
{}通用 Agent 分组 MCP-Atlas 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: PresentBench · quote_snippet: 76.8%
{}通用 Agent 分组 PresentBench 行;映射到 present-bench benchmark 主数据
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: OfficeQA Pro · quote_snippet: 60.3%
{}通用 Agent 分组 OfficeQA Pro 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: SpeadSheet v2 · quote_snippet: 29.4%
{}通用 Agent 分组 Spreadsheet v2 行(页面拼写为 SpeadSheet v2);映射到 spreadsheetbench benchmark 主数据
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: JobBench · quote_snippet: 59.0%
{}通用 Agent 分组 JobBench 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: Apex-Agents · quote_snippet: 37.8%
{}通用 Agent 分组 Apex-Agents 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: Draco · quote_snippet: 83.3%
{}通用 Agent 分组 Draco 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: BrowseComp · quote_snippet: 88.7%
{}通用 Agent 分组 BrowseComp 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: HLE w/ tools‡ · quote_snippet: 59.4%
{
"harness": null,
"tools": [
"browser",
"code_execution"
],
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": null,
"aggregation": null,
"judge": null
}页面脚注明示 HLE w/ tools 中 Step 5 Preview (High) 与 GLM-5.3 (Max) 在纯文本子集上评测,其余模型在完整数据集上评测——不同评测设置不直接可比
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: FinStepBench-LiveSearch† · quote_snippet: 74.5%
{}new-benchmark: 阶跃自研 FinStepBench 子集(LiveSearch)
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: FinStepBench-CorporateValuation† · quote_snippet: 60.6%
{}new-benchmark: 阶跃自研 FinStepBench 子集(CorporateValuation)
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: FinStepBench-FinanceDR† · quote_snippet: 55.8%
{}new-benchmark: 阶跃自研 FinStepBench 子集(FinanceDR / DeepResearch)
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 通用 Agent · row: FrontierFinance · quote_snippet: 66.4%
{}FrontierFinance(Samaya)外部评测,页面给出 220 道题、11,543 项评估标准
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 电脑操作 · row: Agents' Last Exam (ALE-CLI) · quote_snippet: 29.5%
{}电脑操作分组 Agents' Last Exam CLI 子集行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 多模态与文档 · row: MMMU-Pro · quote_snippet: 76.0%
{}多模态与文档分组 MMMU-Pro 行
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: 更多评测结果 · table: 多模态与文档 · row: GDP.pdf · quote_snippet: 14.8%
{}new-benchmark: 多模态与文档分组 GDP.pdf 行(GDPval 文档理解子集)