帕累托前沿,描述的是多个目标之间所能达到的最佳平衡:在这条边界上,想进一步改善一个维度,通常就必须牺牲另一个。对 AI 模型而言,能力、效率与成本之间也存在这样的取舍。推进帕累托前沿,并不是让取舍消失,而是通过新的模型设计,将这条边界继续向外推——
模速生态企业阶跃星辰新一代旗舰模型 Step 5 Preview,为此而来!
这是一款面向真实世界 Agentic 任务的旗舰基座模型。我们认为,随着 Agent 从“回答问题”走向“完成任务”,日常工作主力模型的标准也在发生变化:不再只是单项能力足够强,而是要在能力、成本、效率和场景覆盖之间实现更好平衡。Step 5 Preview 正是围绕这种平衡而设计。
它采用稀疏 MoE 架构,总参数量 600B、激活参数仅 27B,支持 100 万 Token 上下文窗口,原生支持文本与视觉输入,在 AI 编程、软件工程、专业知识工作、金融等场景表现突出。
在全球权威的 Artificial Analysis Intelligence Index 中,Step 5 Preview 取得 44 分,位居全球开源模型前三。与此同时,Step 5 Preview 单任务成本仅为 Claude Opus 5 的 1/8。这意味着,Step 5 Preview 在同样成本下获得更强智能,也让同等能力能以更低成本投入实际工作——进一步推动 AI 模型的帕累托前沿。

在公开和内部评估中,Step 5 Preview 在复杂的软件工程任务(包括长程规划任务)、专业知识工作和金融领域等基准测试中展现出较为均衡的综合能力,并在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投资研究评测 FrontierFinance,以及跨领域深度研究评测 DRACO 上仅次于 GPT-6 Astra 或 Claude Opus 5,领先其他参评开源模型。

GDPval-AA v2 采用 Artificial Analysis 截至 2026 年 9 月 19 日公布的最新结果。DeepSWE v1.1 使用SWE-agentharness 进行评测,参数设置为 temperature=1.0 和 top_p=0.95。
Step 5 Preview 全量开放,Step 5 Preview 依旧是一款开源模型,将在10 月 15 日释放模型权重,欢迎大家持续关注。
Model Blog:https://www.stepfun.com/step-5-preview
国内开放平台 API 接入:https://platform.stepfun.com/
国外开放平台 API 接入:https://platform.stepfun.ai/
Studio平台在线体验:studio.stepfun.com
在真实场景中找到能效平衡
Step 5 Preview 面向 AI 编程、软件工程、专业知识工作、金融等场景设计,重点覆盖需要长上下文、多轮工具调用和持续执行的真实工作场景。相比一次性回答问题,我们更关注模型能否在更长的任务链中持续理解上下文、调用工具,并最终完成任务交付。
Coding:既要广,也要深
阶跃构建了 StepCodeBench,覆盖 553 个独立代码仓库、9 类任务、20 个应用领域和 33 种编程语言,评测设计参考了产业需求、真实用户需求和专家工作轨迹。
在该评测上,Step 5 Preview 在整体任务成功率和跨场景稳定性上表现突出,能够覆盖多种编程语言,以及 Bug 修复、功能开发、代码重构、环境配置等真实开发任务。


在下方展示的任务中,Step 5 Preview 根据自然语言需求,自主阅读 ESP32 设备及相关 API 的大量开发文档,将一块 ESP32-S3 开发板改造成支持蓝牙按键与语音输入的 Vibe Coding 键盘。在开发过程中,模型不仅编写代码,还能够访问 COM 串口、调用摄像头、获取设备截图、模拟鼠标操作,并根据真实设备返回的状态和报错持续修改、运行和调试代码,连续执行超过 3 小时。
跨越更长任务周期
长周期任务要求模型持续追踪此前的执行结果,利用运行反馈,并判断下一步应该尝试什么。我们选择了两个可量化的场景:一个是优化 GPU Kernel,另一个是优化后训练数据流程。
优化 GPU Kernel
给 Step 5 Preview 24 小时,让它在一张 NVIDIA H100 GPU 上从零开始优化一个 MLA GPU 内核。该任务的头维度为 512,生产配置为 batch size 1、64 个注意力头和 8,192 个 token。
从一份初始描述出发,Step 5 Preview 自主实现修改、运行内核并测量吞吐量。当某个候选方案能够成功运行,却导致吞吐量下降时,它会放弃该方案,并从此前找到的最佳版本继续优化。在本次任务中,Step 5 Preview 经过约 22 小时,将峰值性能提升至 508 TFLOPS,超越 Claude Opus 5 的 493 TFLOPS。

优化后训练数据循环
在第二项实验中,给 Step 5 Preview 24 小时,要求它通过自动化后训练提升一个 Qwen3-30B-A3B 基础模型在 AIME24 上的表现。模型可以调用一个接入生产数据的 API annotator,并自行决定如何使用 annotator、如何调整后训练数据,再根据下游效果继续迭代。
经过后训练,模型在 AIME24 官方测试集上的准确率由 53.3% 提升至 60%。这一成绩与参与 Claude Opus 5 持平,同时消耗的 annotator token 更少。

前端设计:让想法真实落地
Step 5 Preview 不只会写前端代码,也能直接参与视觉内容的生成与迭代。它可以完成网页界面和数据可视化,也能调用 Blender 创建并反复调整 3D 资产,再把这些资产接入 Three.js 的交互式 Web 应用和游戏。
Step 5 Preview 可以从一本 1922 年的《广九铁路旅行指南》中,提取信息构建行程查询、费用计算与路线回放功能,让小火车沿百年前的线路运行,将百年史料转化为可交互的产品。
聚焦金融:一场对综合能力的真实检验
金融是最能检验模型综合能力的场景之一。它同时连接宏观经济、政策监管、行业周期与公司经营,任何一个行业的变化,都可能进一步影响市场预期和资产价格。对模型来说,这不仅要求掌握财报分析、估值、投资研究等专业知识,也要求具备跨行业理解、证据核验和复杂问题拆解能力。
因此阶跃将金融作为 Step 5 Preview 的重点验证场景之一,主要考察三类能力:是否具备扎实的金融专业知识,是否能够建立跨行业之间的因果联系,以及是否能在信息不完整、数据口径不一致的情况下,借助工具完成严谨分析和建模。围绕公司研究这一典型且高难度的金融工作流,我们进一步构建了三项内部评测。
FinStepBench - LiveSearch:评估模型能否随着信息需求变化,检索并验证及时、可靠的金融信息。
FinStepBench - CorporateValuation:评估模型能否将金融数据和合理假设转化为内部一致的预测,并完成可复现的估值。
FinStepBench - DeepResearch:评估完整的金融研究流程,从证据收集与分析,到最终产出完整、有充分依据的研究报告。
阶跃还使用外部基准测试 FrontierFinance 对 Step 5 Preview 进行了评估。该测试通过 220 道由专家设计的问题和 11,543 项评估标准,覆盖六类投资应用场景。其详细的评分规则从另一个维度补充评估了模型处理复杂金融问题的能力。在全部四项基准测试中,Step 5 Preview 均取得较强结果,展现出其在信息检索、企业估值和金融研究等任务上的强劲能力。

写在最后:阶跃的 3 次效率追问
过去,大模型 Scaling 的核心逻辑是用更多计算换取更强智能。但随着模型规模和任务复杂度持续增长,计算成本也被同步放大,Scaling 的核心关注开始变成:如何更高效地把计算转化成模型能力?
从 Step 3.5 Flash、Step 3.7 Flash 到 Step 5 Preview,阶跃持续探索的正是这个问题。相信下一阶段的 Scaling,不只是更多 Compute,也包括更高效率的 Compute。
最后,阶跃将在 10 月 15 日释放 Step 5 Preview 完整权重,敬请期待!
来源:阶跃StepFun