已经实测了,可以用多模态,文字,语音,图像各种模型。 响应大概 5 秒内能返回,挺快的,至于后续人多了会不会卡,现在还不确定,反正免费 Token 大家用力蹬起来。
活动链接大家可以用我的邀请链接: https://platform.stepfun.com/?invite_code_v2=MODLTTUN 也让我沾沾光,哈哈
StepFun Step Plan API 模型测试报告
- 测试时间:2026-09-20 11:38:39 CST (Asia/Shanghai)(报告更新于 2026-09-20 11:40:07 CST (Asia/Shanghai))
- Endpoint:
https://api.stepfun.com/step_plan/v1/chat/completions - 认证:Bearer (
box-secrets.json→card.STEPFUN_API_KEY,全程脱敏,未写入本报告) - 测试图:
/workspace/step-plan-test.png( 200×80 PNG ,红色圆 + 标签42)
摘要
| 类别 | 通过 | 失败 | 合计 |
|---|---|---|---|
| 文本冒烟 | 5 | 0 | 5 |
| 多模态视觉 | 2 | 0 | 2 |
| 视觉答案正确(含「 42 」) | 2 | 0 | 2 |
- 总体判定:通过 — 全部文本模型成功;视觉至少一次成功且答对
文本冒烟结果
提示词:要求精确回复 TEXT_OK(允许附带 reasoning ;判定:HTTP 200 且 assistant 内容非空或有可用输出)。参数:max_tokens=96,temperature=0。
| 模型 | HTTP | 延迟(s) | finish_reason | prompt | completion | total | 内容摘要(~80) | 成功 | 错误 |
|---|---|---|---|---|---|---|---|---|---|
| step-5-preview | 200 | 36.791 | stop | 22 | 23 | 45 | TEXT_OK | ✅ | — |
| step-3.7-flash | 200 | 1.992 | stop | 23 | 56 | 79 | TEXT_OK | ✅ | — |
| step-3.5-flash | 200 | 1.295 | stop | 23 | 62 | 85 | TEXT_OK | ✅ | — |
| step-3.5-flash-2603 | 200 | 1.398 | stop | 23 | 81 | 104 | TEXT_OK | ✅ | — |
| step-router-v1 | 200 | 1.452 | stop | 488 | 40 | 528 | TEXT_OK | ✅ | — |
多模态(视觉)结果
内容:text + image_url( data URL base64 PNG ,detail=low)。问题:图中数字/标签是什么?只答该内容。
说明:首次用 max_tokens=64 时,两模型 finish_reason=length,content 被截断在推理中间(未露出最终答案)。随后以 max_tokens=256(step-3.7-flash 另加 reasoning_effort=low)重试,均成功返回 42。下表为重试结果。
| 模型 | HTTP | 延迟(s) | finish_reason | prompt | completion | total | 内容摘要 | 成功 | 答对 42 | 备注 | 错误 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| step-3.7-flash | 200 | 3.98 | stop | 462 | 56 | 518 | 42 | ✅ | ✅ | max_tokens=256; reasoning_effort=low | — |
| step-5-preview | 200 | 4.895 | stop | 202 | 65 | 267 | 42 | ✅ | ✅ | max_tokens=256 | — |
首次视觉截断记录(供对照)
| 模型 | HTTP | 延迟(s) | finish_reason | completion | 内容摘要(截断) |
|---|---|---|---|---|---|
| step-3.7-flash | 200 | 2.186 | length | 64 | The user wants me to identify the number in the image. 1. *Analyze the image: |
| step-5-preview | 200 | 4.895 | length | 64 | The user is asking what number or label is in the image. The image shows a pink/ |
其他模型
- 跳过 step-image-edit-2:官方文档将其列为文生图/图像编辑模型,chat/completions 请求形态与快速冒烟路径不明确,为避免无效烧 token 未调用。
- 跳过 stepaudio-*:音频端到端模型需要 modalities/audio 等专用字段与音频样本,本次仅做文本与视觉冒烟。
备注与选型
-
step-5-preview (文本):可用;延迟约 36.791s ; HTTP 200 ;回复
TEXT_OK。 -
step-3.7-flash (文本):可用;延迟约 1.992s ; HTTP 200 ;回复
TEXT_OK。 -
step-3.5-flash (文本):可用;延迟约 1.295s ; HTTP 200 ;回复
TEXT_OK。 -
step-3.5-flash-2603 (文本):可用;延迟约 1.398s ; HTTP 200 ;回复
TEXT_OK。 -
step-router-v1 (文本):可用;延迟约 1.452s ; HTTP 200 ;回复
TEXT_OK。 -
step-3.7-flash (视觉):成功且识别到
42;延迟约 3.98s 。 -
step-5-preview (视觉):成功且识别到
42;延迟约 4.895s 。 -
文档侧:
step-3.7-flash旗舰多模态推理,适合 agent/coding/视觉;step-3.5-flash/step-3.5-flash-2603偏高速 agent/coding ;step-router-v1为 Step Plan 智能路由(不支持图像输入);step-5-preview文档示例支持图文。 -
推理模型在视觉场景下建议
max_tokens≥ 128–256 ,否则易在reasoning阶段被length截断;可用reasoning_effort=low缩短思考。 -
step-router-v1本次纯文本正常,但 prompt_tokens=488 (明显高于其他 ~22–23 ),可能含路由侧额外上下文。
错误原文(已脱敏)
本次最终结果无失败错误体(首次视觉仅为 length 截断,非 HTTP 错误)。
结论(日常使用推荐)
-
日常主力( agent/coding + 需要视觉):
step-3.7-flash— 文本 ~2s 级,视觉可正确 OCR ,建议配合reasoning_effort=low/medium与充足max_tokens。 -
高频/省延迟文本与 agent:
step-3.5-flash(~1.3s )或step-3.5-flash-2603(~1.4s ),本次均精确返回TEXT_OK。 -
质量优先预览:
step-5-preview文本可用但冷启动较慢(本次 ~37s ),视觉正确;适合非延迟敏感任务。 -
智能路由纯文本:
step-router-v1可用;勿传图片(文档明确不支持)。 -
图像编辑 / 音频:本次跳过;有专用需求再按官方 image/audio API 单独测。
-
文本成功:
step-5-preview,step-3.7-flash,step-3.5-flash,step-3.5-flash-2603,step-router-v1 -
视觉正确:
step-3.7-flash,step-5-preview
脱敏原始结果:/workspace/step-plan-test-results.json、/workspace/step-plan-vision-retry.json