已经实测了,可以用多模态,文字,语音,图像各种模型。 响应大概 5 秒内能返回,挺快的,至于后续人多了会不会卡,现在还不确定,反正免费 Token 大家用力蹬起来。
活动链接大家可以用我的邀请链接: https://platform.stepfun.com/?invite_code_v2=MODLTTUN 也让我沾沾光,哈哈
https://api.stepfun.com/step_plan/v1/chat/completionsbox-secrets.json → card.STEPFUN_API_KEY,全程脱敏,未写入本报告)/workspace/step-plan-test.png( 200×80 PNG ,红色圆 + 标签 42)| 类别 | 通过 | 失败 | 合计 |
|---|---|---|---|
| 文本冒烟 | 5 | 0 | 5 |
| 多模态视觉 | 2 | 0 | 2 |
| 视觉答案正确(含「 42 」) | 2 | 0 | 2 |
提示词:要求精确回复 TEXT_OK(允许附带 reasoning ;判定:HTTP 200 且 assistant 内容非空或有可用输出)。参数:max_tokens=96,temperature=0。
| 模型 | HTTP | 延迟(s) | finish_reason | prompt | completion | total | 内容摘要(~80) | 成功 | 错误 |
|---|---|---|---|---|---|---|---|---|---|
| step-5-preview | 200 | 36.791 | stop | 22 | 23 | 45 | TEXT_OK | ✅ | — |
| step-3.7-flash | 200 | 1.992 | stop | 23 | 56 | 79 | TEXT_OK | ✅ | — |
| step-3.5-flash | 200 | 1.295 | stop | 23 | 62 | 85 | TEXT_OK | ✅ | — |
| step-3.5-flash-2603 | 200 | 1.398 | stop | 23 | 81 | 104 | TEXT_OK | ✅ | — |
| step-router-v1 | 200 | 1.452 | stop | 488 | 40 | 528 | TEXT_OK | ✅ | — |
内容:text + image_url( data URL base64 PNG ,detail=low)。问题:图中数字/标签是什么?只答该内容。
说明:首次用 max_tokens=64 时,两模型 finish_reason=length,content 被截断在推理中间(未露出最终答案)。随后以 max_tokens=256(step-3.7-flash 另加 reasoning_effort=low)重试,均成功返回 42。下表为重试结果。
| 模型 | HTTP | 延迟(s) | finish_reason | prompt | completion | total | 内容摘要 | 成功 | 答对 42 | 备注 | 错误 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| step-3.7-flash | 200 | 3.98 | stop | 462 | 56 | 518 | 42 | ✅ | ✅ | max_tokens=256; reasoning_effort=low | — |
| step-5-preview | 200 | 4.895 | stop | 202 | 65 | 267 | 42 | ✅ | ✅ | max_tokens=256 | — |
| 模型 | HTTP | 延迟(s) | finish_reason | completion | 内容摘要(截断) |
|---|---|---|---|---|---|
| step-3.7-flash | 200 | 2.186 | length | 64 | The user wants me to identify the number in the image. 1. *Analyze the image: |
| step-5-preview | 200 | 4.895 | length | 64 | The user is asking what number or label is in the image. The image shows a pink/ |
step-5-preview (文本):可用;延迟约 36.791s ; HTTP 200 ;回复 TEXT_OK。
step-3.7-flash (文本):可用;延迟约 1.992s ; HTTP 200 ;回复 TEXT_OK。
step-3.5-flash (文本):可用;延迟约 1.295s ; HTTP 200 ;回复 TEXT_OK。
step-3.5-flash-2603 (文本):可用;延迟约 1.398s ; HTTP 200 ;回复 TEXT_OK。
step-router-v1 (文本):可用;延迟约 1.452s ; HTTP 200 ;回复 TEXT_OK。
step-3.7-flash (视觉):成功且识别到 42;延迟约 3.98s 。
step-5-preview (视觉):成功且识别到 42;延迟约 4.895s 。
文档侧:step-3.7-flash 旗舰多模态推理,适合 agent/coding/视觉;step-3.5-flash / step-3.5-flash-2603 偏高速 agent/coding ;step-router-v1 为 Step Plan 智能路由(不支持图像输入);step-5-preview 文档示例支持图文。
推理模型在视觉场景下建议 max_tokens ≥ 128–256 ,否则易在 reasoning 阶段被 length 截断;可用 reasoning_effort=low 缩短思考。
step-router-v1 本次纯文本正常,但 prompt_tokens=488 (明显高于其他 ~22–23 ),可能含路由侧额外上下文。
本次最终结果无失败错误体(首次视觉仅为 length 截断,非 HTTP 错误)。
日常主力( agent/coding + 需要视觉):step-3.7-flash — 文本 ~2s 级,视觉可正确 OCR ,建议配合 reasoning_effort=low/medium 与充足 max_tokens。
高频/省延迟文本与 agent:step-3.5-flash(~1.3s )或 step-3.5-flash-2603(~1.4s ),本次均精确返回 TEXT_OK。
质量优先预览:step-5-preview 文本可用但冷启动较慢(本次 ~37s ),视觉正确;适合非延迟敏感任务。
智能路由纯文本:step-router-v1 可用;勿传图片(文档明确不支持)。
图像编辑 / 音频:本次跳过;有专用需求再按官方 image/audio API 单独测。
文本成功:step-5-preview, step-3.7-flash, step-3.5-flash, step-3.5-flash-2603, step-router-v1
视觉正确:step-3.7-flash, step-5-preview
脱敏原始结果:/workspace/step-plan-test-results.json、/workspace/step-plan-vision-retry.json
这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。
V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。
V2EX is a community of developers, designers and creative people.