我们给 AI 视频生成加了一道确认关卡,想听听 V 友怎么看

1 小时 3 分钟前
 fi903403

事情是这样的。

我在 Renoise 团队负责市场和增长。最近参与产品对外介绍时,我们反复碰到一个有点反直觉的问题。

现在让 AI 生成一段视频,其实已经不算难了。

难的是按下生成按钮之前,你到底想清楚了没有。

拿一张产品图做短广告,看起来就是一句话的事。真做起来,要先定画幅和时长,再拆镜头、写提示词、选模型,还要想清楚首帧、参考图和声音怎么接。方向有一点没说清楚,模型也会很认真地跑完,然后消耗 credits ,留下的却可能是一段无法交付的结果。

麻烦不只在生成质量。很多返工,其实发生在需求还没说清楚的时候。生成系统越听话,这个问题反而越明显。

所以我们做 Renoise Agent 时,没有让它收到一句话就立刻开始生成。它会先追问缺少的信息,再把需求拆成镜头和具体任务。图片、视频、音频都可以放进同一个会话里,每个任务会列出提示词、模型、格式和参考素材。

然后,它会停下来,等待确认。

这一步是我们最想做的东西。

每项任务真正运行前,用户会看到一张确认卡。卡片里有模型、参数和预计消耗的 credits 。你确认了,它才提交生成。只是和 Agent 聊方案,不会消耗生成 credits 。

我们逐渐形成了一个判断。

一个能替用户花钱的 Agent ,重要的能力不只是自动化,还要知道什么时候停下来,把决定权交还给人。

自动化当然很爽。你给一个目标,它自己选模型、排任务、跑结果,最好连人都不用看。可只要任务会消耗真实预算,或者后续步骤依赖前面的结果,完全自动运行就很容易从省事变成失控。

我们现在选择的做法,是先让 Agent 把意图翻译成一个可以检查的计划,再让人决定要不要执行。

说实话,这个方案还远远没到完美。

Renoise Agent 目前还是 Beta 。它给你的是一组图片、视频和音频素材,不是一条自动剪辑完成的影片。生成结果仍然需要人来审,镜头不对还得重新调整,最终拼接也要在剪辑软件里完成。

Agent 也没有取代画布。前者更适合「我有一个目标,但不想从空白提示词开始」,后者更适合已经知道自己要什么、希望亲手控制素材关系和镜头顺序的人。

现在的典型流程大概是这样。

用户先用自然语言描述创作目标,也可以把参考图片、视频或音频放进会话。信息不足时,Agent 会继续追问。需求明确后,它会规划一组镜头任务,并在确认卡中展示提示词、模型、格式和预计消耗。

到这里仍然没有直接生成。用户可以检查任务、修改方向,再决定是否执行。确认后的结果会回到同一个会话里,接着可以迭代、增强或下载。

这个流程没有解决所有问题。角色或产品在多个镜头里的稳定程度,仍然会受到素材、提示词和所选模型影响。某个镜头失败后,怎样只重做必要部分,而不破坏已经可用的结果,也还有继续优化的空间。

但我们认为,先把计划摊开给人看,至少能把一部分昂贵的试错挡在生成按钮之前。

所以想问问 V 友。

一个会消耗 credits 的 AI Agent ,大家更希望每项任务都手动确认,还是给它一个预算上限,让它自己跑?

模型选择这件事,应该完全交给 Agent ,还是默认给出两三个候选,让用户自己挑?

多镜头生成里,大家最想优先解决的是角色和产品一致性、失败任务的重试,还是成片的自动拼接?

如果你也在做类似的 Agent 工作流,很想听听你是怎么处理权限、预算和人工确认这三件事的。

产品功能页放在这里。

https://renoise.ai/features/renoise-agent

38 次点击
所在节点    推广
0 条回复

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1240656

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX