昨天 Wan 3.0 开始公测,大家讨论最多的应该是单次终于可以做到 30 秒。
但我看了一圈之后,反而觉得这次比较容易被忽略的功能是:它开始直接吃“文档”了。
除了文字、图片、视频、音频之外,现在 doc 、xls 、ppt 、pdf 、md 都可以直接作为输入。
这个变化其实挺有意思。
以前所谓的 AI 视频生成,大部分还是:
写 prompt → 抽一个视频 → 不满意继续抽。
所以它本质上还是一个“生成素材”的工具。
但如果模型能直接理解一份 PPT 、产品 Brief 或 PDF ,然后把里面的内容、图片、结构一起理解之后生成视频,那用户给 AI 的就不再只是一个 prompt ,而是一整份“任务上下文”。
比如扔进去一份产品介绍 PPT ,让它直接做产品宣传片;或者把课程 PDF 丢进去做讲解视频。感觉视频模型正在慢慢从“生成一个好看的镜头”,往“完成一个视频任务”走。
另外单次 30 秒也比想象中重要。5 ~ 10 秒更像素材,30 秒已经开始能够完整讲一件事情了,后面如果角色一致性和镜头衔接继续提高,很多以前必须靠剪辑拼起来的东西可能会直接在模型里完成。
查资料的时候看到一个 Wan 3 的站: https://wan3video.app/ 里面整理了一些 Wan 3 的视频案例、prompt 和不同输入方式,想研究的可以一起看看。
现在比较好奇的是:
如果以后视频模型真的可以直接读 PPT / PDF / 产品资料,然后自己规划镜头、生成画面、配音和声音,大家觉得最先被替代的会是“AI 视频工具”,还是传统的视频制作 SaaS