最近做了一个叫「片刻转写」的桌面工具,起因是我想整理小约翰可汗的视频。
像《苏联为何而强大? [小约翰] 》这样的长视频,看完只能记住一个大概。如果想把内容整理成以后可以查找、引用、继续加工的资料,就需要完整文稿、时间点,以及后续的校对。
我试过几款市面上的视频转写工具,发现它们大多只解决“把声音变成文字”这一步。有些等待时间比较长,拿到文稿以后,如果还要核对人名、时间点,或者想知道视频里的配乐,通常还要再找别的工具。
所以我做了一个更完整一点的整理流程。
目前能做什么?
1. 文稿提取
导入本地视频后,生成带时间点的分段文稿,可以继续搜索、复制,也可以导出 TXT 、SRT 、VTT 等文件。

上图是实际的文稿结果页:左侧保留任务列表,右侧展示当前视频的文字稿和时间信息。
2. 多人说话校对
转写结果会和原视频放在同一个校对页面里:
- 点击某段文字,视频跳到对应时间;
- 播放时,当前段落跟着定位;
- 可以修改文字、说话人、开始时间和结束时间;
- 检测到多位说话人后,可以重新命名角色;
- 段落可以切分,也可以合并。
我比较看重这一部分。因为真正整理资料时,第一次识别出来的文字通常还不够可靠,尤其是人名、地名、年代和多人对话。能不能快速回到原视频核对,比单纯生成一篇文字更重要。

截图里可以看到,视频和分段文稿同时出现;页面检测到了多位说话人,并提供说话人、起止时间、文本、切分和合并等编辑入口。
3. 视频配乐提取
视频里除了人声,还有背景音乐。片刻转写会标出可能出现音乐的区间,并尝试识别曲名、作者和出现时间。
同一首歌如果出现多次,会合并成一条记录,但保留多个时间区间。点某个区间,可以回到视频里的对应位置;暂时没识别出来的片段,也会保留下来,方便之后人工核对。
以《苏联为何而强大?》为例,目前演示里识别出了《 All This 》、Kevin MacLeod 、Action Cuts ,并保留了 9 个出现区间。

截图中的音乐时间轴会标出候选区间,曲目卡片则显示曲名、作者、专辑、匹配度和多个出现时间段。
4. 字幕和任务结果
如果只需要字幕,可以从同一份分段结果导出常见字幕文件;处理过的任务也会保留在应用中,方便之后继续查看或重新导出。


为什么现在还没有开源?
目前这个工具还没有开源,也没有对外提供公共服务。
主要原因不是想故意闭源,而是其中部分能力依赖按量付费的语音和音乐识别接口。直接开源的话,接口配置、费用承担、滥用控制和用户隐私这些问题都还没有想清楚;如果做成公共在线服务,又需要承担持续的接口成本。
现在它更像是一个我自己在使用的桌面工具:需要时打开,处理自己的视频,结果保存在自己的电脑上。
在决定要不要继续投入之前,我想先听听 V2EX 上大家的看法。
想请教大家几个问题
- 你们平时有没有整理课程、访谈、播客、直播回放或长视频的需求?
- 对你们来说,文稿提取、多人说话校对、配乐时间轴,哪个功能最有价值?
- 如果部分识别服务需要按量付费,你们更能接受哪种方式:自带接口配置、按次付费、订阅,还是一次性买断?
- 这种工具更适合做成桌面软件,还是在线服务?
- 如果不考虑开源,大家会希望看到什么样的下载、试用和隐私说明,才愿意使用?
我现在主要想判断两件事:
- 这是不是一个只有我自己会用的个人工具;
- 还是确实有人愿意为“文稿提取 + 多人校对 + 配乐整理”这一整套流程付费或长期使用。
如果大家觉得有价值,我会继续把安装、试用和费用说明整理清楚;如果需求比较小,也可能就把它保留成自己的整理工具。
欢迎直接批评产品定位、功能设计和可能的收费方式。谢谢。