This topic created in 2193 days ago, the information mentioned may be changed or developed.
通过 AI 识别音频生成字幕的工具有现成的,单纯的文字转换成语音的服务也有很多。可是有基于字幕文件生成符合时间轴的音频的服务或者工具吗?
我在做一个操作示例视频,为了让观看的人有更好的体验,我希望能通过成熟的文字转语音服务配上相对标准的英文配音。一句一句调语速,对时间轴是一个很大的工作量,不知道有没有现成的工具或者服务可以使用?
4 replies • 2020-07-21 14:02:11 +08:00
 |
|
1
aec4d Jul 21, 2020 via iPhone
调 tts api 应该 50 行代码能够解决
|
 |
|
2
whileFalse Jul 21, 2020
关键从字幕中没法正确地获得语速和发音人。 首先当两个人对话的时候,字幕通常不包含发音人信息,所以你是不是能接受明明是两个人的对话,转出来的音频却是一个人自说自话? 其次语速,如果是两个人几乎同时说话,字幕中的信息只能看出是一句话之后半秒下一句就开始说了,那么程序会不会认为上一句的语速很快,半秒就说完了?
在存在这些问题的情况下,“字幕转音频”这个需求没法产品化;虽然就 LZ 的需求来看,不存在上述的几个问题。
|