vget v0.12.1 发布,新增 AI 功能,语音转文字, 效果极好

1 月 7 日
 guiyumin

各位好

vget v0.12.1 发布了

https://github.com/guiyumin/vget

https://vget.io

这一版,有一个重大的更新: 语音转文字,英文是 speech to text ,或者是 Automatic Speech Recognition ( ASR )

首先,你可以用 vget 下载视频,或者播客

然后使用语音转文字功能,转录为带有时间戳的文本

下一步,你可以继续用 openai api 来总结一下,当然,也可以复制粘贴去其他 ai 做一下总结

目前支持的大模型是这些:

命令行使用

在 CLI 中使用 vget ai transcribe 命令即可进行语音转文字:

# 基础用法:转写音频文件,默认输出 Markdown 格式
vget ai transcribe ./recording.mp3

# 指定语言:使用 -l 参数指定音频语言
vget ai transcribe -l zh ./interview.mp3

# 输出字幕文件:使用 -o 参数指定输出为 SRT 格式
vget ai transcribe -l zh ./podcast.mp3 -o podcast.srt

# 转写视频文件:自动提取音频后进行转写
vget ai transcribe -l en ./lecture.mp4 -o lecture.srt

Docker Web 界面

在 Docker 部署的 Web 界面中,点击左侧导航栏的 AI 图标即可访问语音转文字功能:

  1. 选择文件 - 可以从 /home/vget/downloads 目录选择已下载的文件,也可以直接上传本地文件
  2. 设置语言 - 选择音频对应的语言以获得最佳识别效果
  3. 选择格式 - 支持 Markdown 文本或 SRT 字幕格式输出
  4. 开始转写 - 点击按钮即可开始,转写完成后可直接下载结果

支持的文件格式

类型 支持格式
音频 MP3, WAV, M4A, FLAC, OGG, AAC
视频 MP4, MKV, MOV, AVI, WebM

对于视频文件,vget 会自动提取音频轨道后进行转写,无需手动转换。

2490 次点击
所在节点    分享创造
3 条回复
Vendettar
1 月 14 日
感谢,研究试试
ronman
3 月 5 日
docker 拉不到 vget:full-large 呢?
guiyumin
3 月 5 日
@ronman 我看一下,不好意思,请稍后

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1183737

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX