音频转文本模型推荐

4 小时 37 分钟前
 carlself

目前使用 whisper-large-v3-turbo ,英文音频效果不错,但是中文识别准确率很差,几乎每个句子都有错。请问有什么更好的模型推荐?

351 次点击
所在节点    问与答
5 条回复
jackOff
4 小时 36 分钟前
同求,如果中文每个字的时间轴识别能精准不偏移就完美了
Muniesa
4 小时 36 分钟前
Qwen3-ASR-1.7B 很多方言口音也能识别
snow0
3 小时 59 分钟前
项目中用的 qwen-audio-3.0-asr-flash-filetrans ,可以试试
Liu6
3 小时 26 分钟前
我在前公司部署的是中文采用 funasr , 英文 whisperx
zlowly
3 小时 21 分钟前
Fun-ASR-Nano 挺不错,以前的 funasr 是非自回归模型,中文同音字之类的很容易出错,后来换了用 LLM 解码器,中文质量肉眼可见的提升,

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1247087

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX