目前使用 whisper-large-v3-turbo ,英文音频效果不错,但是中文识别准确率很差,几乎每个句子都有错。请问有什么更好的模型推荐?
目前使用 whisper-large-v3-turbo ,英文音频效果不错,但是中文识别准确率很差,几乎每个句子都有错。请问有什么更好的模型推荐?
1
jackOff 2h 30m ago
同求,如果中文每个字的时间轴识别能精准不偏移就完美了
|
2
Muniesa 2h 30m ago
Qwen3-ASR-1.7B 很多方言口音也能识别
|
3
snow0 1h 53m ago
项目中用的 qwen-audio-3.0-asr-flash-filetrans ,可以试试
|
4
Liu6 1h 20m ago
我在前公司部署的是中文采用 funasr , 英文 whisperx
|
5
zlowly 1h 15m ago
Fun-ASR-Nano 挺不错,以前的 funasr 是非自回归模型,中文同音字之类的很容易出错,后来换了用 LLM 解码器,中文质量肉眼可见的提升,
|