carlself
V2EX  ›  问与答

音频转文本模型推荐

  •  
  •   carlself · 2h 31m ago · 271 views

    目前使用 whisper-large-v3-turbo ,英文音频效果不错,但是中文识别准确率很差,几乎每个句子都有错。请问有什么更好的模型推荐?

    5 replies  •  2026-10-08 17:31:02 +08:00
    jackOff
        1
    jackOff  
       2h 30m ago
    同求,如果中文每个字的时间轴识别能精准不偏移就完美了
    Muniesa
        2
    Muniesa  
       2h 30m ago
    Qwen3-ASR-1.7B 很多方言口音也能识别
    snow0
        3
    snow0  
       1h 53m ago
    项目中用的 qwen-audio-3.0-asr-flash-filetrans ,可以试试
    Liu6
        4
    Liu6  
       1h 20m ago
    我在前公司部署的是中文采用 funasr , 英文 whisperx
    zlowly
        5
    zlowly  
       1h 15m ago
    Fun-ASR-Nano 挺不错,以前的 funasr 是非自回归模型,中文同音字之类的很容易出错,后来换了用 LLM 解码器,中文质量肉眼可见的提升,
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3376 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 31ms · UTC 10:46 · PVG 18:46 · LAX 03:46 · JFK 06:46
    ♥ Do have faith in what you're doing.