• 请不要在回答技术问题时复制粘贴 AI 生成的内容
ted0220
V2EX  ›  程序员

想请教下:有没有轻量实时的视听融合方案,判断目标方位是否有人说话?

  •  
  •   ted0220 · 4h 29m ago · 340 views
    大家好,想请教一个实时视听判断的问题。

    目前自己搭了一套阵列麦克风,可以做一定程度的波束拾音和声源方向估计。但现在遇到的问题是:即使声音方向和画面中的人物对上了,也无法确认这个声音确实是他发出的,反射声或附近声源也可能造成误判。

    所以想增加视觉嘴型判断,通过 MediaPipe 获取嘴部关键点,再结合 VAD 、DOA 和人物位置,判断目标方位的人是否真的在说话。

    之前了解过 Light-ASD 、TalkNet 、SyncNet 等方案,但这些方案都只能用于后处理,计算量也比较大,无法直接接入实时链路。

    想请教大家:

    1. 这个方向是否合理?
    2. 有没有成熟的轻量流式模型或开源方案?
    3. 如果没有,自己训练一个以嘴部时序、VAD 和 DOA 为输入的轻量模型是否可行?

    不要求每一帧都给出结果,证据不足时输出 unknown 也可以。欢迎有相关经验的朋友指点一下,谢谢。
    2 replies    2026-08-28 15:58:42 +08:00
    yuiffy
        1
    yuiffy  
       3h 24m ago
    没做过视觉和阵列的,用过阿里维护的 funasr 里面有 asr+说话人识别,通过音频声线识别的。我看飞书会议有时候能区分说话人,可能也是基于这个说话人识别能力。
    ted0220
        2
    ted0220  
    OP
       3h 18m ago
    @yuiffy 是的,阿里的应该都是通过声纹特征来做聚合,之前也研究过声纹相关内容,目前开源的声纹技术对环境要求还是相对严苛,如果在嘈杂的环境几乎就失效了,而且都是后处理,无法实时验证,感觉这个方向还挺好玩
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2808 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 23ms · UTC 11:17 · PVG 19:17 · LAX 04:17 · JFK 07:17
    ♥ Do have faith in what you're doing.