大家好,想请教一个实时视听判断的问题。
目前自己搭了一套阵列麦克风,可以做一定程度的波束拾音和声源方向估计。但现在遇到的问题是:即使声音方向和画面中的人物对上了,也无法确认这个声音确实是他发出的,反射声或附近声源也可能造成误判。
所以想增加视觉嘴型判断,通过 MediaPipe 获取嘴部关键点,再结合 VAD 、DOA 和人物位置,判断目标方位的人是否真的在说话。
之前了解过 Light-ASD 、TalkNet 、SyncNet 等方案,但这些方案都只能用于后处理,计算量也比较大,无法直接接入实时链路。
想请教大家:
1. 这个方向是否合理?
2. 有没有成熟的轻量流式模型或开源方案?
3. 如果没有,自己训练一个以嘴部时序、VAD 和 DOA 为输入的轻量模型是否可行?
不要求每一帧都给出结果,证据不足时输出 unknown 也可以。欢迎有相关经验的朋友指点一下,谢谢。
目前自己搭了一套阵列麦克风,可以做一定程度的波束拾音和声源方向估计。但现在遇到的问题是:即使声音方向和画面中的人物对上了,也无法确认这个声音确实是他发出的,反射声或附近声源也可能造成误判。
所以想增加视觉嘴型判断,通过 MediaPipe 获取嘴部关键点,再结合 VAD 、DOA 和人物位置,判断目标方位的人是否真的在说话。
之前了解过 Light-ASD 、TalkNet 、SyncNet 等方案,但这些方案都只能用于后处理,计算量也比较大,无法直接接入实时链路。
想请教大家:
1. 这个方向是否合理?
2. 有没有成熟的轻量流式模型或开源方案?
3. 如果没有,自己训练一个以嘴部时序、VAD 和 DOA 为输入的轻量模型是否可行?
不要求每一帧都给出结果,证据不足时输出 unknown 也可以。欢迎有相关经验的朋友指点一下,谢谢。