想请教下:有没有轻量实时的视听融合方案,判断目标方位是否有人说话?

5 小时 56 分钟前
 ted0220
大家好,想请教一个实时视听判断的问题。

目前自己搭了一套阵列麦克风,可以做一定程度的波束拾音和声源方向估计。但现在遇到的问题是:即使声音方向和画面中的人物对上了,也无法确认这个声音确实是他发出的,反射声或附近声源也可能造成误判。

所以想增加视觉嘴型判断,通过 MediaPipe 获取嘴部关键点,再结合 VAD 、DOA 和人物位置,判断目标方位的人是否真的在说话。

之前了解过 Light-ASD 、TalkNet 、SyncNet 等方案,但这些方案都只能用于后处理,计算量也比较大,无法直接接入实时链路。

想请教大家:

1. 这个方向是否合理?
2. 有没有成熟的轻量流式模型或开源方案?
3. 如果没有,自己训练一个以嘴部时序、VAD 和 DOA 为输入的轻量模型是否可行?

不要求每一帧都给出结果,证据不足时输出 unknown 也可以。欢迎有相关经验的朋友指点一下,谢谢。
377 次点击
所在节点    程序员
2 条回复
yuiffy
4 小时 50 分钟前
没做过视觉和阵列的,用过阿里维护的 funasr 里面有 asr+说话人识别,通过音频声线识别的。我看飞书会议有时候能区分说话人,可能也是基于这个说话人识别能力。
ted0220
4 小时 44 分钟前
@yuiffy 是的,阿里的应该都是通过声纹特征来做聚合,之前也研究过声纹相关内容,目前开源的声纹技术对环境要求还是相对严苛,如果在嘈杂的环境几乎就失效了,而且都是后处理,无法实时验证,感觉这个方向还挺好玩

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1237873

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX