开源语音大模型 Step-Audio 2 mini

6 天前
 hzwer

大家好,我们上了一个开源端到端语音大模型 Step-Audio 2 mini ,该模型在多个国际基准测试集上取得最佳成绩。

它将语音理解、音频推理与生成统一建模,在音频理解、语音识别、跨语种翻译、情感与副语言解析、语音对话等任务中表现突出,并率先支持语音原生的 Tool Calling 能力,可实现联网搜索等操作。

GitHub: https://github.com/stepfun-ai/Step-Audio2

Hugging Face: https://huggingface.co/stepfun-ai/Step-Audio-2-mini

817 次点击
所在节点    分享发现
4 条回复
bigtear
6 天前
开放权重就是好模型,顶🆙
byc4i
6 天前
能贴一下微信吗?微信群超 200 了不能扫码
closedevice
2 天前
赞,晚点就研究下,有相关论文么?
hzwer
2 天前
@closedevice 嗯,主页有 arxiv

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1156226

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX