开源语音大模型 Step-Audio 2 mini

V2EX = way to explore

V2EX 是一个关于分享和探索的地方

现在注册

已注册用户请登录

这是一个创建于 48 天前的主题，其中的信息可能已经有所发展或是发生改变。

大家好，我们上了一个开源端到端语音大模型 Step-Audio 2 mini ，该模型在多个国际基准测试集上取得最佳成绩。

它将语音理解、音频推理与生成统一建模，在音频理解、语音识别、跨语种翻译、情感与副语言解析、语音对话等任务中表现突出，并率先支持语音原生的 Tool Calling 能力，可实现联网搜索等操作。

4 条回复 • 2025-09-05 16:50:06 +08:00

bigtear

48 天前

开放权重就是好模型，顶🆙

byc4i

47 天前

能贴一下微信吗？微信群超 200 了不能扫码

closedevice

44 天前

赞，晚点就研究下，有相关论文么？

hzwer

43 天前

@closedevice 嗯，主页有 arxiv