借助语音大模型,实现 Linux 下的语音输入,邀请 Linux 桌面用户试试

4 小时 20 分钟前
 ko20

起因是昨天下午看到 IT 之家这个新闻:

识别、合成、实时交互全球第一,Qwen-Audio-3.0 系列语音模型上线阿里千问 AI 平台 https://www.ithome.com/0/990/679.htm

于是我搞了一套适用于大部分 linux 发行版和桌面环境的流程。平台送了 36000s (有效期 3 个月),到期后的话,我看了一下价格是每秒 0.00022 元

代码开源在 这里

截图如下,邀请用 linux 桌面的朋友们来试试。有用的话留个⭐呀。这套 flow 个人感觉在 linux 桌面环境很轻量,以后更换模型也很简单,稍微适配一下就可以了。

329 次点击
所在节点    Linux
5 条回复
ko20
4 小时 18 分钟前
效果还是不错的,对于冒号,顿号、文字中夹杂着 APP 、10000 这种字母和数字,识别都还 OK
enpitsulin
4 小时 0 分钟前
回去试试好不好使
ko20
3 小时 41 分钟前
@enpitsulin #2 谢谢欢迎反馈
ktyang
1 小时 0 分钟前
唉 可惜你搞出来的有点晚了 已经用别的产品了
ko20
24 分钟前
@ktyang #4 也可以再用用这个,哈哈

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1235328

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX