PennyScribe 内测: Agent 友好的语音转写 API [送 100 小时码]

7 小时 14 分钟前
 yedaxia

大家好,我是叶大侠。

这是我第一次尝试完全依靠 AI 编程工具( Codex ),从零到一开发一款产品。整个过程中,我自己一行代码都没有写。

转写模型使用的是 Qwen ASR ,GPU 算力来自 Vast.aiVast.ai 的消费级 GPU 虽然价格便宜,但想把它做成稳定、可靠的在线服务,并不是一件容易的事。

为了兼顾成本与服务稳定性,我借助 Codex 放弃了官方的 Serverless 方案,从零构建了一套 GPU 实例调度系统。

这个过程中踩了很多坑,但非常值得。如果没有 Codex 的帮助,我估计至少需要 3 个月才能把这件事做好,而现在只用了不到两周——当然,对很多大佬来说,这个速度可能依然不算快。

接下来,郑重向大家介绍一下我的新产品:PennyScribe

PennyScribe 是一款面向 AI Agent 和开发者的音频转写服务,可以将音频、视频中的语音快速转换为结构化文本,再交给 Agent 完成内容总结、知识提取、信息检索和自动化处理。

如果你曾经让 ChatGPT 或 Claude Code 处理音频转写任务,可能会发现它们经常需要先下载并运行 Whisper 。这不仅会让处理时间变得漫长,还可能因为设备性能不足或网络问题而中断。

这时,一个对 Agent 友好的云端语音转写服务就能派上用场。尤其是在需要批量处理大量音频时,云端多台 GPU 并行处理的优势会更加明显。

在测试过程中,我发现 Qwen ASR 的文本转写效果非常出色,但 Qwen ForcedAligner 生成时间戳的效果并不理想。去除背景音乐和环境噪声后会有所改善,但这也会增加处理流程的复杂度和计算成本。

因此,PennyScribe 现阶段决定先专注于一件事:把语音转写成高质量的纯文本。

虽然它暂时不适合视频字幕制作,但如果你需要将访谈、播客、通话或课程录音转换成干净的多语言文本,再交给应用程序或 AI 工作流继续处理,那么 PennyScribe 会是一个非常合适的搭档。

PennyScribe 提供 API 和 MCP ,对 AI Agent 原生友好。

这也是我对未来新产品形态的一点思考:产品不仅要方便人使用,也应该让 AI 能够轻松发现、理解和调用,而不是把所有能力都封闭在 UI 里。

目前定价档最低$0.002 / 分钟,不过 GPU 调度效率和转写吞吐量仍有很大的优化空间。接下来我会继续优化架构、降低成本,并进一步压缩最终价格。

当然,我也不确定这件事是否还有足够大的商业空间——毕竟市面上已经有很多成熟的语音转写产品。但我依然想把它做出来,看看一个真正面向 AI Agent 设计的转写服务,能够走多远。

如果你有兴趣参与内测,可以留下注册邮箱,或者前往 X 私信联系我。我会让 Codex 为大家发放 100 小时免费转写额度的兑换码。

如果不希望邮箱被直接展示,可以先使用 Base64 编码后再留言。

246 次点击
所在节点    分享创造
3 条回复
do1ng
7 小时 8 分钟前
d29yZEBvdHBlYm94LmNvbQ==
谢谢老板
hellodigua
4 小时 58 分钟前
hello@digua.me

谢谢老板
hellodigua
4 小时 57 分钟前
最近一直有这个痛点,没想到真看到这种工具了

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1231005

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX