retemlamb's recent timeline updates
retemlamb

retemlamb

V2EX member #404150, joined on 2019-04-22 18:29:00 +08:00
retemlamb's recent replies
@zeusho871 实在不好意思,前两天比较忙,没有及时回复消息,目前已经在 0.1.21 的桌面端上进行了优化,有收到你的 issue ,如果还是存在问题,麻烦提供 deamon.log/报错信息,感谢
@tangping J4105 是低功耗弱核,8G 内存装得下小模型,但算力可能带不动"实时",建议把它当离线/非实时转写用。选最小档模型(如 xasr / sensevoice 小模型)可以尝试实时,但目前我手上没有相关设备,不能保证效果
@Cado 0.1.21 的内置 MOSS 说话人分离 + 声纹识别( Voice ID ),多人录音会按人切分、登记后能标姓名,都在本地跑。会议转写方面,录好的会议文件可以直接转写;线上会议可以用"系统内录音"把通话声音录进来再转。目前确实还不支持麦克风和系统音同时录,这是已知需求,我们在评估
@sickworm 坦率地说,目前听写功能只做了热词,还没有加基于 LLM 的文字后处理,目前无法完全替代 typeless ,后续会加强这方面的内容,感谢支持
@ethusdt 太棒了,直接把 xcframework 接进自己的 App 里,这正是我们希望看到的用法!

回你的三个问题:

1. Metal 后端支持在计划中,目前 macOS 桌面端已经用上了 Metal 加速,iOS 的 xcframework 还是 CPU ,后续会加上(预计下周)
2. FireRedVAD 目前确实只在桌面端/CLI 里用了,xcframework 没有暴露。你用的能量 VAD 方案作为轻量替代是合理的,后续会把 VAD 也作为 SDK 能力开放
3. 你说得对,目前推理过程中没有接 ggml 的 abort callback ,停止时要等当前计算图跑完才能释放。这个确实该补上
@ccvip 感谢二次支持,你走过的路正好就是 OpenASR 想解决的问题。

你提的三个需求都很实在:

1. 批量转写保持目录结构——CLI 的 openasr transcribe 已经支持指定输入目录 + -o 输出目录,输出文件名跟输入一致只换扩展名(目前可以让 agents 来做)。桌面端的批量导入在做了
2. 输出格式目前支持 txt/json/srt/vtt/markdown ,说话人分离/声纹识别预计周内上线,热词目前支持(后续会考虑增增加热词配置文件)。meta 摘要还没有,跟第 3 点一起规划
3. 转写后接 LLM 做总结/润色确实是下一步方向,配置 prompt 模板自动出总结这个思路很好,之前有考虑过,目前可能排期可能会到 1-2 周后(目前仍在优化基础体验,提升模型的运行速度,接入新模型等)

商业化的建议也收到,目前暂无精力做云版本,待功能完善后,可能会出一些企业产品,感谢!
@justxwy 可能是的,因为模型都托管在 hf 上,高级设置中有“国内加速”的选项,打开后会好很多
@Kobayashi #107 感谢推荐,刚认真看了一下,确实有不少重叠。侧重点不太一样:TypeWhisper 更偏听写 + AI 工作流,通过插件组合本地和云端模型; OpenASR 更偏统一的本地推理引擎和模型生态,重点在多架构模型统一运行、长音频字幕、说话人分离和中文方言上。两者也不冲突,TypeWhisper 完全可以通过本地 API 把 OpenASR 当模型后端用
0.1.19 桌面版(内核 0.1.23 )更新了

更新日志:
- 修复启动后偶尔卡死 — 系统托盘菜单更新时存在一个死锁,已排除。特别感谢 @zealotxxxx 提供的日志分析
- GPU 内核切换失败时给出明确原因 — 例如切换到 CUDA 失败,现在会告诉你具体哪一步出了问题,日志里也能查到详情;不再只显示含糊的"本地文件错误"。
- 双显卡电脑正确识别独显 — 集显+独显并存时,现在能正确找到 NVIDIA 或 AMD 独立显卡并优先使用,不会再用错卡。
- Windows 深层路径不再报错 — 路径超出系统默认长度限制时,模型目录迁移、引擎内核安装等操作现在都能正常完成。
- 直接转写微信/Telegram 语音 — 新增 Opus 、WebM 、无损 M4A 格式支持,不用再手动转格式。
- 显存不够时自动降级到 CPU — 遇到显存不足,会自动回退用 CPU 跑完,不再整个任务直接失败。特别感谢 @tushile928 提供的日志分析
- FireRed 系列转写更快 — 引擎层面的速度优化。速度提升至前一版本 2-6 倍。 @ccvip 可以试试这个版本,速度快了很多
@aaxx2xx #97 好的,稍后我会专门优化解决断句的问题,断句确实是当前最大的痛点之一,后续会做针对字幕的专门优化工作,确保断句/换行等合理,这个场景会重点优化
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2522 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 16ms · UTC 16:01 · PVG 00:01 · LAX 09:01 · JFK 12:01
♥ Do have faith in what you're doing.