前面分享过一次,这次再过来更新下,主要是准确率相比第一次分享的版本有了比较大的提升。 这个版本我比较有信心推荐用来日常使用,特别是注重隐私,喜欢用轻量级输入法软件的可以试一试。 而且当前的架构基本上我也满意了,引入了 nn 语言模型,技术实现上跟商业输入法比也不逊色了。
具体效果改进可以看下面这个评测表格。
• 这是最终发布版 GRU 相对未启用 GRU 的同模型基线,统一按 Top-1 统计:
| 评测集 | 模式 | 句准确率:基线 → GRU | 绝对提升 | 字准确率:基线 → GRU | 绝对提升 |
|---|---|---|---|---|---|
| case.1 | 全拼 | 72.99% → 75.39% | +2.40 pp | 94.08% → 94.56% | +0.49 pp |
| case.2 | 全拼 | 38.40% → 46.75% | +8.35 pp | 83.73% → 87.07% | +3.34 pp |
| inbox | 全拼 | 71.44% → 75.57% | +4.13 pp | 93.57% → 94.78% | +1.21 pp |
| case.num.1 | T9 | 62.76% → 65.06% | +2.30 pp | 88.99% → 89.59% | +0.60 pp |
| case.num.2 | T9 | 22.57% → 29.50% | +6.93 pp | 69.27% → 74.66% | +5.40 pp |
| num.inbox | T9 | 51.44% → 57.86% | +6.42 pp | 84.14% → 86.98% | +2.84 pp |
| 六集合整体 | — | 52.34% → 57.41% | +5.07 pp | 85.47% → 87.75% | +2.28 pp |
换算成相对提升:
这次最大的收益确实集中在原来最弱的口语化集合和 T9 集合。 整体多答对了 539 句,从 5562/10627 提升至 6101/10627 。
以及,我本意是重点做 Linux ,因为我日常使用 ArchLinux ,确实觉得相比其它生态 Linux 下缺少能跟微信/豆包输入法能类似效果体验的,这个版本应该有希望 PK 一下了。再就是我重点做了 Android 版本,也是因为日常使用最多。
ArchLinux 下安装可以用 yay -S fcitx5-sime
Android 的下载可以到 Github: https://github.com/Ismantic/SimeApp
这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。
V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。
V2EX is a community of developers, designers and creative people.