开源一个统计语言模型驱动的中文输入法 Sime,支持 Linux / Android / macOS
Hi,大家好:完全自研的中文输入法「是语输入法引擎 Sime 」,过来分享一下。
核心是 C++ 引擎 + 自训语言模型(百亿字语料),整句解码。几个特点:
全拼 / 简拼 / T9 九宫格,支持任意混输:h'n'w's → 湖南卫视,shanxi9426 → 陕西西安,T9 还能中英混输(7464486474663 → 苹果 iPhone )
上下文联想、繁简转换、表情符号
完全本地运行,输入和剪贴板内容不上传、不收集、不统计
Apache-2.0 ,连训练 pipeline 一起开源,可以拿自己的语料训模型
目前支持 Linux ( fcitx5 )、Android 、macOS ,iOS 在计划中。
仓库: https://github.com/Ismantic/Sime
下载: https://github.com/Ismantic/Sime/releases/latest
还在持续开发中,欢迎试用和拍砖,遇到问题提 issue 就行。
非常期待大家提出意见,任何反馈对我来说都是很宝贵的,也期望能多些 Star ,能让我继续改进下去,谢谢。 其实这个项目很适合对中文输入法感兴趣的人学习,自认为这个项目包含了全部训练和推理的输入法实现细节。 没有 win 吗 @dddedd 其实可以搞,引擎是统一的,用 Cc/Codex 实现个前端也不难。
页:
[1]