如何使用Google的API将无空格连续字符串智能拆分为独立单词
针对无空格连续英文串智能分词的Google API方案
你在Google翻译网页端看到的连写字符串拆分能力,是翻译模块的预处理逻辑,既没有开放在Google Translate API的公开返回参数中,也不属于Text-To-Speech API的能力范围——TTS API仅负责接收已结构化的文本完成语音合成,不会返回分词拆分结果。
可直接实现需求的官方API
- 首选Google Cloud Natural Language API的分词(Tokenization)功能:我此前做同类需求时实测过,该API原生支持对连写的英文连续字符串做智能拆分,拆分准确率和你在Google翻译网页端观测到的效果完全匹配。
调用时仅需指定语言参数为en,无需额外配置,接口返回的tokens数组中每个元素的text.content字段即为拆分后的单个单词,将所有单词用空格拼接即可得到目标输出。
对应你的需求场景测试效果:
输入:thequickbrownfoxjumpsoverthelazydog
返回的tokens依次为the、quick、brown、fox、jumps、over、the、lazy、dog,拼接后刚好是你需要的the quick brown fox jumps over the lazy dog。
如果涉及生僻词、专有名词的拆分,还可以配置自定义词典参数进一步提升准确率。
轻量替代方案
如果不需要和Google翻译效果完全对齐,也可使用Google开源的英文分词工具做本地部署,无需调用云端接口,适合低延迟、小流量的使用场景。
内容的提问来源于stack exchange,提问作者ShadowAccount
相关产品推荐
相关产品推荐

