如何通过Wikipedia API获取可在iOS应用使用的纯净页面文本摘要
结论
目前Wikipedia API没有自带参数可以直接过滤extracts返回结果里的这类冗余内容,你需要自行做内容清洗处理。
具体说明
- 你当前调用的接口中
prop=extracts的实现逻辑是对原始维基页面HTML做轻量化解析,explaintext参数仅负责移除所有HTML标签,不会主动识别并删除音频标注、引用标记这类非核心文本。 - 针对你提到的
(listen)这类常见冗余内容,可以直接通过简单的正则匹配规则完成清理,常见的可清理内容包括:- 音频播放标记:匹配
(listen)等固定格式的标注,替换为空即可,注意同步清理前后多余的空格避免残留空白。 - 引用标记:如果后续获取更长的词条内容,可能出现
[1]、[2]这类上标引用标识,同样可以通过匹配方括号加数字的规则批量移除。 - 发音描述内容:如果不需要展示词条的音标、发音说明,可以写规则匹配整段发音描述块统一移除。
- 音频播放标记:匹配
- 如果对内容自定义程度要求更高,也可以调整接口参数请求原始wikitext格式的内容,自行解析提取需要的段落,灵活度会更高。
内容的提问来源于stack exchange,提问作者Georg
相关产品推荐
相关产品推荐

