You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何通过Wikipedia API获取可在iOS应用使用的纯净页面文本摘要

结论

目前Wikipedia API没有自带参数可以直接过滤extracts返回结果里的这类冗余内容,你需要自行做内容清洗处理。

具体说明

  • 你当前调用的接口中prop=extracts的实现逻辑是对原始维基页面HTML做轻量化解析,explaintext参数仅负责移除所有HTML标签,不会主动识别并删除音频标注、引用标记这类非核心文本。
  • 针对你提到的(listen)这类常见冗余内容,可以直接通过简单的正则匹配规则完成清理,常见的可清理内容包括:
    • 音频播放标记:匹配(listen)等固定格式的标注,替换为空即可,注意同步清理前后多余的空格避免残留空白。
    • 引用标记:如果后续获取更长的词条内容,可能出现[1]、[2]这类上标引用标识,同样可以通过匹配方括号加数字的规则批量移除。
    • 发音描述内容:如果不需要展示词条的音标、发音说明,可以写规则匹配整段发音描述块统一移除。
  • 如果对内容自定义程度要求更高,也可以调整接口参数请求原始wikitext格式的内容,自行解析提取需要的段落,灵活度会更高。

内容的提问来源于stack exchange,提问作者Georg

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 08:06:02