如何仅获取维基百科、维基词典页面的主文章主体HTML内容?
获取MediaWiki/Wiktionary纯净HTML的方法
一、传统URL参数方案(你当年可能用的就是这个)
你提到的不含界面元素但保留目录的HTML,最可能是用action=render参数,搭配可选参数控制目录显示:
- 基础用法:在页面路径后加上
?action=render,比如针对某个词条,URL格式为/wiki/目标词条?action=render - 保留目录:
action=render默认会保留目录结构,若遇到目录不显示的情况,可追加&disabletoc=false强制开启 - 早期曾有
printable=yes参数,但目前多数站点已用action=render替代,后者能更稳定地移除页眉、页脚、侧边栏等冗余界面元素,只保留页面核心内容
二、旧版MediaWiki API方案
如果需要更灵活的内容控制,可使用旧版API的parse模块:
GET /w/api.php?action=parse&page=目标词条&prop=text&format=json
返回的JSON数据中,parse.text.*字段即为纯净的页面HTML。若需保留目录,可追加&disabletoc=false参数:
GET /w/api.php?action=parse&page=目标词条&prop=text&format=json&disabletoc=false
三、新版REST API方案
MediaWiki的REST API提供了更简洁的内容获取方式,直接请求词条的HTML端点:
GET /rest/v1/page/html/目标词条
返回的内容仅包含页面核心HTML,默认保留目录,完全无界面冗余元素,非常适合语料处理、格式解析等场景。
如果需要直接获取纯文本内容,可请求纯文本端点:
GET /rest/v1/page/text/目标词条
内容的提问来源于stack exchange,提问作者hippietrail
相关产品推荐
相关产品推荐

