You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何仅获取维基百科、维基词典页面的主文章主体HTML内容?

获取MediaWiki/Wiktionary纯净HTML的方法

一、传统URL参数方案(你当年可能用的就是这个)

你提到的不含界面元素但保留目录的HTML,最可能是用action=render参数,搭配可选参数控制目录显示:

  • 基础用法:在页面路径后加上?action=render,比如针对某个词条,URL格式为/wiki/目标词条?action=render
  • 保留目录:action=render默认会保留目录结构,若遇到目录不显示的情况,可追加&disabletoc=false强制开启
  • 早期曾有printable=yes参数,但目前多数站点已用action=render替代,后者能更稳定地移除页眉、页脚、侧边栏等冗余界面元素,只保留页面核心内容

二、旧版MediaWiki API方案

如果需要更灵活的内容控制,可使用旧版API的parse模块:

GET /w/api.php?action=parse&page=目标词条&prop=text&format=json

返回的JSON数据中,parse.text.*字段即为纯净的页面HTML。若需保留目录,可追加&disabletoc=false参数:

GET /w/api.php?action=parse&page=目标词条&prop=text&format=json&disabletoc=false

三、新版REST API方案

MediaWiki的REST API提供了更简洁的内容获取方式,直接请求词条的HTML端点:

GET /rest/v1/page/html/目标词条

返回的内容仅包含页面核心HTML,默认保留目录,完全无界面冗余元素,非常适合语料处理、格式解析等场景。

如果需要直接获取纯文本内容,可请求纯文本端点:

GET /rest/v1/page/text/目标词条

内容的提问来源于stack exchange,提问作者hippietrail

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.27 18:57:55