You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用BeautifulSoup提取HTML代码中markup="content"对应的文本内容

定位markup="content"元素的方法

你可以通过BeautifulSoup的attrs参数筛选自定义属性,精准匹配目标元素,示例代码如下:

# 方式1:直接全局定位markup属性为content的元素
target_ele = soup.find(attrs={"markup": "content"})

# 方式2:如果确定目标元素在你找到的父div范围内,可缩小范围查找,避免匹配到其他位置的同属性元素
parent_div = soup.find("div", class_="break-word news_main")
target_ele = parent_div.find(attrs={"markup": "content"})

# 提取元素内的文本内容
content_text = target_ele.text.strip()

关于markup属性的说明

  • markup不是HTML的内置标准属性,和class、id这类所有HTML元素通用的原生全局属性不同
  • 它是当前网站开发者自行定义的自定义属性,作用和常见的data-*自定义属性类似,仅用于当前站点给元素打标识、存储自定义数据,没有全行业通用的固定含义,不同站点的markup属性作用可能完全不同

内容的提问来源于stack exchange,提问作者micastik

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 03:57:02