如何使用BeautifulSoup提取HTML代码中markup="content"对应的文本内容
定位markup="content"元素的方法
你可以通过BeautifulSoup的attrs参数筛选自定义属性,精准匹配目标元素,示例代码如下:
# 方式1:直接全局定位markup属性为content的元素 target_ele = soup.find(attrs={"markup": "content"}) # 方式2:如果确定目标元素在你找到的父div范围内,可缩小范围查找,避免匹配到其他位置的同属性元素 parent_div = soup.find("div", class_="break-word news_main") target_ele = parent_div.find(attrs={"markup": "content"}) # 提取元素内的文本内容 content_text = target_ele.text.strip()
关于markup属性的说明
markup不是HTML的内置标准属性,和class、id这类所有HTML元素通用的原生全局属性不同- 它是当前网站开发者自行定义的自定义属性,作用和常见的
data-*自定义属性类似,仅用于当前站点给元素打标识、存储自定义数据,没有全行业通用的固定含义,不同站点的markup属性作用可能完全不同
内容的提问来源于stack exchange,提问作者micastik
相关产品推荐
相关产品推荐

