You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用正则边界匹配提取soup中script标签的labels和数据返回None如何解决

问题原因与解决方法

原代码错误点

  • 正则语法错误:单词边界标识是\b,你误写为/b,规则无法生效
  • 匹配规则完全不符合实际内容:labels: ],和你提供的script内结构完全不符,labels后是一长串数字组成的数组,不是直接闭合的方括号
  • 使用逻辑错误:BeautifulSoup的find方法传入正则匹配文本,只会筛选出符合规则的script标签,不会直接返回你需要提取的labels和数据内容,还需要二次提取

正确实现代码

import re
import json

# 第一步:筛选出包含目标图表的script标签
script_tag = soup.find("script", string=re.compile(r"new Chart.*chart-overall-mentions"))
if not script_tag:
    print("未找到目标script标签")
else:
    script_content = script_tag.string
    # 提取labels数组
    labels_res = re.search(r'labels:\s*(\[.*?\])', script_content, re.DOTALL)
    if labels_res:
        labels = json.loads(labels_res.group(1))
        print("提取到的labels:", labels)
    # 提取datasets中的对应数据数组
    data_res = re.search(r'datasets:\s*\[\s*{\s*data:\s*(\[.*?\])', script_content, re.DOTALL)
    if data_res:
        data_list = json.loads(data_res.group(1))
        print("提取到的对应数据:", data_list)

代码说明

  • 用正则匹配时加re.DOTALL(缩写为re.S)参数,确保.可以匹配换行符,避免内容换行导致匹配失败
  • 匹配到的数组字符串符合JSON格式,直接用json.loads转换为Python列表,无需手动拆分处理
  • 如果有多个datasets,可以调整正则匹配规则遍历获取所有数据数组

内容的提问来源于stack exchange,提问作者Guilherme Ely

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 12:06:00