You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python提取DataFrame中特定格式字符串内的字典值?

从字符串格式的嵌套字典中提取指定值生成新列

你的ColX里的数据是字符串形式的嵌套字典,但它不是标准的Python字典格式(键未加引号),需要先处理字符串格式,再解析成字典提取目标值。下面是具体实现方案:

实现步骤

  1. 预处理字符串:用正则表达式给所有未加引号的键补上双引号,转换成合法的Python字典字符串。
  2. 解析为嵌套字典:用ast.literal_eval(比eval更安全)把处理后的字符串转成实际的嵌套字典对象。
  3. 提取目标值:从嵌套字典中取出variable1下的key2值、variable2下的key4值,生成新列。

完整代码示例

import pandas as pd
import ast
import re

# 模拟示例DataFrame
df = pd.DataFrame({
    'ColX': [
        "{variable1={key:'value',key2:'value2'}, variable2={key3:'value3',key4:'value4'}}",
        "{variable1={key:'val1',key2:'val2'}, variable2={key3:'val3',key4:'val4'}}"
    ]
})

# 定义处理函数:转字典+提取目标值
def extract_target_values(s):
    # 给未加引号的键补双引号
    processed_str = re.sub(r'(\w+)(?=:)', r'"\1"', s)
    # 解析为嵌套字典
    nested_dict = ast.literal_eval(processed_str)
    # 安全提取值,无对应键时返回缺失值
    key2_val = nested_dict.get('variable1', {}).get('key2', pd.NA)
    key4_val = nested_dict.get('variable2', {}).get('key4', pd.NA)
    return pd.Series([key2_val, key4_val], index=['key2', 'key4'])

# 应用函数生成新列
df[['key2', 'key4']] = df['ColX'].apply(extract_target_values)

print(df)

关键细节说明

  • 正则替换:re.sub(r'(\w+)(?=:)', r'"\1"', s) 会匹配所有紧跟冒号的字母/数字/下划线组合,自动补上双引号,把非标准格式转成合法的字典字符串。
  • ast.literal_eval:专门用于解析字符串形式的Python字面量(字典、列表等),不会执行任意代码,比eval更安全。
  • get方法取值:用dict.get()可以避免因键不存在导致的报错,无对应键时返回pd.NA(Pandas标准缺失值标记)。

内容的提问来源于stack exchange,提问作者Krzysztof Dołęgowski

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.16 06:40:35