如何用Python提取DataFrame中特定格式字符串内的字典值?
从字符串格式的嵌套字典中提取指定值生成新列
你的ColX里的数据是字符串形式的嵌套字典,但它不是标准的Python字典格式(键未加引号),需要先处理字符串格式,再解析成字典提取目标值。下面是具体实现方案:
实现步骤
- 预处理字符串:用正则表达式给所有未加引号的键补上双引号,转换成合法的Python字典字符串。
- 解析为嵌套字典:用
ast.literal_eval(比eval更安全)把处理后的字符串转成实际的嵌套字典对象。 - 提取目标值:从嵌套字典中取出
variable1下的key2值、variable2下的key4值,生成新列。
完整代码示例
import pandas as pd import ast import re # 模拟示例DataFrame df = pd.DataFrame({ 'ColX': [ "{variable1={key:'value',key2:'value2'}, variable2={key3:'value3',key4:'value4'}}", "{variable1={key:'val1',key2:'val2'}, variable2={key3:'val3',key4:'val4'}}" ] }) # 定义处理函数:转字典+提取目标值 def extract_target_values(s): # 给未加引号的键补双引号 processed_str = re.sub(r'(\w+)(?=:)', r'"\1"', s) # 解析为嵌套字典 nested_dict = ast.literal_eval(processed_str) # 安全提取值,无对应键时返回缺失值 key2_val = nested_dict.get('variable1', {}).get('key2', pd.NA) key4_val = nested_dict.get('variable2', {}).get('key4', pd.NA) return pd.Series([key2_val, key4_val], index=['key2', 'key4']) # 应用函数生成新列 df[['key2', 'key4']] = df['ColX'].apply(extract_target_values) print(df)
关键细节说明
- 正则替换:
re.sub(r'(\w+)(?=:)', r'"\1"', s)会匹配所有紧跟冒号的字母/数字/下划线组合,自动补上双引号,把非标准格式转成合法的字典字符串。 - ast.literal_eval:专门用于解析字符串形式的Python字面量(字典、列表等),不会执行任意代码,比
eval更安全。 - get方法取值:用
dict.get()可以避免因键不存在导致的报错,无对应键时返回pd.NA(Pandas标准缺失值标记)。
内容的提问来源于stack exchange,提问作者Krzysztof Dołęgowski
相关产品推荐
相关产品推荐

