如何通过pandas高效生成判断字典列是否含指定键的布尔值列
错误原因
你之前的写法报错核心原因是:'KEYWORD' in df['DICTIONARY'] 是判断字符串KEYWORD是否存在于DICTIONARY Series的顶层元素列表中,仅返回单个布尔值,并不是你需要的逐行判断得到的、和DataFrame行数等长的布尔序列,用单个布尔值作为loc的行索引自然会触发报错。
你写的生成器表达式返回的是生成器对象,无法直接被pandas识别为行索引条件,需要转换才能使用。
正确实现
方法1:用apply逐行判断(最简洁)
直接对DICTIONARY列调用apply方法逐行检查,布尔结果转整数直接得到二值的CONDITION列:
KEYWORD = "你的预定义关键字" df['CONDITION'] = df['DICTIONARY'].apply(lambda x: KEYWORD in x).astype(int)
如果要严格检查字典的键(避免和字典的元素值混淆),也可以写成:
df['CONDITION'] = df['DICTIONARY'].apply(lambda x: KEYWORD in x.keys()).astype(int)
方法2:用列表推导式(性能更优,适合大数据量)
列表推导式的执行效率比apply更高,数据量较大时更推荐:
KEYWORD = "你的预定义关键字" df['CONDITION'] = [1 if KEYWORD in x else 0 for x in df['DICTIONARY']]
内容的提问来源于stack exchange,提问作者oliver.c
相关产品推荐
相关产品推荐

