如何使用Python遍历Power BI数据集逐行判断指定字符串是否存在
问题原因
你之前的代码存在两个核心错误:
- 直接遍历
dataset时,获取的是DataFrame的列名而非行数据 dataset["randomString"]是整列的Series对象,转为字符串后是整列内容的拼接结果,只要列中存在hello就会匹配成功;同时直接给dataset["containsHello"]赋值是对整列统一赋值,因此会出现全Yes/全No的错误结果。
解决方案
Power BI查询编辑器传入的dataset是标准pandas DataFrame结构,推荐优先用更高效的pandas向量化操作实现需求,不需要手动写循环:
import pandas as pd # na=False表示空值视为不匹配 dataset['containsHello'] = dataset['randomString'].str.contains('hello', na=False).map({True: 'Yes', False: 'No'})
如果确实需要逐行遍历校验,可使用iterrows方法实现逐行操作:
import re # 先初始化新列默认值为No dataset['containsHello'] = 'No' # 逐行遍历拿到每行的索引和行内容 for idx, row in dataset.iterrows(): # 取当前行的randomString值判断 if re.search(r'hello', str(row['randomString'])): # 只给当前行的containsHello赋值为Yes dataset.loc[idx, 'containsHello'] = 'Yes'
Power BI 运行注意事项
- 脚本执行完成后,在查询编辑器弹出的数据集选择窗口中,选择
dataset作为输出结果加载即可 - 若
randomString列存在空值,str(row['randomString'])会自动转为nan字符串,不会触发匹配,符合预期逻辑
内容的提问来源于stack exchange,提问作者lakeviking
相关产品推荐
相关产品推荐

