You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python从DataFrame的Occupation列提取地产类值生成新DataFrame问题

问题原因与解决方法

你当前代码返回空DataFrame最常见的原因是Occupation列的目标字符串前后存在未清理的空白字符,或存在你没注意到的隐藏字符,用精确匹配自然无法命中。可以用以下两种方案解决:

方案1:清理空白后精确匹配(仅匹配你指定的3种职业,不会误命中其他包含realestate的条目)

用str.strip()先去除字符串前后的所有空白,再用isin简化多条件匹配,比你原写法的多|判断更易维护:

target_occu = ['RealEstate', 'REALESTATE', 'RealEstateDeveloper']
# str.strip() 去除前后空白,过滤空值避免报错
dfRealEstate = df[df.Occupation.str.strip().isin(target_occu) & df.Occupation.notna()]

方案2:模糊匹配(所有包含realestate的条目都命中,容错性更高)

如果不需要严格匹配指定的3种写法,只要内容包含realestate(不区分大小写)就提取,可以用str.contains实现:

# case=False 忽略大小写,na=False 空值直接返回False不报错
dfRealEstate = df[df.Occupation.str.contains('realestate', case=False, na=False)]

排查辅助

如果以上方法还没得到预期结果,可以先运行以下代码查看列内的实际值:

# repr会显示字符串的原始形式,方便发现空格、转义字符等隐藏内容
print(df.Occupation.apply(repr).unique())

内容的提问来源于stack exchange,提问作者Adam

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 19:36:03