为什么Pandas DataFrame检查值存在的两种方法中第二种不生效
原因解析
两种写法生效逻辑的差异源于in运算符在不同Pandas对象上的行为不同:
'Ankit' in df.values能生效的原因:df.values返回整个DataFrame所有元素组成的二维Numpy数组,in作用于Numpy数组时会遍历所有元素判断是否存在匹配值,所以能正确识别到Ankit。'Ankit' in df['Name']不生效的原因:df['Name']返回的是Pandas的Series对象,in运算符作用于Series时默认是检查目标值是否存在于Series的索引中,而非检查Series的元素值。你当前案例中df['Name']的索引是['a','b','c','d','e','f'],自然找不到'Ankit',所以第二个判断会进入else分支输出not found。
你可以用一个简单测试验证这个逻辑:执行'a' in df['Name']会返回True,因为a是该Series的第一个索引值。
正确的单列值存在性检查写法
有几种常用的可靠写法:
- 写法1:显式访问Series的存储值判断
if 'Ankit' in df['Name'].values: - 写法2:使用Pandas原生的
isin方法(更推荐,大数据量下性能更优,支持多值同时检查)if df['Name'].isin(['Ankit']).any(): - 写法3:Pandas 1.4+版本支持直接访问Series数组
if 'Ankit' in df['Name'].array:
内容的提问来源于stack exchange,提问作者Hitesh Khandelwal
相关产品推荐
相关产品推荐

