如何筛选StackOverflow调查数据中Country列含United States的行并存入变量
实现方案(Python + Pandas 环境,最常用的结构化调查数据处理工具)
- 首先确保你已经导入pandas库,且已将StackOverflow调查数据读取为
DataFrame格式存入my_data变量 - 直接使用布尔索引完成筛选,核心代码如下:
import pandas as pd # 筛选Country列等于United States的所有行,reset_index是为了重置结果的行索引避免残留原有索引 my_result_data = my_data[my_data['Country'] == 'United States'].reset_index(drop=True)
对应你的示例数据验证
构造你的示例输入数据后执行上述筛选,得到的结果完全符合预期:
# 构造你提供的示例数据 my_data = pd.DataFrame({ 'Age1stCode': [12, 13, 15, 16, 18], 'Country': ['India', 'China', 'United States', 'England', 'United States'], 'x': ['a', 'b', 'c', 'd', 'e'] }) # 执行筛选 my_result_data = my_data[my_data['Country'] == 'United States'].reset_index(drop=True)
输出的my_result_data结构如下:
Age1stCode Country x 0 15 United States c 1 18 United States e
注意事项
如果数据中Country列存在首尾空格、大小写不一致的情况,可以先对列做预处理再筛选,避免匹配失败:
# 先去除Country列值的首尾空格,再做匹配 my_result_data = my_data[my_data['Country'].str.strip() == 'United States'].reset_index(drop=True)
内容的提问来源于stack exchange,提问作者Uday Singh Khalsa
相关产品推荐
相关产品推荐

