如何基于pandas DataFrame B的数据筛选DataFrame A的行?
解决方案:筛选出席宾客的联系方式
没问题,这事儿好办!你需要基于guest_list中标记为出席的宾客,从CONTACTS表中提取对应的联系方式,下面是两种实用的实现方法:
方法一:使用merge合并后筛选
这种方法适合需要同时保留宾客出席状态信息的场景,步骤清晰直观:
import pandas as pd # 初始化数据 C = {'name': ['Alice', 'Alice', 'Bob', 'Charlie'], 'phone': ['007', '1764', '1317210', '314159']} CONTACTS = pd.DataFrame(data=C) answer = {'guest_name': ['Alice', 'Bob', 'Charlie'], 'attending': [True, False, True]} guest_list = pd.DataFrame(data=answer) # 合并两个表,按姓名关联 merged_df = pd.merge(CONTACTS, guest_list, left_on='name', right_on='guest_name', how='inner') # 筛选出席状态为True的行,提取姓名和联系方式 attending_contacts = merged_df[merged_df['attending'] == True][['name', 'phone']] print(attending_contacts)
运行结果:
name phone 0 Alice 007 1 Alice 1764 2 Charlie 314159
方法二:使用isin直接筛选
如果只需要联系方式,不需要保留出席状态,这种方法更简洁:
# 先从guest_list中提取所有出席的宾客姓名 attending_guests = guest_list[guest_list['attending'] == True]['guest_name'].tolist() # 在CONTACTS中筛选姓名属于出席列表的行 attending_contacts = CONTACTS[CONTACTS['name'].isin(attending_guests)] print(attending_contacts)
这个方法会得到和上面完全一致的结果,代码更简短,适合只需要提取联系方式的场景。
小提示
- 因为
CONTACTS表中有两个Alice的条目,两种方法都会保留这两个联系方式,正好满足你联系所有出席宾客的需求(包括同一人有多个联系方式的情况)。 - 如果后续担心姓名重复的问题,可以考虑添加更多关联条件(比如邮箱),但根据你提供的数据,用姓名关联就足够啦。
内容的提问来源于stack exchange,提问作者ebosi
相关产品推荐
相关产品推荐

