如何将DataFrame含特定字符串的单元格归到对应列?(Python Colab)
解决方案
方法一:逐行匹配提取(适合小数据集)
先定义目标交通方式列表,遍历每个方式后在拆分出的6列中查找对应内容,存入新增列:
import pandas as pd # 定义需要匹配的交通方式 transport_modes = ['Motorbike', 'Car', 'Bus', 'Train', 'Tram', 'Taxi'] # 遍历每个交通方式,提取对应内容到新增列 for mode in transport_modes: Users[f'{mode}1'] = Users[transport_modes].apply( lambda row: row[row.str.contains(mode, na=False)].iloc[0] if any(row.str.contains(mode, na=False)) else None, axis=1 )
方法二:长格式转换提取(高效适配大数据集)
通过melt将宽格式转长格式,匹配后再转回宽格式,避免逐行循环的性能损耗:
# 将拆分后的6列转为长格式 melted_df = Users.melt( id_vars=Users.columns.difference(transport_modes), value_vars=transport_modes, var_name='temp_col', value_name='transport_content' ) # 从内容中提取对应的交通方式关键词 melted_df['matched_mode'] = melted_df['transport_content'].str.extract(f"({'|'.join(transport_modes)})", expand=False) # 转回宽格式并添加后缀,得到各交通方式的对应内容 pivoted_df = melted_df.pivot( index=melted_df.index, columns='matched_mode', values='transport_content' ).add_suffix('1') # 合并回原DataFrame Users = Users.join(pivoted_df)
说明
- 两种方法都基于「每行各交通方式最多出现一次」的前提,能精准提取对应内容,不会出现冲突覆盖问题。
- 新增的
Motorbike1、Car1等列会保留原数据中对应交通方式的完整内容(比如Motorbike: 30km),原拆分的6列数据不会被修改。
内容的提问来源于stack exchange,提问作者Lily101
相关产品推荐
相关产品推荐

