You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将DataFrame含特定字符串的单元格归到对应列?(Python Colab)

解决方案

方法一:逐行匹配提取(适合小数据集)

先定义目标交通方式列表,遍历每个方式后在拆分出的6列中查找对应内容,存入新增列:

import pandas as pd

# 定义需要匹配的交通方式
transport_modes = ['Motorbike', 'Car', 'Bus', 'Train', 'Tram', 'Taxi']

# 遍历每个交通方式,提取对应内容到新增列
for mode in transport_modes:
    Users[f'{mode}1'] = Users[transport_modes].apply(
        lambda row: row[row.str.contains(mode, na=False)].iloc[0] if any(row.str.contains(mode, na=False)) else None,
        axis=1
    )

方法二:长格式转换提取(高效适配大数据集)

通过melt将宽格式转长格式,匹配后再转回宽格式,避免逐行循环的性能损耗:

# 将拆分后的6列转为长格式
melted_df = Users.melt(
    id_vars=Users.columns.difference(transport_modes),
    value_vars=transport_modes,
    var_name='temp_col',
    value_name='transport_content'
)

# 从内容中提取对应的交通方式关键词
melted_df['matched_mode'] = melted_df['transport_content'].str.extract(f"({'|'.join(transport_modes)})", expand=False)

# 转回宽格式并添加后缀,得到各交通方式的对应内容
pivoted_df = melted_df.pivot(
    index=melted_df.index,
    columns='matched_mode',
    values='transport_content'
).add_suffix('1')

# 合并回原DataFrame
Users = Users.join(pivoted_df)

说明

  • 两种方法都基于「每行各交通方式最多出现一次」的前提,能精准提取对应内容,不会出现冲突覆盖问题。
  • 新增的Motorbike1、Car1等列会保留原数据中对应交通方式的完整内容(比如Motorbike: 30km),原拆分的6列数据不会被修改。

内容的提问来源于stack exchange,提问作者Lily101

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 20:50:29