You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于列内容为DataFrame动态分配表头并优化Python代码风格

问题解决方案

一、动态识别并处理目标列

针对CSV列数不固定的情况,我们可以通过扫描列名特征来动态定位目标列,重命名后保留所需列,代码实现如下:

import pandas as pd
import re

def process_currency_csv(file_path):
    # 读取CSV,保留原始表头
    df = pd.read_csv(file_path, header=0)
    original_cols = df.columns.tolist()
    
    # 匹配含"Curncy"的列(作为IsoCode来源)
    curncy_cols = [col for col in original_cols if 'Curncy' in col]
    # 匹配以".+数字"结尾的列(作为ConversionRate来源,正则精准匹配格式)
    conversion_cols = [col for col in original_cols if re.search(r'\.\d+$', col)]
    
    # 校验列的有效性(可根据实际需求调整多列处理逻辑)
    if not curncy_cols or not conversion_cols:
        raise ValueError("未找到符合特征的Curncy列或ConversionRate列")
    if len(curncy_cols) > 1 or len(conversion_cols) > 1:
        raise ValueError("找到多个符合特征的目标列,请检查CSV格式")
    
    # 重命名列并仅保留目标列
    df = df.rename(columns={curncy_cols[0]: 'IsoCode', conversion_cols[0]: 'ConversionRate'})
    df = df[['IsoCode', 'ConversionRate']]
    
    return df

逻辑说明

  • 不预设列数和表头,完全基于列名特征识别目标列
  • 可根据实际CSV的列名格式调整匹配规则(比如如果".数字"出现在列名中间,修改正则表达式即可)
  • 加入校验逻辑,避免因列不唯一或缺失导致的错误

二、关于PEP8规范:建议将函数调用放入main函数

完全符合PEP8规范的做法是把脚本的执行代码放在if __name__ == '__main__':代码块中,好处如下:

  • 当脚本被作为模块导入时,不会自动执行调用代码,只保留函数供其他模块复用
  • 让代码结构更清晰,明确区分函数定义部分和执行部分

调整后的完整代码示例:

import pandas as pd
import re

def process_currency_csv(file_path):
    df = pd.read_csv(file_path, header=0)
    original_cols = df.columns.tolist()
    
    curncy_cols = [col for col in original_cols if 'Curncy' in col]
    conversion_cols = [col for col in original_cols if re.search(r'\.\d+$', col)]
    
    if not curncy_cols or not conversion_cols:
        raise ValueError("未找到符合特征的Curncy列或ConversionRate列")
    if len(curncy_cols) > 1 or len(conversion_cols) > 1:
        raise ValueError("找到多个符合特征的目标列,请检查CSV格式")
    
    df = df.rename(columns={curncy_cols[0]: 'IsoCode', conversion_cols[0]: 'ConversionRate'})
    df = df[['IsoCode', 'ConversionRate']]
    
    return df

if __name__ == '__main__':
    # 替换为你的CSV文件路径
    result_df = process_currency_csv('currency_data.csv')
    print(result_df.head())

样本数据测试

假设输入的CSV样本为:

Date,Product,Curncy,Amount.1,Region,Price,Category
2024-01-01,A,USD,1.0,NA,100,Electronics
2024-01-02,B,EUR,0.92,EU,200,Clothing
2024-01-03,C,GBP,0.79,UK,150,Home

执行后输出的DataFrame为:

IsoCode  ConversionRate
0     USD             1.00
1     EUR             0.92
2     GBP             0.79

内容的提问来源于stack exchange,提问作者joebob

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.22 00:15:04