You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Pandas中实现类Vlookup并计算文件夹内CSV文件数值差值

实现相邻日期CSV文件的Seller匹配与Value差值计算

需求概述

文件夹内存在多个带日期后缀的CSV文件(例如_183kOutput_data_2023-04-18.csv),每个文件包含Seller和Value列。需要实现类Vlookup的匹配逻辑,将相邻日期的文件按Seller匹配,计算Value的差值,最终输出包含匹配列及差值的结果表。

解决方案(Python实现)

使用pandas处理CSV文件的匹配与计算,步骤如下:

1. 导入依赖库

import pandas as pd
import os
from datetime import datetime

2. 获取并排序CSV文件

首先遍历文件夹,筛选出目标CSV文件并提取日期信息,再按日期排序:

# 替换为你的CSV文件所在文件夹路径
folder_path = "./csv_files"

# 收集符合格式的CSV文件及对应日期
csv_file_list = []
for filename in os.listdir(folder_path):
    if filename.endswith(".csv") and "_data_" in filename:
        # 从文件名中提取日期字符串
        date_part = filename.split("_data_")[-1].replace(".csv", "")
        try:
            # 转换为datetime对象用于排序
            file_date = datetime.strptime(date_part, "%Y-%m-%d")
            csv_file_list.append((file_date, filename))
        except ValueError:
            # 跳过日期格式不符合的文件
            continue

# 按日期升序排列文件
csv_file_list.sort(key=lambda x: x[0])

3. 处理相邻文件对,计算差值

遍历排序后的文件,两两匹配并计算Value差值:

# 存储所有计算结果
results = []

# 遍历每一组相邻日期的文件
for idx in range(len(csv_file_list) - 1):
    curr_date, curr_filename = csv_file_list[idx]
    next_date, next_filename = csv_file_list[idx + 1]
    
    # 读取两个文件的Seller和Value列
    df_curr = pd.read_csv(os.path.join(folder_path, curr_filename))[["Seller", "Value"]]
    df_next = pd.read_csv(os.path.join(folder_path, next_filename))[["Seller", "Value"]]
    
    # 按Seller匹配(outer join保留所有出现过的Seller,inner join仅保留两边都有的)
    merged_df = pd.merge(
        df_curr, 
        df_next, 
        on="Seller", 
        how="outer", 
        suffixes=(f"_{curr_date.strftime('%Y-%m-%d')}", f"_{next_date.strftime('%Y-%m-%d')}")
    )
    
    # 计算Value差值(后日期 - 前日期),空值填充为0
    diff_col_name = f"Value_Diff_{next_date.strftime('%Y-%m-%d')}_vs_{curr_date.strftime('%Y-%m-%d')}"
    merged_df[diff_col_name] = merged_df[f"Value_{next_date.strftime('%Y-%m-%d')}"].fillna(0) - merged_df[f"Value_{curr_date.strftime('%Y-%m-%d')}"].fillna(0)
    
    results.append(merged_df)

# 合并所有结果(可根据需求选择纵向拼接或按Seller横向合并)
final_result = pd.concat(results, ignore_index=True)

# 输出结果到CSV文件
final_result.to_csv("./value_difference_results.csv", index=False)

关键参数说明

  • 匹配方式:代码中使用how="outer",会保留所有在任意文件中出现的Seller;如果只需要保留在相邻两个文件中都存在的Seller,改为how="inner"即可。
  • 空值处理:空值会被填充为0参与计算,若需其他处理(例如保留空值),可移除.fillna(0)。
  • 差值方向:当前逻辑是后日期Value - 前日期Value,若需要反向计算,调换两个Value列的顺序即可。

内容的提问来源于stack exchange,提问作者harry

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.22 21:02:27