You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark中如何将DataFrame保存为指定分隔符的文本文件?

如何将DataFrame保存为以|分隔的多分区文本文件?

嘿,我来帮你搞定这个需求!你手里的DataFrame要存成以|作为字段分隔符的文本,还要自动生成part-00000、part-00001这类命名的文件,分两种常用场景给你说明:

场景1:使用PySpark(推荐分布式环境)

part-xxxxxx这种命名格式其实是Spark默认的输出文件命名,用Spark来处理最省心,步骤如下:

  • 如果你的数据是Pandas DataFrame,先转成Spark DataFrame:
    spark_df = spark.createDataFrame(your_pandas_df)
    
  • 然后调用Spark的写入API,指定分隔符为|,输出到目标目录:
    spark_df.write \
        .option("sep", "|") \
        .option("header", False)  # 要是需要保留表头就改成True
        .mode("overwrite")  # 可选:覆盖已有文件,也可以用"append"追加
        .csv("your_target_folder")
    
    执行后,目标目录里会自动生成part-00000、part-00001这类文件,还会附带一些元数据文件(比如_SUCCESS),如果不需要可以手动删除。
  • 要是想控制分区数量,可以用coalesce()或者repartition()调整,比如要生成2个分区:
    spark_df.coalesce(2).write \
        .option("sep", "|") \
        .option("header", False)
        .mode("overwrite")
        .csv("your_target_folder")
    

场景2:使用Pandas(适合单机小数据)

Pandas本身不会自动生成part-xxxxxx的命名,得自己写逻辑分割保存:

  • 先确定要分成多少个分区,然后循环分割DataFrame并逐个保存:
    import pandas as pd
    
    # 假设你的DataFrame叫df
    total_rows = len(df)
    num_partitions = 3  # 你可以根据需求修改分区数
    partition_size = total_rows // num_partitions
    
    for part_num in range(num_partitions):
        # 计算每个分区的行索引范围
        start_idx = part_num * partition_size
        # 最后一个分区要包含剩余所有行
        end_idx = start_idx + partition_size if part_num != num_partitions -1 else total_rows
        part_df = df.iloc[start_idx:end_idx]
        # 保存为指定格式的文件,sep设为|,去掉索引和表头(按需调整)
        part_df.to_csv(f"part-{str(part_num).zfill(5)}", sep="|", index=False, header=False)
    
    这里zfill(5)是把分区号补成5位数字,确保文件名格式统一(比如0变成00000,1变成00001)。

内容的提问来源于stack exchange,提问作者Sai

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 10:03:15