You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Spark collect()后循环展示结果异常:读取文本文件时出现未知内容引发ValueError

问题根源与解决方案

首先,你遇到的PK\x03\x04...内容是ZIP文件的文件头标识,这说明你的Spark程序读取到了一个压缩文件,而非你目标的yields.txt文本文件。

核心问题:读取路径错误

你的代码中spark.sparkContext.textFile传入的是文件夹路径(data文件夹),而非具体的yields.txt文件路径:

lines = spark.sparkContext.textFile(DATA_FOLDER_PATHNAME, minPartitions = 2000, use_unicode = False)

Spark的textFile API如果传入文件夹路径,会自动读取该文件夹下所有非隐藏的文件——如果你的data文件夹里不小心混入了ZIP压缩包、编辑器备份文件(比如yields.txt~)或者其他临时文件,这些文件的内容就会被一起读入,进而引发类型转换错误。

解决方案步骤

1. 修正文件读取路径

把路径指向具体的yields.txt文件,推荐用os.path.join来拼接路径,避免手动拼接的跨平台问题和错误:

import os
# 更稳妥的路径拼接方式
DATA_FILE_PATHNAME = os.path.join(os.path.dirname(__file__), '..', 'data', 'yields.txt')
# 读取具体文件而非文件夹
lines = spark.sparkContext.textFile(DATA_FILE_PATHNAME, minPartitions = 2000, use_unicode = False)

2. 清理目标文件夹

检查data文件夹,删除所有无关文件(比如压缩包、临时文件、隐藏文件),只保留需要的yields.txt,防止Spark误读其他内容。

3. 增强代码容错性(可选)

可以给mapper函数添加校验逻辑,跳过无效行,避免单个错误行导致整个任务失败:

def mapper(line):
    line = line.strip()
    # 跳过空行
    if not line:
        return None
    fields = line.split()
    # 跳过字段数量不符合要求的行
    if len(fields) != 7:
        return None
    try:
        return Row(
            ID=int(fields[0]),
            asset_1=float(fields[1]),
            asset_2=float(fields[2]),
            asset_3=float(fields[3]),
            asset_4=float(fields[4]),
            asset_5=float(fields[5]),
            asset_6=float(fields[6])
        )
    except (ValueError, IndexError):
        # 跳过类型转换失败的行
        return None

# 过滤掉无效的None行
assets_with_yields_rdd = lines.map(mapper).filter(lambda x: x is not None)

补充说明

你本地用open读取文件时没看到内容,大概率是路径拼接错误导致没读到正确的文件——用os.path.join同样能解决这个问题,同时注意保持文件编码一致(比如用encoding='utf-8')。

内容的提问来源于stack exchange,提问作者JacobJustCoding

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.28 19:02:51