You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Spark读取ADLS Gen2中AVRO文件输出截断及Body字段转码问题

问题解答

1. 列内容完全展开打印方法

df.show(n, truncate=False)的用法本身是正确的,其中第二个参数truncate设为False后,Spark不会自动截断长度超过20字符的普通列内容。你调整后仅Body字段仍显示为截断的十六进制内容,是因为Body为二进制类型,Spark默认打印二进制类型时仅会输出前几位十六进制标识,和截断参数无关,属于第二个问题的解决范畴。
如果需要查看SystemProperties这类嵌套复杂类型的完整结构,也可以配合df.printSchema()输出完整字段定义,或者单独提取嵌套子字段打印。

2. 二进制Body字段转可读JSON文本

你需要先将二进制类型的Body转换为字符串类型,Spark内置函数即可实现,修改代码如下:
首先导入依赖函数:

from pyspark.sql.functions import col, decode
# 如果需要解析JSON为结构化字段,额外导入from_json
# from pyspark.sql.functions import from_json

加载数据后增加字段转换逻辑:

# 方式1:默认按UTF-8编码转换二进制为字符串,适配绝大多数场景
df = df.withColumn("Body", col("Body").cast("STRING"))

# 方式2:如果JSON用了非UTF-8编码,用decode指定对应编码即可,示例为GBK
# df = df.withColumn("Body", decode(col("Body"), "GBK"))

# 可选操作:如果需要直接把JSON解析为结构化列,可自定义schema后用from_json转换
# json_schema = "payload STRING, event_id STRING, occur_time TIMESTAMP"
# df = df.withColumn("Body", from_json(col("Body"), json_schema))

转换完成后再调用df.show(10, False)即可看到Body字段完整的可读JSON内容。

内容的提问来源于stack exchange,提问作者RRM

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 03:15:04