You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Palantir Foundry代码工作簿中创建空数据集与最简PySpark DataFrame?

在Palantir Foundry Code Workbook中的两个PySpark操作方案

1. 使用SparkContext创建空数据集

在Foundry Code Workbook中,ctx是自动注入的上下文对象,可通过它获取SparkContext。要创建空数据集(以空DataFrame为例),需先定义Schema,再结合空RDD生成:

from pyspark.sql.types import StructType, StructField, StringType

# 获取SparkContext
sc = ctx.spark_context

# 自定义空数据集的Schema(按需调整字段和类型)
empty_schema = StructType([
    StructField("id", StringType(), nullable=True),
    StructField("value", StringType(), nullable=True)
])

# 基于空RDD创建空DataFrame
empty_dataframe = ctx.spark_session.createDataFrame(sc.emptyRDD(), schema=empty_schema)

如果不需要指定Schema(不推荐,后续操作易出类型问题),也可以直接创建无结构的空DataFrame:

empty_dataframe = ctx.spark_session.createDataFrame([], schema=StructType([]))

2. 创建最简PySpark DataFrame

你提供的代码在Foundry Code Workbook中可直接运行,ctx.spark_session是Workbook内置的SparkSession实例:

# 一行一列的最简DataFrame
my_df = ctx.spark_session.createDataFrame([('1',)], ["a"])

代码说明

  • [('1',)]:包含单个元组的列表,代表一行数据,元组内的元素对应一列值
  • ["a"]:指定DataFrame的列名

若需要明确指定列的数据类型,可结合Schema实现:

from pyspark.sql.types import StructType, StructField, StringType

simple_schema = StructType([StructField("a", StringType(), nullable=True)])
my_df = ctx.spark_session.createDataFrame([('1',)], schema=simple_schema)

内容的提问来源于stack exchange,提问作者Skat

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.21 16:48:24