You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用petastorm加载Spark DataFrame时遇‘无匹配字段’错误

问题:使用Petastorm 0.12加载Spark DataFrame时触发“No fields matching the criteria 'None' were found in the dataset”错误

我按照Petastorm Spark Converter TensorFlow相关教程,通过Petastorm 0.12加载Spark DataFrame,核心代码如下。标题中的错误在with语句中触发,但直接执行train_context_manager = converter_train.make_tf_dataset(BATCH_SIZE)创建TFDatasetContextManager时不会出现该问题。

from petastorm import TransformSpec
from petastorm.spark import make_spark_converter

spark.conf.set(SparkDatasetConverter.PARENT_CACHE_DIR_URL_CONF, "file:///dbfs/tmp/petastorm/cache")

converter_train = make_spark_converter(DF_TRAIN)
with converter_train.make_tf_dataset(BATCH_SIZE) as X_train:
  pass

数据集肯定不为空,我还尝试显式使用TransformSpec选择目标字段:

with converter_train.make_tf_dataset(
    BATCH_SIZE,
    transform_spec=TransformSpec(selected_fields=[TRAIN_COL])
) as X_train:

另外,converter_train.make_torch_dataloader也出现相同问题。

内容的提问来源于stack exchange,提问作者ascripter

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.23 03:33:12