You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用DataFrame列表列初始化Keras的StringLookup层

解决方案

报错原因

  • 第一次报错:df.col 每个元素都是Python列表对象,存储该列的Series转为NumPy数组后为object类型,TensorFlow没有对应支持的张量类型,无法直接转换输入到adapt方法
  • 第二次报错:itertools.chain(*df.col) 返回的是迭代器对象,adapt方法期望输入的是一维数组类结构,迭代器逐个吐出的字符串没有shape属性,触发属性错误

正确实现步骤

步骤1:展平列表列为一维字符串序列

将所有子列表中的字符串拼接为一个一维的列表/数组即可,提供两种常用实现:

# 方法1:使用pandas explode拆分行,适合数据量较大的场景
all_strings = df.explode('col')['col'].dropna().tolist()

# 方法2:直接拼接所有子列表,适合中小数据集
all_strings = sum(df.col.tolist(), [])

步骤2:传入StringLookup层完成适配

lookup_layer = tf.keras.layers.StringLookup(max_tokens=335)
lookup_layer.adapt(all_strings)

可选:整列数据转换方案

如果后续需要对整个col列的列表数据做批量编码,可以用不规则张量(RaggedTensor)处理变长列表:

# 将整列列表转为不规则张量
ragged_col = tf.ragged.constant(df.col.tolist(), dtype=tf.string)
# 批量编码,输出同样为不规则张量,每个元素对应原列表中字符串的索引
encoded_col = lookup_layer(ragged_col)

内容的提问来源于stack exchange,提问作者kawaiinekochan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 03:54:01