You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python和AWS Lambda将含嵌套结构的Pandas DataFrame写入DynamoDB

将含嵌套结构的Pandas DataFrame写入DynamoDB的正确方法

直接用batch_writer写入原生Python列表/字典会触发ValidationException,原因是DynamoDB要求数据必须转换成它原生支持的类型标识(比如L对应列表、M对应字典),而非直接传入Python原生类型。以下是可行的解决步骤:

核心思路

利用boto3内置的TypeSerializer工具,将DataFrame中的Python原生类型(列表、字典、字符串、数字等)自动转换成DynamoDB兼容的格式,再通过batch_writer批量写入。

具体实现代码

1. 导入依赖库

import boto3
import pandas as pd
from boto3.dynamodb.types import TypeSerializer

2. 初始化DynamoDB表连接

dynamodb = boto3.resource('dynamodb')
table = dynamodb.Table('你的表名')

3. 定义类型转换函数

这个函数会把单行数据(字典格式)的每个键值对转换成DynamoDB可识别的结构:

def to_dynamo_item(item_dict):
    serializer = TypeSerializer()
    return {key: serializer.serialize(value) for key, value in item_dict.items()}

4. 遍历DataFrame并批量写入

# 假设你的DataFrame对象名为df
with table.batch_writer() as batch:
    for _, row in df.iterrows():
        # 将行数据转为字典,再转换为DynamoDB格式
        dynamo_item = to_dynamo_item(row.to_dict())
        batch.put_item(Item=dynamo_item)

注意事项

  • 确保DataFrame中主键列(分区键、排序键)的类型与DynamoDB表架构完全匹配,比如表主键定义为字符串类型,就不能传入数字类型值
  • TypeSerializer会自动处理None值,将其转为DynamoDB的NULL类型,无需额外处理
  • 批量写入时,batch_writer默认会按25条/批或16MB/批的限制自动拆分批次,无需手动控制

内容的提问来源于stack exchange,提问作者NNM

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.11 20:40:26