DynamoDB导入数据量与实际表容量差异过大的原因是什么?
DynamoDB导入后表容量与导入数据量差异的疑问
各阶段数据集大小
- S3中的压缩数据集(DynamoDB JSON格式,GZIP压缩):13.3GB
- 导入页面显示的导入表大小(未压缩):64.4GB
- 导入条目数:376 736 126
- 当前表页面显示的表大小:41.5GB(小于导入时的大小!)
- 当前条目数:380 528 674(已执行过一些插入操作)
自导入以来,该表一直在增长。
实际表容量估算值远小于导入时数据量的原因是什么? 是因为DynamoDB表容量本身为近似值?还是DynamoDB会对存储的数据应用压缩?
源S3数据集不应存在重复项:它是通过Athena对DynamoDB表的键执行GROUP BY查询生成的,因此这并非原因所在。
每个条目包含4个属性:PK为2个长字符串(区块链地址=40个十六进制字符+额外约2-6个字符)+1个长字符串(uint256余额的十六进制字符串≤64字符)+1个数值。表导入格式为DynamoDB JSON。
内容的提问来源于stack exchange,提问作者Anton Bryzgalov
相关产品推荐
相关产品推荐

