关于Amazon Neptune的Gremlin数据加载格式技术咨询
Amazon Neptune Gremlin批量加载格式问题解答
问题1:列的处理方式
不需要重命名现有业务列,而是新增Neptune要求的必填列:
- 顶点文件:新增
id(顶点唯一标识,比如用customer_no作为客户顶点的id、order_no作为订单顶点的id、item_id作为商品顶点的id)和label(顶点类型,比如"Customer"、"Order"、"Item"),原有的date_order_created、zip_code、item_short_description等列作为顶点的属性列保留即可。 - 边文件:新增
id(边的唯一标识,比如用order_no+item_id组合生成)、label(边的关系类型,比如"placed"表示客户下单、"contains"表示订单包含商品)、from(起始顶点id,比如"placed"边的from是客户的customer_no)、to(目标顶点id,比如"placed"边的to是订单的order_no),如果有边的属性也可以保留原有列。
问题2:顶点文件的数量选择
两种方式都支持,但推荐按顶点类型拆分多份文件(比如customers.csv、orders.csv、items.csv),这样更便于维护和排查问题。如果不想拆分,也可以把所有顶点放在同一份文件里,通过label列来区分不同类型的顶点(比如一行label是"Customer",另一行是"Order"),Neptune能自动识别不同label的顶点。
内容的提问来源于stack exchange,提问作者Tom Bomer
相关产品推荐
相关产品推荐

