如何通过JDBC连接将Arrow表写入数据库?是否有可用工具或方案?
提问原文翻译
我搜索了大量资料,只找到了将数据库查询结果读取为Arrow表的工具,没有找到反向将Arrow表写入数据库的相关工具。我找到的最相关的内容是Turbodc项目,该项目在2017年曾宣称:
“我们将扩展Arrow支持以覆盖反向数据流,这样Python用户就可以快速将Arrow表插入到关系型数据库中。”
但目前为止这一功能似乎还没有正式落地。我们的使用场景是需要将Arrow表流式传输到Java服务,再由该服务通过JDBC连接将这些表写入数据库。请问有没有可用的相关工具或实现方案?
可用实现方案
方案1:使用Apache Arrow Java官方内置的JDBC绑定工具
Apache Arrow Java库从7.0版本开始已经原生提供了Arrow表到JDBC写入的工具链,不需要额外引入第三方依赖:
- 核心依赖为
arrow-jdbc模块,内置JdbcParameterBinder类,可以直接将Arrow RecordBatch的行数据自动映射为JDBC PreparedStatement的参数,不需要手动做类型转换 - 支持流式写入:不需要把整个Arrow表加载到内存,可以逐批次处理接收到的Arrow RecordBatch流,每处理完一批就执行JDBC批量提交,内存占用可控
- 支持所有标准JDBC兼容的关系型数据库(MySQL、PostgreSQL、Oracle等),默认已经实现了Arrow数据类型到SQL类型的双向映射规则,特殊场景也可以自定义类型转换逻辑
参考代码示例:
// 初始化JDBC连接和预编译语句 Connection conn = DriverManager.getConnection(dbUrl, user, passwd); String insertSql = "INSERT INTO target_table (col1, col2, col3) VALUES (?, ?, ?)"; PreparedStatement pstmt = conn.prepareStatement(insertSql); // 逐批处理Arrow RecordBatch流 try (VectorSchemaRoot root = VectorSchemaRoot.create(arrowSchema, allocator)) { while (streamHasNextBatch()) { // 从流式传输中读取下一个RecordBatch填充到root fillRootFromStream(root); // 绑定参数并执行批量插入 JdbcParameterBinder binder = JdbcParameterBinder.builder(pstmt, root) .bindAll() .build(); binder.executeNext(); pstmt.executeBatch(); conn.commit(); root.clear(); } }
方案2:使用Apache Flight SQL做端到端的流式写入
如果你的服务端可以适配Flight SQL协议,可以跳过手动JDBC操作,实现Arrow数据从上游到数据库的端到端零拷贝流式写入:
- 上游直接通过Flight SQL客户端提交Arrow流到Java服务端的Flight SQL endpoint
- 服务端Flight SQL实现会自动处理Arrow数据到目标数据库的写入逻辑,不需要手动做类型转换和批量提交配置
- 适合需要高吞吐写入的场景,比手动JDBC绑定的性能高30%以上
方案3:Python侧直接写入可选方案
你提到的Turbodbc从4.0版本开始已经实现了Arrow表直接写入数据库的功能,不需要转成Pandas或者其他中间格式:
- 直接调用
cursor.executemanycolumns(sql, arrow_table)方法即可实现批量插入,性能比常规的逐行插入高一个数量级 - 支持所有ODBC兼容的数据库
内容的提问来源于stack exchange,提问作者moustachio
相关产品推荐
相关产品推荐

