使用Turbodbc插入MySQL数据异常缓慢的问题求助
Turbodbc批量插入MySQL性能异常问题求助
我基于simdutf 7.3.0、Python 3.11从源码编译了Turbodbc 5.1.2。向MySQL 8.0 InnoDB表插入15万行、46列数据时,Turbodbc耗时约190秒,但现有SQLAlchemy实现仅需15秒。
我参考Turbodbc高级用法文档实现了列批量插入:
options = turbodbc.make_options( use_async_io=True, ) conn = turbodbc.connect( driver="MySQL Driver", server = get("host"), port=3306, uid=get("user"), pwd=get("pw"), plugin_dir="/usr/local/lib/plugin", turbodbc_options = options, ) cursor = conn.cursor() cols = str(insert_df.columns).replace("'", "").replace("[", "(").replace("]", ")") params = "(" + ", ".join(["?" for _ in insert_df.columns]) + ")" insert_df = insert_df.with_columns( cs.float().cast(pl.Float64), cs.integer().cast(pl.Int64) ) values = [x.to_numpy() for x in insert_df.iter_columns()] on_duplicate_key_update_stmts = ( str([i + " = VALUES(" + i + ")" for i in insert_df.columns]) .replace("[", "") .replace("]", "") .replace("'", "") ) cursor.executemanycolumns(f"INSERT INTO {table_name} {cols} VALUES {params} ON DUPLICATE KEY UPDATE updated_at = if(coalesce(data_change_hash,0) <> values(data_change_hash), NOW(),updated_at), updated_at_micro_ts = if(coalesce(data_change_hash,0) <> values(data_change_hash),NOW(6),updated_at_micro_ts), " + on_duplicate_key_update_stmts + ", modified_at=NOW();", values)
也尝试了逐行插入的方式,耗时同样约190秒:
cursor.executemany(f"INSERT INTO {table_name} {cols} VALUES {params} ON DUPLICATE KEY UPDATE updated_at = if(coalesce(data_change_hash,0) <> values(data_change_hash), NOW(),updated_at), updated_at_micro_ts = if(coalesce(data_change_hash,0) <> values(data_change_hash),NOW(6),updated_at_micro_ts), " + on_duplicate_key_update_stmts + ", modified_at=NOW();", list(insert_df.to_numpy()))
现有SQLAlchemy实现逻辑类似,通过engine创建游标执行executemany,参数占位符使用%s:
INSERT INTO schema.table(my, forty, six, column, names, here, ...) VALUES ( %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s, %s) ON DUPLICATE KEY UPDATE updated_at = if(coalesce(data_change_hash,0) <> values(data_change_hash), NOW(),updated_at), updated_at_micro_ts = if(coalesce(data_change_hash,0) <> values(data_change_hash),NOW(6),updated_at_micro_ts), col1 = VALUES(col1), col2 = VALUES(col2), ..., modified_at=NOW();
恳请各位提供优化建议或问题排查方向。
内容的提问来源于stack exchange,提问作者GBPU
相关产品推荐
相关产品推荐

