如何高效将MySQL中的二进制数据导入PostgreSQL?
我之前也碰到过这个头疼的问题——用mysqldump和psql导普通数据顺风顺水,但一碰到MySQL里的BLOB类型,导入PostgreSQL的BYTEA就直接卡壳。下面分享几个我亲测有效的解决思路:
方法一:用pgloader工具一键迁移(最省心)
如果不想自己写代码,强烈推荐用pgloader这个专门的数据库迁移工具,它能自动处理MySQL到PostgreSQL的类型映射,包括BLOB转BYTEA,完全不用手动干预。
首先安装pgloader(不同系统安装方式略有不同,比如Ubuntu可以用apt install pgloader,CentOS用yum install pgloader),然后直接运行迁移命令:
pgloader mysql://mysql_user:mysql_pass@mysql_host/mysql_dbname pgsql://pgsql_user:pgsql_pass@pgsql_host/pgsql_dbname
它会自动读取MySQL的表结构和数据,把BLOB字段转换成PostgreSQL的BYTEA,还能处理索引、约束这些细节,迁移过程中会显示进度,非常方便。
方法二:用脚本做中转(自定义性强)
如果需要对数据做额外处理,比如过滤、转换,写个简单的脚本是个不错的选择。我常用Python结合pymysql和psycopg2库来实现,核心思路是直接读取MySQL的二进制数据,再写入PostgreSQL的BYTEA字段。
举个极简示例:
import pymysql import psycopg2 # 连接MySQL mysql_conn = pymysql.connect(host='mysql_host', user='user', password='pass', db='dbname') mysql_cursor = mysql_conn.cursor() # 连接PostgreSQL pg_conn = psycopg2.connect(host='pg_host', user='user', password='pass', dbname='dbname') pg_cursor = pg_conn.cursor() # 查询MySQL中的数据,包含BLOB字段 mysql_cursor.execute("SELECT id, blob_column FROM your_table") for row in mysql_cursor.fetchall(): id_val, blob_data = row # 直接将二进制数据插入PostgreSQL的BYTEA字段 pg_cursor.execute("INSERT INTO your_pg_table (id, bytea_column) VALUES (%s, %s)", (id_val, blob_data)) pg_conn.commit() # 关闭连接 mysql_cursor.close() mysql_conn.close() pg_cursor.close() pg_conn.close()
这个方法的好处是可以灵活加逻辑,比如只迁移符合条件的数据,或者对二进制数据做预处理。
方法三:修改mysqldump输出手动转换(临时应急)
如果只是临时处理少量数据,可以用mysqldump的--hex-blob参数把BLOB数据导出为十六进制字符串,然后修改SQL文件适配PostgreSQL的BYTEA格式。
步骤如下:
- 用mysqldump导出数据,加上
--hex-blob参数:
mysqldump -u mysql_user -p --hex-blob mysql_dbname your_table > dump.sql
- 替换SQL文件中的十六进制格式,把MySQL的
0xXXXX转换成PostgreSQL能识别的decode('XXXX', 'hex'),可以用sed批量替换:
sed -i 's/0x\([0-9A-Fa-f]*\)/decode('\''\1'\'', '\''hex'\'')/g' dump.sql
- 最后用
psql导入修改后的SQL文件:
psql -U pgsql_user -d pgsql_dbname -f dump.sql
这个方法适合临时应急,但如果表很多或者数据量极大,处理起来会比较麻烦。
总的来说,优先推荐pgloader工具,省心又高效;需要定制化处理就写脚本;临时小量数据可以用修改dump文件的方法。
备注:内容来源于stack exchange,提问作者shalow

