Jupyter Notebook连接MySQL数据库的代码优化咨询
MySQL与Jupyter连接代码审阅意见
你的基础实现已经可以完成从MySQL取数到Pandas DataFrame的核心流程,以下是符合开发最佳实践的优化方向:
- 敏感信息不要硬编码
目前你将数据库用户名、密码、地址直接写在连接字符串中,一旦共享Notebook或者将文件提交到版本仓库,会直接造成数据库凭据泄露,且多环境切换时修改配置非常麻烦。推荐通过环境变量读取敏感配置,本地开发可以配合python-dotenv管理本地环境变量,示例代码:import os from dotenv import load_dotenv # 读取当前目录下.env文件中存储的配置,.env文件需要加入.gitignore避免提交 load_dotenv() conn_str = ( f"mysql+mysqlconnector://{os.getenv('DB_USER')}:{os.getenv('DB_PWD')}" f"@{os.getenv('DB_HOST')}/{os.getenv('DB_NAME')}" ) engine = db.create_engine(conn_str) - 用上下文管理器自动管理连接资源
你手动调用engine.dispose()释放连接的思路是对的,但如果SQL执行阶段抛出异常,dispose()方法不会被执行,会造成数据库连接泄漏。推荐使用with上下文管理器,无论执行成功还是报错,都会自动释放连接资源,无需手动调用dispose:with engine.connect() as conn: df = pd.read_sql_query("SELECT customer_id, name, create_time FROM customer", conn) - 优化SQL写法规避潜在问题
不推荐在查询中使用SELECT *:如果后续表结构发生字段增减、顺序调整,会直接导致读取到的DataFrame结构不符合预期,最好明确指定需要查询的字段。
如果查询需要传入动态参数,绝对不要用字符串拼接的方式构造SQL,会存在SQL注入风险,使用read_sql_query自带的params参数传参即可:# 参数化查询示例 query = "SELECT customer_id, name FROM customer WHERE level > %s" df = pd.read_sql_query(query, conn, params=(3,)) - 大数据量场景的适配优化
如果customer表数据量达到百万级以上,直接全量拉取会占用大量内存,甚至导致Jupyter内核崩溃。可以优先在SQL层完成过滤、聚合逻辑,只拉取需要的数据集;如果必须拉取全量数据,可以传入chunksize参数分块读取处理。
内容的提问来源于stack exchange,提问作者Splatboy
相关产品推荐
相关产品推荐

