Spark通过JDBC读取SQL Server时如何设置NOLOCK?
Spark JDBC读取SQL Server设置NOLOCK的实现方法
Spark JDBC没有提供直接配置NOLOCK的选项,你可以通过修改dbtable参数的方式实现,具体是将原本的表名替换为包含WITH (NOLOCK)的子查询语句。
修改后的代码示例:
df = (spark.read.format('jdbc') .option('url', str_con) .option('driver', driver) .option('fetchsize', fetchsize) # 替换dbtable为带NOLOCK的子查询,必须添加别名 .option('dbtable', f"(SELECT * FROM {source_table_name} WITH (NOLOCK)) AS tmp_table") .option('user', usu_login) .option('password', usu_senha) .option('schema', get_schema(columns)) .load() )
注意事项:
- 子查询必须指定别名(比如示例中的
tmp_table),否则SQL Server JDBC连接器会抛出语法错误 - 若不需要读取全表列,建议将
SELECT *替换为具体列名,减少数据传输开销 - 该方式的本质是让SQL Server执行带NOLOCK的查询,Spark仅通过JDBC执行这条查询语句获取结果
内容的提问来源于stack exchange,提问作者neves
相关产品推荐
相关产品推荐

