关于Kudu文档“每个集群避免多Kudu客户端”规则的技术疑问
问题描述
我正在查阅Kudu官方文档中kudu-spark的部分说明,其中提到:每个集群避免使用多个Kudu客户端。Kudu-Spark开发中常见的编码错误是实例化额外的KuduClient对象。在kudu-spark中,KuduClient归KuduContext所有,Spark应用代码不应创建另一个连接同一集群的KuduClient,而应通过
KuduContext#syncClient方法获取KuduClient。要诊断Spark任务中的多KuduClient实例问题,可查看日志中是否有来自不同客户端的大量GetTableLocations或GetTabletLocations请求导致Master过载的迹象,这类情况在Spark Streaming代码中尤为常见——若每个任务创建一个KuduClient,会引发来自新客户端的周期性Master请求浪潮。请问这是否意味着同一时间只能运行一个kudu-spark任务?若有一个持续向Kudu写入数据的Spark Streaming程序,其他Spark程序该如何连接Kudu?
回答
放心,这绝对不代表同一时间只能跑一个Kudu-Spark任务!官方这段文档的约束对象是单个Spark应用内部的客户端创建行为,而非限制不同Spark应用之间的并发连接。
先搞懂文档说的“多客户端”到底指什么
文档里禁止的是在同一个Spark应用里手动创建多个KuduClient实例——比如在Spark Streaming的每个微批任务里都new一个KuduClient,或者在应用的不同模块各自实例化客户端。这种情况会导致Kudu Master被大量重复的元数据请求(比如GetTableLocations)淹没,引发性能问题。
而不同的Spark应用(比如你那个持续运行的Streaming程序,和另一个批处理Spark任务),各自拥有独立的KuduContext和对应的KuduClient实例是完全合规的,这不属于文档里要避免的“多客户端”场景。
针对你的场景的正确做法
如果已经有一个持续写入的Spark Streaming程序在运行,其他Spark程序连接Kudu只需要遵守以下两点:
- 每个新的Spark应用只创建一个
KuduContext实例(全局复用,不要每个任务或函数里都创建) - 所有需要操作Kudu的代码,都通过这个
KuduContext调用syncClient()方法获取客户端,绝对不要手动实例化KuduClient
额外提醒
Kudu本身具备良好的多应用并发处理能力,只要每个应用内部都遵守“用KuduContext管理客户端”的规则,多个Spark应用同时读写Kudu完全没问题。如果之后遇到Master负载过高的情况,优先排查每个应用内部是不是有违规创建KuduClient的代码,而不是怀疑多应用并发的问题。
内容的提问来源于stack exchange,提问作者xuejianbest

