MLCP数据脱敏迁移任务运行10小时后出现网络地址不可用错误求助
针对你遇到的10小时后突然出现的网络地址不可用错误,结合MarkLogic 10.0.3和MLCP 10.0.4的环境,可按以下步骤排查:
先确认网络与目标服务状态
任务前期正常运行,大概率是临时网络波动或目标服务临时异常。在MLCP执行机器上,用telnet outputhost 8000或nc -zv outputhost 8000测试端口连通性;同时登录目标MarkLogic的8001管理界面,确认服务是否正常运行、集群状态无异常,近期有没有重启过服务。核对MLCP配置的目标地址参数
即便之前运行正常,也可以快速核对本次MLCP命令中的输出主机参数(如-host或-output_host),确认主机名拼写、端口号(8000是MarkLogic的应用服务端口,若用管理端口应为8001)是否正确;尝试用目标主机IP代替主机名,排除DNS解析临时失效的问题。检查目标主机的资源负载
长时间迁移任务可能导致目标主机资源耗尽:查看目标主机系统日志,确认是否有内存溢出(OOM)、磁盘空间不足的报错;登录MarkLogic管理界面,检查数据库所在磁盘的剩余空间,以及CPU、内存的实时占用率,是否因负载过高导致服务无法响应连接。深挖日志细节
查看MLCP运行日志的完整堆栈信息,除了当前报错,是否有前期的连接超时、写入重试警告?同时查看目标MarkLogic的ErrorLog.txt(默认路径/var/opt/MarkLogic/Logs),有没有与该迁移任务相关的权限错误、数据写入冲突等信息,这些可能是触发最终连接报错的根源。验证任务配置与版本兼容性
确认MLCP命令中的并发线程数(-thread_count)是否过高,导致目标服务器长时间高负载后出现连接异常;虽然版本匹配,但可核对脱敏相关的配置参数,是否存在与当前版本不兼容的设置。
内容的提问来源于stack exchange,提问作者ravvi

