K3s集群CoreDNS间歇性DNS解析失败问题求助
K3s集群DNS间歇性失效问题排查
环境与核心问题
我有一个由1个主节点+2个工作节点组成的K3s集群,目前遭遇严重的DNS解析间歇性失效问题:重启Pod后能暂时恢复解析功能,但不久后故障会再次出现。
初始现象与日志
最初CoreDNS日志仅反复弹出以下警告:
[WARNING] No files matching import glob pattern: /etc/coredns/custom/*.override [WARNING] No files matching import glob pattern: /etc/coredns/custom/*.server [WARNING] No files matching import glob pattern: /etc/coredns/custom/*.override [WARNING] No files matching import glob pattern: /etc/coredns/custom/*.server [WARNING] No files matching import glob pattern: /etc/coredns/custom/*.override [WARNING] No files matching import glob pattern: /etc/coredns/custom/*.server
重启CoreDNS Deployment后,在DNS调试Pod中执行nslookup google.com,前几次能成功解析,但后续请求会直接超时:
/ # nslookup google.com ;; connection timed out; no servers could be reached
CoreDNS ConfigMap配置详情
当前Corefile配置如下:
data: Corefile: | .:53 { errors health ready kubernetes cluster.local in-addr.arpa ip6.arpa { pods insecure fallthrough in-addr.arpa ip6.arpa } hosts /etc/coredns/NodeHosts { ttl 60 reload 15s fallthrough } prometheus :9153 forward . /etc/resolv.conf cache 30 loop reload loadbalance import /etc/coredns/custom/*.override } import /etc/coredns/custom/*.server NodeHosts: | 10.25.165.243 i-0617a53e804d5cd0a 10.25.130.16 i-0596bb6d78c4748c5 10.25.157.146 i-0796e8161080685c4 10.25.204.118 i-0c409f7c2d69c3011
已尝试的缓解动作
将CoreDNS副本数扩容至2个后,故障情况略有改善:失效后偶尔能收到解析响应,但仍有半数请求失败。
最新状态更新
我已从ConfigMap中移除了import相关配置,消除了日志中的警告,但DNS解析间歇性失效的问题依然存在。当前CoreDNS日志如下:
.:53 [INFO] plugin/reload: Running configuration SHA512 = b941b080e5322f6519009bb49349462c7ddb6317425b0f6a83e5451175b720703949e3f3b454a24e77f3ffe57fd5e9c6130e528a5a1dd00d9000e4afd6c1108d CoreDNS-1.10.1 linux/amd64, go1.20, 055b2c3
内容的提问来源于stack exchange,提问作者Mateo Arboleda
相关产品推荐
相关产品推荐

