You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

GCP VM上部署的Fluentd Agent无法向Logs Explorer推送日志求助

问题根因排查与解决方案

最高概率根因(镜像部署场景占比80%以上)

你通过镜像复制现有正常VM的部署方式会携带原实例的Fluentd读取位置记录:
原VM上/var/lib/google-fluentd/pos/目录下的pos文件记录了对应日志文件的已读取偏移量,新VM上的syslog等日志文件大小远小于pos记录的偏移量时,Fluentd会判定无新日志需要采集,就会出现首次启动推送少量系统初始化日志后完全停止的现象。
解决步骤:

  1. 停止Fluentd服务:systemctl stop google-fluentd
  2. 清空所有历史偏移量记录:rm -rf /var/lib/google-fluentd/pos/*
  3. 重启Fluentd服务:systemctl start google-fluentd
    验证:观察后续10分钟的日志推送量,确认是否恢复正常。

其他高概率排查方向

  • 日志级别过低无报错输出
    默认info级别的Fluentd日志不会打印连接重试、API限流、静默丢包类的告警信息,需调整日志级别获取底层异常:
    修改/etc/google-fluentd/google-fluentd.conf中的log_level配置为debug,重启服务后查看/var/log/google-fluentd/google-fluentd.log,重点排查是否有连接超时、写入被拒、批量打包超限类的日志。
  • 网络会话超时断开
    若新VM通过Cloud NAT访问公网调用Logging API,默认30分钟的TCP会话超时时间如果短于Fluentd长连接的保活间隔,会导致连接被NAT静默断开,Fluentd默认配置不会主动检测断开重连:
    可先执行curl -I https://logging.googleapis.com验证连通性,确认无拦截后调整Fluentd输出插件的keepalive_timeout配置为20分钟(小于NAT超时时间),或调整Cloud NAT的TCP会话超时时间到1小时以上。
  • syslog入站流量拦截
    执行tcpdump -i any port 514确认VM的514端口(syslog默认端口)是否有持续流量进入,排除负载均衡未配置新VM为后端、VPC防火墙拦截syslog入站流量的问题。
  • 服务账号权限异常
    核对新VM绑定的服务账号是否持有roles/logging.logWriter权限,镜像复制场景下可能丢失服务账号绑定配置,导致仅能推送初始化阶段的少量日志后无权限继续写入。

内容的提问来源于stack exchange,提问作者saurabh.k

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 17:45:01