Ansible在35k台VM组成的超大规模主机组上的性能问题求助
Ansible在35k台VM组成的超大规模主机组上的性能问题求助
各位Ansible老司机,救命!我现在要在一个包含35000台VM的超大规模主机组上跑安装node_exporter的playbook,愁死我了!
我一开始就知道直接硬跑肯定会内存炸掉,所以自己先捣鼓了几个优化配置,但跑起来还是慢得离谱,而且也怕中间出问题崩掉,来跟大伙求点更靠谱的优化思路:
我目前已经试过的优化:
- 用了
free策略(strategy: free) - 把串行执行数设成了
serial: 350 - 严格控制只收集必要的facts,配置如下:
gather_facts: true gather_subset: - "default_ipv4" - "system" - "service_mgr" - "pkg_mgr" - "os_family" - "selinux" - "user" - "mounts" - "!all" - "!min"
本来还有第4个尝试的,但内容没写完,先把当前的情况抛出来。
现在的问题是,就算做了这些,执行速度还是达不到预期,而且我也不确定这些配置是不是真的能扛住35k台机器的规模不崩。想问问各位大佬,针对这种超大集群,还有什么我没考虑到的优化点?比如有没有其他策略、参数或者实践经验能让这个playbook跑得既稳定又高效?
备注:内容来源于stack exchange,提问作者Anatolii Tk
相关产品推荐
相关产品推荐

