僵尸服务器问题及其解决方案
在QCon London会议上,Red Hat的Quarkus高级首席软件工程师Holly Cummins讨论了服务器利用率和弹性与可持续性的关系,并介绍了一系列实用的“僵尸服务器”清理技术,包括简单的自动化、LightSwitchOps和FinOps。
僵尸服务器的定义与现状
僵尸服务器是指那些没有提供任何信息或计算服务超过六个月的服务器,它们不仅浪费资源,还增加了成本和碳排放。Cummins提到,美国数据中心中有超过1200万台服务器大部分时间处于闲置状态,平均服务器利用率仅为12-18%,最大功率利用率为30-60%。2021年的一项研究显示,公共云中因“始终在线”的资源浪费了266亿美元。
僵尸服务器的成因
僵尸服务器的出现通常是因为过度配置服务、项目结束、业务流程变化或隔离需求,导致人们忘记关闭服务器。此外,批处理作业在周末运行或系统在非工作时间保持24/7运行也会导致服务器利用率低下。虽然自动扩展可以解决部分问题,但缩减规模并不容易。
解决方案
Cummins提出了绿色计算模型,强调通过检测和销毁来消除僵尸服务器。具体方法包括系统考古学、尖叫测试、标签化(提供元数据以供未来审查),以及利用GreenOps、FinOps、AIOps和LightSwitchOps等操作。LightSwitchOps的核心是像开关灯一样快速启动和关闭服务器,确保其具备弹性和幂等性。
其他工具与技术
Cummins还提到通过脚本和GitOps(基础设施即代码)来启动和关闭服务器,从而节省成本。GitOps还可以替代需要冗余的系统。然而,云计算、虚拟化和无服务器架构并不能完全消除僵尸服务器,因为它们有时仍有实例运行,尽管可能没有成本。
僵尸数据的扩展
Cummins指出,僵尸问题不仅限于服务器,还包括数据和网络流量(未到达目的地的数据包),这些共同构成了“互联网背景噪音”。
双重收益
消除僵尸服务器不仅有助于财务节省,还能减少环境影响。Cummins强调,我们需要努力消除僵尸服务器,使用或创建工具来提高利用率(弹性、多租户)和去僵尸化(可见性、可处置性),并利用GreenOps、FinOps、AIOps、GitOps和LightSwitchOps等技术。
LightSwitchOps的起源
Cummins提到,LightSwitchOps的灵感来自于Quarkus的快速启动时间。Quarkus在原生编译时启动速度比LED灯泡还快,这解决了“为什么不在不使用时关闭服务器,在需要时再启动”问题的一半。然而,另一半问题在于组织对启动和关闭服务器的流程和基础设施的依赖。
最佳服务器利用率的工具
Cummins建议使用自动扩展工具来优化服务器利用率,尽管它们并不完美。在数据中心层面,Turbonomic应用资源管理和Densify等工具也能提供帮助。
通过这些方法和工具,Cummins希望能够有效减少僵尸服务器,提升资源利用率,从而实现经济和环境的双重收益。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。