1.
总体目标与适用范围
• 目标:确保美国机房物理机(站群)稳定、安全、可恢复;
• 适用对象:物理服务器、裸金属托管、近线存储与边缘CDN节点;
• 频率:日常巡检(每日)、周检、月检与应急响应;
• 输出:每次巡检形成运维记录并归档,异常在2小时内升级到值班工程师;
• KPI:可用率≥99.9%,15分钟内检测到并响应重大流量异常或服务宕机;
• 说明:结合自动化脚本(Ansible/SSH)和监控(Zabbix/Prometheus+Alertmanager)。
2.
硬件与机房物理检查
• 检查点:主板、CPU温度、内存错误(ECC)、硬盘SMART状态、RAID健康;
• 命令示例:sensors 查看温度;smartctl -a /dev/sda 查看磁盘;ipmitool sdr 列出感测;
• 阈值:CPU温度长期>85°C警报,S.M.A.R.T.出现Reallocated_Sector_Ct>0需排查;
• 维护项:更换有问题硬盘、清理机箱灰尘、检查机柜供电冗余与PDU负载;
• 备件与替换:建议每台站群机配备可热插拔SSD与备用电源线;
• 示例物理机配置(示例表格):
| 机房 | 型号 | CPU | 内存 | 磁盘 | 上行链路 |
| US-East-1 | Dell R730 | Intel Xeon E5-2620 v3 (6C/12T) | 32GB DDR4 | 2x480GB SSD RAID1 | 1Gbps |
3.
网络、域名与CDN配置检查
• DNS:核对域名解析是否指向正确A/AAAA/CAA记录,TTL设置是否过低(生产建议300-3600s);
• CDN:确认CDN(如Cloudflare/Akamai)证书和缓存策略,检查回源IP白名单与回源健康检查;
• 路由与BGP:检查路由丢包(mtr/traceroute)和BGP公告是否正常;
• 带宽与峰值:记录正常业务峰值带宽(例如平时200-400Mbps),设置阈值告警(超过800Mbps触发);
• DDoS策略:启用速率限制、地理封锁、JS挑战与WAF规则;对常见端口(80/443/22)设置额外防护;
• 建议:对站群使用CDN做边缘缓存并限制回源QPS,回源只允许CDN出口IP访问。
4.
系统服务与安全配置检查
• SSH:强制使用密钥登录,禁用root远程登录(/etc/ssh/sshd_config: PermitRootLogin no),更改默认端口并使用Fail2ban;
• Web服务:nginx配置检查(worker_processes auto;worker_connections 1024;keepalive_timeout 15;gzip on);
• 数据库:检查MySQL/Redis慢查询、连接数,设置连接池上限以避免资源枯竭;
• 防火墙:核查iptables/nft规则,确保只开放必需端口,例:iptables -A INPUT -p tcp --dport 22 -m conntrack --ctstate NEW -m recent --set;
• 日志权限与轮替:核对logrotate策略,确保/var/log不过度膨胀并且日志由集中化系统收集(ELK/Graylog);
• 演示配置片段:nginx worker_connections=1024,fail2ban jail sshd maxretry=5 findtime=600 bantime=3600。
5.
监控、阈值与日常命令
• 关键指标:CPU、内存、磁盘利用率、磁盘IOPS、网络带宽、连接数、响应时间;
• 命令集合:top、htop、iostat -x 1 3、sar、iftop、ss -s、netstat -tunpl;
• 阈值示例:CPU>80%持续5分钟报警,磁盘使用>85%报警,TCP连接数>10000警报;
• 报警渠道:短信+企业微信+PagerDuty,重要事件自动创建工单并指派值班;
• 自动化脚本:每日4:00执行健康检查脚本(Ansible playbook),并将结果推送到监控系统;
• 日志保留:应用日志不少于30天,审计日志不少于90天(合规需要时延长)。
6.
应急响应与真实案例
• 案例背景:2024-03-12,一组站群在美国东岸遭遇持续DDoS攻击,峰值流量约3Gbps,PPS约150k;
• 发现与处置:监控在1分钟内告警,自动切换到CDN挑战页面并临时封禁异常源IP段,通知带宽池调度;
• 结果:通过CDN限流+回源白名单策略,回源流量稳定在100Mbps以内,业务在30分钟内恢复;
• 经验:提前与带宽商/上游做好应急沟通,准备DDoS清洗策略(OnDemand清洗、Blackholing、Scrubbing);
• 演练:每季度进行一次DDoS应急演练,检查Playbook完整性并评估RTO/RPO是否满足SLA;
• 文档:记录每次事件的流量曲线、攻击特征、封堵IP和最终恢复步骤,作为后续优化依据。
7.
备份、变更与运维记录
• 备份策略:数据库每日全量(冷备)+每小时增量,配置文件实时同步到Git/私有S3;
• 恢复演练:每月演练一次从最近快照恢复主站,要求15分钟内完成DNS切换流程;
• 变更管理:所有生产变更需通过审批并在维护窗口执行,变更记录保留在CMDB中;
• 运维记录:每次巡检填写模板(时间/检查项/异常/处理人/持续状态),并存档90天以上;
• 自动化建议:使用Ansible + Jenkins完成补丁与配置下发,定期校验配置一致性(配置漂移检测);
• 结语:站群物理机运维需结合自动化、监控与预案,定期复盘真实案例以提升抵御能力。
来源:运维手册 美国站群物理机日常维护与安全检查清单