1.
为什么在SLA中明确香港机房宕机赔付很重要
• 香港机房地理位置重要,面向中国境外与港澳台用户延迟低,但故障影响面广。
• 业务中断直接导致订单流失、用户信任下降及合规风险,按行业统计每小时宕机损失可达数万至数十万港币。
• 明确赔付能量化风险、督促供应商提升可用性和应急能力。
• SLA是合同保障的核心条款,涉及赔付上限、证明责任与免责条款。
• 针对服务器/VPS/主机、域名解析、CDN与DDoS防御应分别约定对应指标与补偿方式。
2.
SLA中应包含的关键技术指标
• 可用率(Uptime %):常见等级为99.9%、99.95%、99.99%,分别对应月允许宕机约43.2分钟、21.6分钟、4.32分钟(按30天计算)。
• 平均修复时间(MTTR):例如要求在4小时内恢复关键服务,超过按小时计付违约金。
• 平均响应时间(MTTA):监控告警后供应商首次响应时间(如15分钟内)。
• DDoS清洗能力与最大持续带宽:例如要求至少1Tbps清洗能力和自动流量切走。
• 证据与审计:明确使用哪类日志、边界设备流量记录或第三方监测作为宕机证据。
3.
香港机房常见宕机原因与影响路径
• 电力/UPS故障导致全机房断电,可能同时影响交换机与防火墙。
• 运营商光缆断裂或BGP路由翘曲,造成跨境访问中断。
• 大规模DDoS攻击导致链路拥塞或上游黑洞。
• 机房内硬件故障(交换机、硬盘阵列、核心路由)或软件升级失误引发连锁宕机。
• 人为操作或保安问题导致物理隔离或服务不可用,影响DNS解析、CDN回源或主机访问。
4.
具体服务器配置举例与对SLA的要求(含示例表格)
• 在SLA中对主机配置做最低保障能帮助定位故障责任并计算损失。
• 下表为三类常见香港服务配置示例与带宽/DDoS能力要求:
| 实例类型 |
CPU |
内存 |
存储 |
带宽 |
DDoS清洗 |
| VPS-业务节点 |
4 vCPU |
8 GB |
200 GB NVMe |
1 Gbps 专线 |
100 Gbps |
| 云主机-数据库 |
8 vCPU |
32 GB |
1 TB NVMe RAID |
1 Gbps/Cross-connect |
200 Gbps |
| 裸金属-核心 |
12 cores |
64 GB |
2 x 1.92 TB NVMe |
10 Gbps |
1 Tbps |
• 表格下方说明:以上配置为SLA最低保障示例,若实际机房配置低于约定,应承担相应赔付责任。
• 在SLA中还应约定备份RPO(如15分钟)与RTO(如2小时)。
5.
赔付计算规则与真实案例演示
• 常见赔付模式:比例补偿(按超出宕机时长占整月时长的比例)或分级赔付(超过某阈值,对应固定天数/百分比的服务费返还)。
• 示例数据:某客户月度服务费为HKD 10,000,月总分钟数 30×24×60 = 43,200 分钟。SLA承诺99.95%(允许宕机21.6分钟)。
• 真实案例:某香港金融企业(匿名)2019年因机房电力故障宕机6小时(360分钟),监测显示实际可用率降至约99.166%。
• 按比例赔付计算(若合同约定按超出部分返还相应费用):超出分钟 = 360 - 21.6 = 338.4 分钟;赔付 = 10,000 × (338.4 / 43,200) ≈ HKD 78.4(仅作示例,实际条款通常设有最低赔付标准)。
• 推荐分级赔付示例(更合理):宕机>60分钟且≤360分钟,赔付1天服务费;宕机>360分钟且≤1440分钟,赔付3天服务费;此方式对客户更有保障且便于执行。
6.
技术与合同层面的缓解措施
• 多可用区/主备机房:要求跨可用区自动漂移、DNS快速切换与数据库异步复制。
• BGP多线和任意运营商互联,降低单一路由故障风险。
• CDN+Anycast加速与回源熔断,降低源站压力;在SLA中明确CDN回源失败的责任划分。
• 指定DDoS清洗阈值与清洗启动策略(如流量达到峰值的5%或超出带宽阈值即自动清洗)。
• 定期演练与报告:要求供应商每季度提供故障演练报告、年终SLA合规报告与第三方监测数据共享。
7.
签订与审查SLA的实务建议
• 明确定义术语(宕机、可用率、响应、修复、例行维护时间窗、不可抗力)。
• 约定证据采集方式(第三方监测、边界流量镜像、系统日志)与争议解决机制。
• 设定赔付上限(通常为月费的100%或年费的若干倍)并注意不要让上限过低。
• 约定公告/通知流程与时间窗(如故障发生后30分钟内必须告知),逾期视为违约。
• 保留终止权与迁移支持:当供应商连续多次违反SLA时,客户应有无违约金终止合同并要求迁移补助。
来源:企业如何在SLA中约定香港机房宕机了怎么办的赔付与保障