目标:以稳定性(低故障率、SLA、网络质量)和扩展性(自动扩展、弹性网络、分布式存储)为首要指标,排序云服务候选。
小分段:制定需求(QPS/并发、数据库写入量、延迟要求、合规LGPD),并按稳定性>扩展性>成本的顺序评分每个供应商。
步骤1:从目标客户端或测试机执行 ping 与 traceroute,命令示例:ping
步骤2:用 iperf3 测速:在云主机上启动服务端:iperf3 -s;在本地运行:iperf3 -c <服务器IP> -P 10 -t 30,评估带宽与抖动。
步骤1:优先选择巴西本地区域(如 São Paulo)以保证最低延迟;检查该区域是否有多可用区(Multi-AZ)。
步骤2:若业务必须高可用,部署跨可用区实例并开启自动跨区快照与复制,确保单AZ宕机可恢复。
实例:使用托管实例模板(AWS AMI/GCP Image),启用自动修复(Auto Healing)。
网络:启用私有子网、NAT网关和弹性IP;配置健康检查(HTTP/HTTPS),负载均衡器(ALB/ELB或GCLB)分发流量。

备份:设置数据库的自动备份(RDS/Cloud SQL),定义保留周期与快照策略,定期演练恢复流程(restore到测试环境)。
自动伸缩:创建基于指标(CPU、请求数、响应延迟)的伸缩策略。示例:AWS Auto Scaling 设置目标跟踪策略,目标响应时间为200ms。
缓存与CDN:配置Redis/Memcached作为应用缓存;部署CDN(Cloudflare或CloudFront/GCP CDN)并设置边缘规则,减轻区域主机压力。
数据库:优先托管数据库(RDS/Cloud SQL/Autonomous DB),使用读写分离与只读副本,采用分片或分库分表策略以应对增长。
监控:开启云厂商监控(CloudWatch/Stackdriver/OCI Monitoring),采集主机、应用、数据库指标,并画仪表盘。
告警:设定阈值告警(如CPU>80%持续5分钟、请求错误率>2%),并配置通知到Slack/邮件/PagerDuty。
演练:每季度做一次故障切换与备份恢复演练,记录RTO与RPO,调整优先级与资源配比。
答:优先看是否有本地区域与多可用区、历史SLA与公开事件记录、网络互联(Peering/ISP合作)与DDoS防护能力。实操上用ping/traceroute/iperf3在代表性节点测试延迟与丢包,查看控制台的可用区恢复与自动修复功能。
答:短期看自动伸缩组与负载均衡的即时扩容策略;长期看数据库读写分离、水平分片、CDN与边缘缓存、以及使用容器化(Kubernetes)和Infrastructure as Code(Terraform)来实现可重复、可扩展部署。
答:第一层:有本地多可用区且企业级SLA的云(如AWS/GCP/Azure在圣保罗区);第二层:支持托管数据库与企业监控、自动伸缩与CDN集成;第三层:成本与本地支持(本土云提供商)作为补充,并确保合规(LGPD)与网络连通性。