1.
准备与供应商选择
- 选择有香港机房、支持100G清洗能力且能提供BGP/Anycast和清洗白名单的服务商。
- 要求:能够提供BGP社区、RTBH/FlowSpec、按流量计费与SLA(清洗时延、恢复时间)。
- 小分段:索要清洗能力证明(峰值图)、测试口令与紧急联系人,确认公网IP可切换到清洗线路。
2.
网络与BGP/Anycast规划
- 与运营商沟通启动BGP:准备自己的ASN或使用提供商代为承载。
- 配置Anycast:在多个点宣布同一前缀以分散流量;确认路由优先级和健康检查。
- 小分段:获取BGP社区标签(示例:宣告到清洗池的community:1234:100),确认可下发FlowSpec规则。
3.
清洗策略设计(100G级)
- 按攻击类型分段:大流量UDP/Amplification、SYN/ACK洪泛、应用层HTTP洪泛分别制定策略。
- 设置默认RTBH(黑洞)策略与最小影响的速率限制(rate-limit)规则。
- 小分段:与清洗中心约定“镜像+清洗”流程:异常流量镜像到清洗链路,清洗后回送净化流量。
4.
防火墙与流表规则落地
- 内网服务器先配置基础iptables/nftables:放行必要端口,限制ICMP速率,SYN cookie开启。示例:iptables -A INPUT -p tcp --syn -m limit --limit 10/s -j ACCEPT。
- 在边界设备上部署ACL+速率限制,配合清洗中心的过滤指令。
- 小分段:记录并保存现网规则变更脚本,便于遭受攻击时快速回滚。
5.
BGP/FlowSpec与RTBH实施步骤
- 向接入ISP提交FlowSpec规则模板,示例规则:匹配源IP/目标端口/协议,动作drop或rate-limit。
- RTBH(Remote Triggered Black Hole)用于完全丢弃致命源;配置黑洞社区并测试(使用测试地址、安全窗口)。
- 小分段:演练流程:触发->运营商下发->流量转入清洗->确认回流。
6.
清洗设备与软件选型
- 清洗中心常用设备:Arbor、A10、Radware、Juniper,选择供应商兼容性与API能力。
- 支持自动化下发规则的API十分重要,确保能通过脚本触发清洗。
- 小分段:要求设备支持至少100G吞吐、会话跟踪与SSL解密(如需应用层清洗)。
7.
实时监控体系搭建(Prometheus+Grafana示例)
- 部署Node Exporter:apt-get install prometheus-node-exporter;systemctl enable --now。
- 配置Prometheus抓取目标:在prometheus.yml添加job并定义抓取间隔与告警规则。
- 小分段:用Grafana建立仪表盘展示带宽、包量、丢包率、TCP连接数;设置阈值告警。
8.
流量分析与告警(NetFlow/sFlow/pcap)
- 在交换机/路由器开启NetFlow或sFlow导出到流分析器(如nfdump、ntopng)。
- 配置自动告警:当5分钟带宽超过阈值或单IP连接数异常时通过Alertmanager发送短信/邮件/Webhook。
- 小分段:保存pcap样本(tcpdump -s 0 -w sample.pcap)用于离线分析和取证。
9.
演练、回滚与SOP文档
- 编写SOP:触发条件、联系人清单、下发规则模板、回滚命令与确认步骤。
- 定期演练:在维护窗口模拟小规模攻击,验证流量切换、清洗回流和业务连通性。
- 小分段:版本控制SOP与脚本,确保任何操作都可回溯与快速恢复。
10.
问:如何在不影响正常业务的情况下触发清洗?
- 答:先设立流量阈值与分级响应(警告->限流->清洗),对特征明确的攻击源先下发FlowSpec或RTBH到清洗池,优先对异常特征(比如单一源IP爆炸或特定端口UDP放大)进行过滤;同时在清洗回路做抽样验证,确认净化后回送再全面放行,避免对正常客户产生大面积影响。
11.
问:我没有ASN或不懂BGP,如何实现100G清洗能力?
- 答:选择支持代管BGP与清洗路由的服务商,签订SLA并获取清洗社区/规则模板;在紧急情况下由服务商代为宣布你的IP到清洗池,同时配合提供必要的验证信息和回退流程。供应商通常提供API或控制面板用于触发。
12.
问:部署监控后常见的误报如何减少?
- 答:通过多维度指标联合判断(带宽+包率+连接数+地理分布),对业务高峰窗口设置白名单或动态阈值,使用基线学习期调整告警灵敏度,并在告警中加入“确认步骤”与人工复核以降低误报影响。
来源:香港高防服务器100g流量清洗与实时监控部署指南