每天巡检高防,你只需要先盯住攻击流量、清洗中流量、业务并发连接、源站响应码、黑洞状态这五个数,基本上当天要不要介入就已经清楚了。
高防服务器日常运维要监控哪些指标?先盯这五项
很多运维同行一打开高防控制台就懵,满屏曲线不知道先看哪个,其实把指标分成三类,顺序就理清了:流量类、连接类、源站类,流量类看攻击和清洗,连接类看并发和新建,源站类看响应码和回源质量。
攻击流量峰值
攻击流量峰值是判断是否被打的第一信号,查看时不要只看当前值,要对比过去24小时基线,如果凌晨三点突然冒出一个尖峰,多半是遭遇攻击,日常巡检时先扫一眼攻击流量曲线,确认有没有异常突起,高峰值并不一定代表业务受损,但它决定了是否需要进一步查连接数和清洗丢包。
清洗中流量
清洗中流量是指高防系统正在过滤的流量,这个指标容易被忽视,其实很重要,如果清洗中流量长时间接近购买带宽上限,说明攻击规模接近防护阈值,可能随时触发黑洞,正常业务流量加上清洗中流量超过带宽峰值时,部分机房会执行封禁策略,每天看这个值,能预判是否需要升级带宽包。
正常业务流量基线
业务流量要看环比和同比,昨天同一时间段的流量和今天对比,如果偏差较大,先排除活动、发版、爬虫,再怀疑攻击,业务流量突然下降也要留意,可能是高防策略误杀正常请求,或者源站挂了,行业共识认为,基线波动一旦超过日常均值的一半,就该查原因。
游戏高防服务器运维监控指标:连接数比流量更敏感
游戏行业被攻击时往往不是大流量洪水,而是连接数爆炸,很多运维只盯着带宽,结果机房带宽没跑满,游戏服务器已经卡到无法登录,游戏高防服务器运维监控指标里,连接数权重应该排第一。
并发连接数
并发连接数直接反映在线玩家和攻击连接的叠加,正常登录高峰期的并发数是有规律可循的,每周六晚上八点会比工作日下午高出不少,如果并发连接数在非高峰时段突然翻倍,而流量没怎么涨,基本可以判定是CC攻击或者TCP连接耗尽,查看当前连接数的命令可以用:
netstat -an | grep ESTABLISHED | wc -l
对于UDP游戏,还需要看当前UDP会话数,命令类似:
cat /proc/net/udp | wc -l
新建连接速率
新建连接速率比并发数更早暴露CC攻击,正常玩家登录会有节奏,攻击工具则会在几秒内发起海量新建请求,高防控制台上如果有“新建连接速率”曲线,每天必须盯十分钟,如果速率从每秒几百突然飙到每秒几万,不用犹豫,先开连接限速策略。
SYN包比例
SYN Flood是游戏高防最常见的攻击手法,查看SYN_RECV状态连接数:
netstat -an | grep SYN_RECV | wc -l
当这个数字长期保持在数百以上,同时登录接口响应变慢,就可以判断半连接队列被打满,很多高防设备自带SYN Cookie防护,但巡检时仍要观察这个值,确认防护策略是否真的生效。
高防CDN和高防IP哪个好?日常监控侧重点不一样
这个问题经常出现在技术选型讨论里,高防CDN和高防IP没有绝对好坏,关键看业务形态,从日常运维监控角度对比,两者的重点指标完全不同。
| 对比维度 | 高防CDN | 高防IP |
|---|---|---|
| 核心监控指标 | 缓存命中率、回源状态码、边缘节点响应 | 端口连通性、协议会话数、清洗丢包率 |
| 源站暴露风险 | 源站IP可隐藏 | 源站IP直接暴露在解析层 |
| 攻击接触点 | 边缘节点分散承受 | 单点高防机房承受 |
| 告警关注点 | 回源带宽突增、缓存击穿 | TCP连接数突增、SYN比例 |
| 适合业务 | 网站、下载、API加速 | 游戏、直播、自定义协议 |
高防CDN场景下,每天要重点看缓存命中率有没有突然下降,命中率下降意味着大量请求回源,不仅增加源站压力,还可能触发源站限流,高防IP场景下则要重点看端口连通性,尤其在夜里攻击高发期,用telnet 防护IP 端口验证服务是否还能正常握手。
源站健康与回源质量:北京高防服务器运维注意事项
源站健康是高防的最后一公里,高防再强,源站挂了,业务照样中断,北京高防服务器运维注意事项里,回源质量和BGP线路是两个绕不开的点。
源站响应码
每天定时用
curl -I检查源站返回码,重点关注502、504、503,如果源站直接返回50x,高防层再多的清洗都是白费,正常业务应该稳定返回200或301,一旦连续出现50x,先排查源站负载和Web服务进程。
回源带宽与连接复用
回源带宽突增通常意味着缓存击穿或者源站被绕过,高防CDN场景下,如果回源带宽突然达到日常峰值的数倍,要检查是否有人直接攻击源站IP,源站最好只允许高防节点回源,其他IP一律在安全组里拒绝。
北京地域的BGP线路差异
北京机房多线路BGP接入在运营商互联上表现稳定,但也要注意晚高峰的跨网回源延迟,如果源站在北京,高防节点在其他城市,回源延迟会增加,每天巡检时用ping或mtr记录回源延迟变化,波动超过30ms就要关注,很多运维在比较高防服务器租用价格一个月多少钱时,只盯着防护峰值,却忽略了监控告警是否单独收费,北京地域的高防套餐,部分服务商把实时告警、日志查询放在增值服务里,签约前要确认清楚。
每天巡检的操作路径与命令
巡检不能靠感觉,固定路径走一遍,十分钟就能完成。
控制台看板五分钟巡检
- 第1分钟:看攻击流量峰值和当前攻击状态
- 第2分钟:看清洗中流量是否接近带宽上限
- 第3分钟:看并发连接数和新建连接速率
- 第4分钟:看源站响应码和回源延迟
- 第5分钟:看黑洞状态和解封时间
命令行辅助检查
高防控制台之外,登录服务器自己验证一遍最稳妥,常用命令组合:
netstat -an | awk '/^tcp/ {print $6}' | sort | uniq -c | sort -rn
查看各类TCP连接状态分布,TIME_WAIT过多说明短连接频繁,SYN_RECV过多说明可能在遭受SYN Flood。
curl -I https://你的域名
检查业务入口真实返回码,绕过高防直接测源站则用curl -I --resolve 域名:443:源站IP https://域名。
iftop -i eth0 查看实时流量来源,没有安装的话用nload或bmon替代。
告警阈值设置参考
告警阈值不要照抄别人,根据业务基线调整,业内专家指出,阈值设置过低的告警疲劳比没有告警更危险,参考思路如下:
- 攻击流量峰值:高于日常峰值3倍时告警
- 清洗中流量:超过带宽上限70%时告警
- 并发连接数:高于日常同时段均值80%时告警
- 新建连接速率:高于日常均值10倍时告警
- 源站50x率:连续3分钟超过1%时告警
- 黑洞状态:发生即告警
常见误区和阈值设置参考
只看攻击流量,不看清洗丢包
有些运维看到攻击流量下来了就以为安全了,实际上高防设备在清洗过程中可能丢正常包,要同时观察清洗丢包率,尤其UDP业务对丢包极其敏感,清洗策略调得太严,正常玩家会大量掉线,反而比攻击更伤业务。
把正常业务波动当攻击
每逢大促或节假日流量上涨是正常的,不要一看到流量涨了就开清洗,先对照历史数据,如果攻击类型分布里没有异常,连接数增长和流量增长成正比,基本是正常业务,多数情况下,攻击流量增长和连接数增长是脱节的。
忽略黑洞状态的解封时间
黑洞一旦触发,业务全断,每天巡检最后看一眼黑洞状态和解封倒计时,如果防护IP被拉黑,需要提前通知运营做备用切换,部分机房支持秒级解封,但多数有冷却时间,把解封时间写进值班表,能避免业务长时间停摆。
Q&A:高防服务器日常运维指标常见问题
高防服务器日常运维要监控哪些指标?
最少要盯五个:攻击流量峰值、清洗中流量、业务并发连接数、源站响应码、黑洞状态,这五个覆盖攻击感知、清洗效果、业务质量、源站健康和封禁风险,十分钟内就能完成一轮巡检。
游戏高防服务器运维监控指标和网站高防有什么区别?
游戏高防更看重连接数和包速率,网站高防更看重HTTP状态码和回源质量,游戏协议以UDP和小包为主,流量可能不大但连接数极高,所以游戏高防的告警阈值要单独设置,不能直接沿用网站模板。
北京高防服务器运维注意事项里哪一项最容易被忽略?
回源延迟,北京地域多运营商接入环境下,晚高峰跨网回源延迟会波动,很多人只盯攻击流量,忽略了源站与高防节点之间的链路质量,回源延迟一旦超过业务容忍上限,即使攻击清洗正常,用户体验也会明显下降,以TCP三次握手为例,回源延迟增加30ms以上时,短连接业务的建立时间会明显拉长。
首发原创文章,作者:王坚,如若转载,请注明出处:https://idctop.com/article/654937.html




