接入高防后告警阈值按业务重新标定是必须做的第一步,否则默认阈值要么让攻击流量悄悄穿透、要么让正常业务频繁误报被打断。这句话是很多运维团队踩坑之后的真实总结,高防的默认防护参数是厂商根据机房全链路带宽和硬件能力设定的“通用值”,它只保证设备不被打死,不保证你的业务不受影响,下面这套按业务重标定的方法论,来自多个大型电商和游戏项目的实际落地经验,直接照着做就行。
高防接入后告警阈值不重设会出哪些事
先说最常见的两个局面,第一个是阈值设太高,攻击流量已经占满回源带宽或者把源站CPU打到80%,告警系统还在沉默,等业务彻底不可用才被外部监控发现,第二个是阈值设太低,稍微来一波秒杀流量或者搜索引擎爬虫高峰,告警就被触发,运维半夜爬起来看了一圈发现是虚惊一场。
告警阈值不是防御参数,是业务健康度的观测标尺。 它要在攻击真正影响到用户体验之前叫醒你,同时又要容忍正常的流量抖动。
行业共识认为,接入高防后的前72小时是事故高发期,这段时间如果告警阈值还沿用厂商默认值,大概率会出现两类误判:高频误报消耗运维精力和高防的智能封禁触发条件错杀正常IP,业内专家指出,高防厂商的默认阈值主要参考机房防护能力,不会针对单条业务的流量形状做适配。
高防告警阈值设置的三个核心参数重标定方法
高防后台的告警配置通常集中在“防护设置”和“告警通知”两个菜单,不同厂商(简米云、酷番云、华为云等)路径略有差异,但核心参数是通用的,重标定要围绕三个参数做组合,而不是单独调某一个。
QPS阈值不能按带宽换算要按业务入口算
很多人的习惯是把带宽阈值当成QPS阈值,这是错的,带宽反映的是字节量,QPS反映的是请求次数,两者的比例受资源大小和请求包体影响极大,一个图片站的平均请求体可能是50KB,一个API网关可能是2KB,同样的100Mbps带宽,前者每秒只能过200个请求,后者能过几千个。
重标定步骤:
- 在高防控制台找到“告警设置”→“QPS阈值”
- 先把阈值拉到当前业务峰值QPS的8倍作为基础值
- 观察一周,如果误报率超过30%,再往上抬0.5倍
- 如果攻击流量没有提前触发告警,就往下压0.3倍
这里的关键是取数源。不要看高防控制台的QPS曲线,要看源站Nginx或SLB的真实请求日志。 高防到源站之间有CDN或云WAF的话,看到的QPS还会被缓存命中率影响,以源站实际收到的请求数为准,加上20%左右的冗余量。
带宽阈值按回源带宽而不是防护带宽来定
高防的防护带宽通常远超实际业务带宽,比如你买了100G的防护包,业务日常只跑2Mbps,如果把告警阈值设在80G,攻击流量到4Gbps时才会触发告警,但你的源站带宽可能只有50Mbps,早就被打挂了。
告警阈值要按源站链路能承受的上限设定,不是按高防的防护上限。
实操路径:
- 登录高防控制台,找到“实例详情”或“防护设置”
- 记录“回源带宽”或“业务带宽”字段(有的厂商叫“转发带宽”)
- 将告警阈值设为该值的60%到70%
- 同时开启“回源流量突变”告警,这个参数在高防的“高级告警策略”里
举个例子:源站是10Mbps的云服务器,高防回源带宽也是10Mbps,那告警阈值设在6Mbps到7Mbps,攻击流量一旦超过这个值,说明回源链路已经开始拥塞,用户请求会在高防侧排队或超时,这时候告警的优先级不该是“通知你”,而是“立刻触发高防的策略联动”去拦截。
连接数阈值要根据建连速率而不是瞬时并发
TCP连接数告警比较容易出问题,瞬时并发连接数在秒杀场景下会突然打满,但业务是正常的,连接数的告警要看每秒新建连接数(CPS)和活跃连接数的比值。
建议的标定公式:
| 业务类型 | 活跃连接数基线 | 告警阈值建议 | 说明 |
|---|---|---|---|
| 电商秒杀/促销 | 平时峰值的2倍 | 峰值的2.5倍 | 秒杀期间连接数会短时激增,留出余量 |
| 游戏登录/长连接 | 在线人数的1.2倍 | 在线人数的1.8倍 | 长连接掉线重连会产生大量新建 |
重标定连接数阈值时,注意把高防的“源IP连接数限制”一起调了,否则告警还没触发,高防已经帮你把正常用户的连接给断了,这两个参数在一个页面,调的时候一起看。
高防封禁阈值调整后怎么验证告警阈值是否合理
光调完参数不验证等于白调。每一组阈值都要用真实流量验证一次,验证窗口放在业务低峰期。
构造模拟流量测试告警触发准确性
高防控制台一般都有“安全测试”或“防护模拟”功能,没有的话可以在低峰期手动压测,用压测工具(如wrk、ab、JMeter)向高防IP发送指定QPS的请求,分三档测试:
- 第一档:平时峰值的80%,确认不触发告警
- 第二档:告警阈值的100%,确认触发告警且通知时间在1分钟内
- 第三档:告警阈值的120%,确认触发告警且高防的防护策略(限速或封禁)开始介入
测试时要盯着源站的监控面板,看告警触发的时间和源站实际受影响的时差,理想状态下,告警应该在源站可用性下降之前发出,而不是之后。
验证告警通知渠道的可用性
高防支持电话、短信、邮件、钉钉/企微Webhook四种通知方式,重标定阈值后要逐一测试,实际测试中,电话和Webhook的触达率最高,短信在攻击时常有延迟,邮件基本只作为归档,不适合当紧急告警渠道。
有条件的建议按这个优先级配置:
- 电话通知(核心负责人)
- 钉钉/企微Webhook(运维群)
- 短信(备用)
- 邮件(日报汇总)
高防接入后与CDN、WAF联动时的告警阈值适配
这部分经常被忽略,但流量链路一复杂,单点阈值就不够用,现在不少业务是“高防→CDN→WAF→源站”的链路组网,每一跳都会影响流量特征。
具体的适配步骤:
前置CDN时把回源IP加白并调整源站限流阈值
高防前面挂了CDN之后,源站看到的IP全是CDN节点的IP,如果不加白名单,高防的CC防护会把这些回源IP当成攻击IP误封,告警阈值再准也没用。
操作路径:
- 在高防的“IP黑白名单”中,把CDN服务的回源IP段全部加入白名单
- 将高防的“CC防护模式”调整为“HTTP特征校验”而非“IP限频校验”
- 此时告警阈值只看CDN回源到高防的流量,不要和源站流量做对比
高防封禁阈值调整后需要同步修改WAF的Bot管理规则
高防的封禁和WAF的Bot管理会叠加,如果高防已经按业务重标定阈值并做了封禁,WAF那边还在拦截正常爬虫,业务侧看到的告警就是“高防没报警,WAF在报警”,两边的阈值对不上,排查问题时会很难定位。
建议把WAF的告警阈值比高防的告警阈值放宽一倍。
高防先报,WAF后报,高防负责大流量攻击的兜底,WAF负责应用层的精细化过滤,这个顺序不能反,否则WAF会扛不住大流量攻击直接挂掉。
高防IP价格与告警阈值配置的性价比权衡
部署高防时会发现不同价格档位的套餐,告警阈值可调范围也不同。低价位套餐的告警阈值调整范围很窄,有些只支持固定值的1到2倍之间调整,购买前需要重点确认这个限制。
业内专家指出,高防套餐的差价主要体现在防护带宽和规则引擎的灵活性上,告警阈值可配置范围对运维效率的影响被大多数人低估了,如果预算允许,选择支持自定义告警规则、支持多条件组合的套餐,比单纯加防护带宽更值。
选型时的判断标准:
- 单条自定义告警规则是否支持“QPS+带宽+连接数”的AND条件组合
- 阈值调整后生效时间是否在5分钟以内(有些平台是隔天生效)
- 是否支持按时间段自动切换阈值(比如晚上低峰期自动调低)
- 告警通知是否支持按级别分发到不同人
高防告警阈值分时间段自动调整策略
一个业务全天24小时的流量不可能是一条直线,按业务重新标定阈值必须包含时间段维度。
游戏业务的典型场景:晚上8点到11点是高峰,凌晨2点到6点是低谷,如果全天都用同一个告警阈值,凌晨的告警阈值设置过低会误报,设置太高会让夜间攻击漏报。
分时段的配置思路:
- 将一天分为三个窗口:高峰段(通常14:00-23:00)、平峰段(07:00-14:00)、低谷段(23:00-07:00)
- 高峰段阈值设为日均峰值的5倍
- 平峰段阈值设为日均峰值的2倍
- 低谷段阈值设为日均峰值的9倍
部分高防平台支持“定时策略”,可以实现自动切换,不支持的话,需要写一个脚本通过API调高防的告警阈值接口,每天定时执行两次,脚本要放在源站之外的机器上,避免源站挂了导致阈值没法切回来。
高防告警触发后的响应流程与阈值再校准
阈值重标定不是一次性的活儿,每次告警触发后都要复盘,根据复盘结果调整下一次的阈值。
建议的响应流程:
- 告警触发后,第一个动作不是看攻击详情,而是看源站的CPU、带宽、请求成功率曲线
- 如果源站指标没异常,说明阈值偏低,记录本次的误报值
- 如果源站已出现性能下降但业务未中断,说明阈值基本合理,记录攻击的峰值作为参考
- 如果源站已打挂,说明阈值偏高,下探一定比例
一周下来,把误报和漏报的次数统计一下,目标是把误报率控制在20%以内,漏报率控制在0,漏报是不能接受的,误报率只要不影响夜间休息,稍微高一点没关系,说明阈值处在相对安全的区间。
常见问题解答
高防接入后告警阈值应该设置为多少才不误报?
没有固定数值,需要先采集源站一周的真实访问数据,以业务峰值QPS的1.8倍、回源带宽的70%、活跃连接数的2倍作为初始参考值,再根据误报和漏报情况逐步微调,QPS类告警的调整步长建议控制在0.3倍。
高防的封禁阈值和告警阈值之间的合理差距是多少?
告警阈值应低于封禁阈值的20%到30%,如果封禁阈值是1000 QPS,告警阈值设在700到800 QPS,给运维留出人工介入的时间窗口,差距太大会导致告警频繁但封禁不触发,运维会产生“告警疲劳”而忽视真正的高危告警。
高防和CDN组网时,按哪一层的指标来设定告警阈值?
以高防的回源带宽和源站的请求日志为准,CDN层有缓存命中,QPS指标会被平滑掉,不适合作为阈值设定依据,要在高防控制台查看“回源统计”,在源站Nginx日志中统计PV和UV,两组数据做交叉校验后设定告警阈值。
首发原创文章,作者:王坚,如若转载,请注明出处:https://idctop.com/article/651590.html





