6.1 安全监控与日志管理


6.1 安全监控与日志管理

本节摘要:监控与日志是安全运营的感官:没有它们,入侵在进行时是无声的,事后是不可知的。本节定采集范围与保留策略,讲特征告警与行为基线的分工,给出把告警变成"值得看的信号"的治理方法。

没有日志的夜班最漫长

从第一章开篇那场凌晨告警继续推演:工程师想把存储桶权限事件的访问日志调出来,发现日志保留期只有七天——关键时段恰好被滚动覆盖。这个场景的教训值得写进任何运营规范的第一页:**日志的价值在事件之后才兑现,而事件发生的时间不由你选。**保留期不足的日志等于没有日志,采集不全的日志等于部分失明。

日志采集的第一原则是覆盖"控制面优先"。云上的控制面日志(谁在何时改了什么配置、授权了什么权限)价值高于一切——因为控制面操作是攻击者的"方向盘"(第一章术语),也是绝大多数云上入侵链条的必经之路。其次是身份日志(登录、提权、联邦凭证发放)、数据面关键路径(存储访问、数据库审计)与网络流日志。求全是不可能也是不必要的:按数据分级(第三章)决定采集深度,核心级数据的全链路必采,公开内容可以只采样。

保留期限的定法是"倒推法":从最坏场景倒推需要回溯多久。行业经验的参考系是——恶意活动的驻留期(从进入到被发现)常以月计,日志保留至少覆盖这个窗口再留余量;涉及合规审计义务的(第七章)按法条与合同要求定,通常以年计。保留策略还有个常被忽略的支点:日志自身要防篡改——攻击者得手后第一件事往往是清日志,所以日志要外送到独立账号或独立的只写存储,与生产环境权限隔离。

图 6-1:云上监控数据的采集与汇聚架构

图 6-1:云上监控数据的采集与汇聚架构

检测规则:特征与基线的分工

检测规则有两类,各有分工。特征规则匹配"已知的坏动作":已泄露凭据的使用、已列入黑名单的目标、已知攻击手法的指纹。优点是准、误报低;短板是只能抓见过的。行为基线走另一条路:先学出"正常长什么样"(某人通常在办公网工作时间用控制台看指标),再对偏离告警(同一账号凌晨在陌生地区导出了全量数据)。它能抓住没见过的新手法,代价是需要调优、初期误报多。

两类规则的实战配比:特征规则铺底(覆盖已知威胁与合规强制项),基线规则聚焦高价值身份(特权账号、服务身份)与高价值数据路径。一条经过实战检验的基线规则示例:"任一身份二十四小时内控制面操作量超过其历史峰值的十倍"——它同时覆盖误操作、凭据被盗后的批量侦察、内部人员异常三类情形。

告警治理:让信号配得上注意力

监控体系最容易死在告警泛滥:一天几千条未处理告警的系统,等于没有监控——人的注意力是运营域最稀缺的资源,告警治理的目标就是保卫它。三个动作:分级(影响面与置信度决定级别,高级别必须有人盯)、去重与关联(同一事件的十条原始告警聚成一条事件单)、上下文自动补全(告警自动附带身份信息、近期操作、资产分级,值班的人不用从零查起)。

治理的度量有两个方向:平均确认时长(告警发出到有人看)与告警有效率(真实事件占比)。有效率低于一成,说明规则需要一轮大扫除——把最吵的十条规则逐条问"上月它抓到了什么",答不上来的降级或关闭。监控体系的健康度,归根结底是"值班的人还信不信告警"。

采集清单:一张能落地的最低配表

理论讲完,给一张能直接抄走的最低配采集表。控制面层:全量采集(配置变更、授权变更、网络变更),保留一年以上——它是所有调查的骨架,投入优先级最高。身份层:登录、提权、凭证签发全采,特权身份的采集优先级最高。数据层:核心级与敏感级数据的访问全采,内部级采样,公开级不采。网络层:流日志采样采集、出口流量全量。应用层:审计日志与流水线卡点记录外送。每层都标注"采集方、去向、保留期、责任组"四要素,落成配置进 IaC——采集本身也要基线化,否则新资源上线忘开日志,监控就瞎一块。

这张表的隐藏价值在成本控制:日志存储是运营域最贵的开销之一,"按级采集"让成本随数据分级结构而非资产数量增长。审计被问"为什么这类日志没采"时,分级依据(3.1)就是答案——采集范围的每一次取舍都有出处,这本身就是问责留证的一部分。

一个检测规则设计的正反例

给"特征与基线"的分工配一组正反例。反例:团队为了抓"异常登录",给每个国家的每个时段硬编码允许规则,三个月后规则表两百行,出差同事天天被拦,真正的异地登录反而淹没在豁免里。这是用特征思路做基线的事——静态枚举"正常"注定追不上现实。正例:同样的目标,改为按身份学基线(该账号历史登录的国家、时段、设备指纹),偏离即告警再按风险分级处置——新员工出差一次就能自动扩写基线,规则表一行没加。

两者的分野可以总结成一句设计口诀:**能枚举穷尽的用特征(已知攻击指纹、黑名单、合规强制项),描述不了穷尽的用基线(人的行为、流量形态、调用模式)。**选错工具的特征规则会腐烂,选错工具的基线规则会误报——检测规则的设计功力就在这道选择题上。

会话示例:一条基线告警的初步检查

告警响了之后的第一步是快速定性,一段标准的检查会话长这样(以集中日志服务的通用查询风格为例):

# 告警:身份 svc-report 凌晨2:14 控制面操作量超基线20倍 $ logq query "身份=svc-report 时间>今日凌晨2:00 操作类型=控制面" 2:14 枚举存储位置列表 来源IP 203.0.113.7 陌生网段 2:15 读取桶 policy 配置 目标: order-exports 2:16 新建访问密钥 成功 ← 关键动作 # 追问一:这个来源IP历史上出现过吗 $ logq query "来源IP=203.0.113.7 时间>近90天" → 首次出现 # 追问二:新建的密钥后来用在哪 $ logq query "访问密钥=AK-NEW-77 时间>2:16" → 2:17起用于批量下载 order-exports # 初步定性:凭据疑似泄露 + 已发生数据面读取 → 高级别事件,转 6.2 流程

注意这段会话的三个专业习惯:每一步查询都带时间与身份条件(查询本身也是留痕);定性结论引用的是日志证据而不是直觉;转交响应流程时带走完整查询记录——6.2 的取证纪律会要求这些查询记录一并入证据库。日志体系的价值,就在这样的凌晨两点被兑现。

本节要点回顾

  • 监控的原料是日志,日志的生命在采集设计:控制面优先、保留期倒推于调查需要、外送防篡改、统一时间源,四条纪律缺一则取证断链。
  • 特征规则抓已知的坏,行为基线抓没见过的怪:能穷尽的用特征,穷不尽的用基线,选错工具的规则会腐烂或误报。
  • 告警治理保卫的是注意力:分级、关联、上下文补全三动作;有效率低于一成该大扫除而不是加人。
  • 采集按数据分级配比:成本随分级结构而非资产数量增长,每次取舍都要有出处。
  • 采集本身要基线化:新资源忘开日志,监控就瞎一块,采集配置进模板与漂移检测。

一个延伸之问:日志该保留多久

保留期是采集清单里最常被追问的参数,答案不是拍一个数,是三段推导。第一段看调查需要:从"事件发生"到"发现事件"的平均时延决定最低保留期——行业经验是入侵潜伏期常以月计,所以热日志至少保留九十天,控制面日志留一年以上。第二段看合同与法规:7.2 承诺客户的留存口径、7.1 点名的法定留存期,取最严者叠加。第三段看成本结构:热存储贵就分层——近三十天可随查,九十天内的转低频,超期归档冷存,销毁时间到自动清理并留痕。三段推导的结论写进采集基线的保留字段,审计问起"为什么是这个数",答案自带出处。顺带钉一个考点:保留期与 6.2 取证的"证据活着"直接挂钩,日志被滚动覆盖后的调查从第一步就是残局。

感官齐备之后,下一节进入实战:告警响了之后的那几个小时,流程怎么走,证据怎么保。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U