云原生计算基金会于8月3日公布Cortex安全审计结果。由Quarkslab执行的白盒审计共发现7个具有安全影响的问题,其中6个为中等级、1个为低等级,所有发现目前都已完成修复并通过验证。
Cortex是一套面向Prometheus和OpenTelemetry指标的长期、多租户、可扩展开源存储系统。它通常部署在Kubernetes或大型云环境中,集中保存多个团队和业务的监控数据,因此租户隔离与集群操作安全直接关系到监控数据的机密性、完整性和可用性。

审计重点放在租户边界
本次审计没有只检查单个接口或依赖版本,而是把租户边界和集群操作作为核心范围。审计人员评估不同租户的数据能否保持隔离,以及集群管理行为是否可能破坏服务可用性或数据完整性。
多租户监控系统的风险与普通单机数据库不同。同一套Cortex集群可能同时接收多个业务的指标,一旦租户标识、查询边界或内部通信处理不严谨,影响可能跨越团队甚至客户。
监控数据看似不如业务数据库敏感,但其中可能包含主机名、服务路径、错误模式、资源规模和部署时间。攻击者通过这些信息能够推断基础设施结构,因此租户隔离不只是防止数据混淆,也属于安全边界。
白盒审计覆盖静态与动态测试
两名Quarkslab审计人员在2026年春季开展检查。流程先从项目发现与威胁模型分析开始,再与维护者确认攻击面,随后进入代码审查、静态分析和动态测试。
白盒方式允许审计人员查看源代码与内部设计,不必只从外部接口猜测系统行为。这更适合分布式系统,因为不少风险隐藏在组件之间的信任关系、租户头传递、缓存和后台任务中。
审计还产出了定制项目文档、修复建议和未来安全开发建议。对开源项目而言,这类成果的价值不仅是关闭当前问题,还在于把威胁模型和安全检查方法留给后续版本维护。
7个安全问题已经完成验证修复
公开结果显示,7个发现中有6个被评为中等级,另有1个为低等级。CNCF公告没有把它们描述为正在被大规模利用的紧急漏洞,而是强调所有问题均已由审计方验证修复。
用户仍需主动升级到最新Cortex版本才能获得修复。开源项目上游合并补丁,并不会自动改变企业集群中正在运行的容器镜像,长期固定旧标签的部署尤其容易继续保留已知问题。
升级时应核对镜像摘要、Helm Chart或部署清单,而不是只查看控制台中显示的应用名称。私有镜像仓库、缓存代理和固定版本策略都可能让实际运行版本落后于上游。
监控系统本身也属于关键基础设施
Cortex经常承载大规模Prometheus指标,并为告警、容量规划和故障调查提供历史数据。系统一旦被破坏,不仅会丢失可观测性,还可能让攻击者隐藏异常指标,影响运维团队判断。
多租户环境还要防止单个租户通过高基数指标、超大查询或异常写入消耗共享资源。安全审计关注机密性与完整性之外,也把可用性纳入范围,符合监控平台作为生产基础设施的实际风险。
部署Cortex的团队需要继续限制管理接口访问,保护租户标识的生成链路,并为查询、写入和后台压缩设置资源边界。升级修复是基础动作,不能替代网络隔离和容量保护。
升级前要验证查询与存储兼容性
Cortex由多个分布式组件组成,生产升级不适合只替换一个镜像后立即结束。运维人员需要验证Distributor、Ingester、Querier、Store Gateway和Compactor等组件的版本兼容范围,并观察滚动升级期间的写入与查询状态。
升级后应检查租户查询边界、告警规则、对象存储访问、缓存命中率和压缩任务,同时确认Prometheus远程写入与OpenTelemetry链路没有出现拒绝或延迟异常。
此次审计完成并不代表Cortex以后不会再出现安全问题。它更重要的意义,是对多租户边界和集群操作进行了一次系统性外部检查,并把修复纳入最新版本。仍使用旧版本的团队需要把升级纳入近期维护计划。


