监控告警
顶有教育科技监控告警分类文章,覆盖 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践。当前分类共 11 篇文章,按发布时间从新到旧排列。
Grafana Dashboard 设计最佳实践:变量、告警、Dashboard as Code
系统讲解 Grafana Dashboard 的专业设计方法:模板变量(Template Variables)实现动态下钻、Panel 类型选择与 PromQL 实战(时序图/Stat/Gauge/Heatmap)、Dashboard 告警配置、使用 Grafonnet 和 Terraform 实现 Dashboard as Code、Grafana 数据源代理与权限管理的生产配置。
K8s 可观测性黄金法则:RED/USE 方法与 SLO 实战
系统讲解生产可观测性体系的方法论与实践:RED 方法(Rate/Error/Duration)面向用户服务监控、USE 方法(Utilization/Saturation/Error)面向基础设施资源监控、SLO(服务等级目标)设计与错误预算计算、Prometheus 中的 SLI 指标配置、AlertManager 基于错误预算的告警策略,帮助从"指标收集"升级到"面向 SLO 的可观测性体系"。
Loki 日志聚合实战:Promtail 采集、LogQL 查询与生产部署
系统讲解 Grafana Loki 日志系统的生产部署:Loki 架构与存储原理(标签索引 vs 全文索引)、Promtail 多场景日志采集配置(Kubernetes/文件/系统日志)、LogQL 查询语言从基础到进阶、Loki 日志告警配置、Loki 分布式部署与存储配置(S3/阿里云 OSS 后端)。
OpenTelemetry 分布式追踪实战:Jaeger 部署、链路分析与性能调优
系统讲解分布式追踪的原理与实战:OpenTelemetry SDK 埋点(Go/Java/Python)、Jaeger 分布式追踪系统部署与配置、Trace/Span/Context 核心概念、W3C TraceContext 传播标准、采样策略配置(尾部采样/概率采样)、通过 Jaeger UI 分析慢请求和依赖关系图,以及 OTEL Collector 收集转发配置。
Alertmanager 实战:告警路由、分组、静默与 PagerDuty/钉钉集成
深入讲解 Prometheus Alertmanager 的核心能力:路由树(route tree)将不同告警分发到不同接收者、告警分组(grouping)合并同类告警减少噪音、静默(silence)和抑制(inhibition)规则、与钉钉/飞书/PagerDuty 集成,以及告警升级策略的完整生产配置。
Prometheus 大规模优化:Recording Rules、Federation 与 Thanos 长期存储
系统讲解 Prometheus 大规模生产优化方案:Recording Rules 预计算高频 PromQL 提升查询性能、Federation 联邦架构跨集群聚合、Thanos 组件(Sidecar/Store/Query/Compactor)实现无限长期存储与全局查询、Prometheus 内存和存储调优参数配置。
OpenTelemetry 毕业后,运维该如何重新理解可观测性
CNCF 宣布 OpenTelemetry 毕业,本文面向运维学习者解释 traces、metrics、logs、Collector、OTLP 以及从传统监控迁移到可观测性的路径。
Prometheus 3 迁移清单:运维要关注哪些兼容性变化
Prometheus 3 带来若干不兼容变化,本文从运维角度整理 feature flags、scrape target、GOMEMLIMIT、GOMAXPROCS、规则和告警的迁移检查。
GPU 监控怎么做?DCGM Exporter、Prometheus 和 Grafana 运维入门
GPU 集群不能只靠 nvidia-smi 手工查看。本文解释 DCGM Exporter 如何暴露 GPU 指标,以及 Prometheus 告警和 Grafana 看板应该关注哪些数据。
OpenTelemetry GenAI 可观测性:LLM 调用慢到底慢在哪里?
OpenTelemetry 的 GenAI 语义约定正在标准化模型调用、token 使用、工具调用和延迟指标。本文解释 AI 应用运维如何建立观测体系。
Prometheus 告警疲劳怎么治理?从标签和分组开始
告警太多不是监控成熟,而是信号质量差。Prometheus 告警治理要从标签、分组、抑制和 Runbook 做起。
