监控告警

顶有教育科技监控告警分类文章,覆盖 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践。当前分类共 11 篇文章,按发布时间从新到旧排列。

分类文章

返回全部文章

2026/7/22 · 监控告警 · 约 13 分钟

Grafana Dashboard 设计最佳实践:变量、告警、Dashboard as Code

系统讲解 Grafana Dashboard 的专业设计方法:模板变量(Template Variables)实现动态下钻、Panel 类型选择与 PromQL 实战(时序图/Stat/Gauge/Heatmap)、Dashboard 告警配置、使用 Grafonnet 和 Terraform 实现 Dashboard as Code、Grafana 数据源代理与权限管理的生产配置。

GrafanaDashboard监控PromQL可视化运维
2026/7/22 · 监控告警 · 约 14 分钟

K8s 可观测性黄金法则:RED/USE 方法与 SLO 实战

系统讲解生产可观测性体系的方法论与实践:RED 方法(Rate/Error/Duration)面向用户服务监控、USE 方法(Utilization/Saturation/Error)面向基础设施资源监控、SLO(服务等级目标)设计与错误预算计算、Prometheus 中的 SLI 指标配置、AlertManager 基于错误预算的告警策略,帮助从"指标收集"升级到"面向 SLO 的可观测性体系"。

SLO可观测性REDUSEPrometheusKubernetes监控告警
2026/7/22 · 监控告警 · 约 14 分钟

Loki 日志聚合实战:Promtail 采集、LogQL 查询与生产部署

系统讲解 Grafana Loki 日志系统的生产部署:Loki 架构与存储原理(标签索引 vs 全文索引)、Promtail 多场景日志采集配置(Kubernetes/文件/系统日志)、LogQL 查询语言从基础到进阶、Loki 日志告警配置、Loki 分布式部署与存储配置(S3/阿里云 OSS 后端)。

Loki日志LogQLPromtail可观测性监控Grafana
2026/7/22 · 监控告警 · 约 14 分钟

OpenTelemetry 分布式追踪实战:Jaeger 部署、链路分析与性能调优

系统讲解分布式追踪的原理与实战:OpenTelemetry SDK 埋点(Go/Java/Python)、Jaeger 分布式追踪系统部署与配置、Trace/Span/Context 核心概念、W3C TraceContext 传播标准、采样策略配置(尾部采样/概率采样)、通过 Jaeger UI 分析慢请求和依赖关系图,以及 OTEL Collector 收集转发配置。

OpenTelemetryJaeger分布式追踪可观测性OTEL链路追踪
2026/7/22 · 监控告警 · 约 13 分钟

Alertmanager 实战:告警路由、分组、静默与 PagerDuty/钉钉集成

深入讲解 Prometheus Alertmanager 的核心能力:路由树(route tree)将不同告警分发到不同接收者、告警分组(grouping)合并同类告警减少噪音、静默(silence)和抑制(inhibition)规则、与钉钉/飞书/PagerDuty 集成,以及告警升级策略的完整生产配置。

AlertmanagerPrometheus告警监控钉钉运维
2026/7/22 · 监控告警 · 约 14 分钟

Prometheus 大规模优化:Recording Rules、Federation 与 Thanos 长期存储

系统讲解 Prometheus 大规模生产优化方案:Recording Rules 预计算高频 PromQL 提升查询性能、Federation 联邦架构跨集群聚合、Thanos 组件(Sidecar/Store/Query/Compactor)实现无限长期存储与全局查询、Prometheus 内存和存储调优参数配置。

PrometheusThanosRecording Rules可观测性监控性能优化运维
2026/7/21 · 监控告警 · 9分钟阅读

OpenTelemetry 毕业后,运维该如何重新理解可观测性

CNCF 宣布 OpenTelemetry 毕业,本文面向运维学习者解释 traces、metrics、logs、Collector、OTLP 以及从传统监控迁移到可观测性的路径。

OpenTelemetry可观测性监控云原生
2026/7/21 · 监控告警 · 8分钟阅读

Prometheus 3 迁移清单:运维要关注哪些兼容性变化

Prometheus 3 带来若干不兼容变化,本文从运维角度整理 feature flags、scrape target、GOMEMLIMIT、GOMAXPROCS、规则和告警的迁移检查。

Prometheus 3监控迁移告警规则云原生运维
2026/7/20 · 监控告警 · 8分钟阅读

GPU 监控怎么做?DCGM Exporter、Prometheus 和 Grafana 运维入门

GPU 集群不能只靠 nvidia-smi 手工查看。本文解释 DCGM Exporter 如何暴露 GPU 指标,以及 Prometheus 告警和 Grafana 看板应该关注哪些数据。

DCGM ExporterGPU监控PrometheusGrafana
2026/7/18 · 监控告警 · 8分钟阅读

OpenTelemetry GenAI 可观测性:LLM 调用慢到底慢在哪里?

OpenTelemetry 的 GenAI 语义约定正在标准化模型调用、token 使用、工具调用和延迟指标。本文解释 AI 应用运维如何建立观测体系。

OpenTelemetryGenAILLM可观测性AI运维
2026/7/13 · 监控告警 · 7分钟阅读

Prometheus 告警疲劳怎么治理?从标签和分组开始

告警太多不是监控成熟,而是信号质量差。Prometheus 告警治理要从标签、分组、抑制和 Runbook 做起。

PrometheusAlertmanager告警治理SRE