Prometheus + Grafana 监控告警完全教程:把服务器和应用状态看得一清二楚

一、原理背景

系统上线后最怕「用户先发现挂了」。监控体系要解决两件事:采集指标可视化/告警。Prometheus + Grafana 是云原生时代最主流的组合:

  • Prometheus(普罗米修斯):负责拉取(pull)并存储时序指标。它定时去各个目标的 /metrics 接口抓取数据,存进自带的时序数据库(TSDB)。数据模型是「指标名 + 标签(labels)+ 时间戳 + 值」。
  • Exporter(采集器):把各种系统(Linux、MySQL、Redis、Nginx)的状态翻译成 Prometheus 能懂的指标。比如 node_exporter 暴露 CPU/内存/磁盘,mysqld_exporter 暴露数据库状态。
  • Grafana:负责画图与告警。它连上 Prometheus 当数据源,用 PromQL 查询,做出漂亮仪表盘,并可在阈值触发时发钉钉/飞书/邮件告警。

整体数据流:被监控对象 → exporter(/metrics) → Prometheus 抓取存储 → Grafana 查询展示/告警

二、分步操作

步骤 1:装 Prometheus(Docker 最简)

# prometheus.yml
global:
  scrape_interval

🔒 付费文档

支付 5 积分后即可解锁全部内容