跳到主要内容

运维平台

运维平台是 HAP 私有部署版内置的一体化监控诊断系统,为私有化环境提供指标、日志、链路三大可观测性能力与智能告警,帮助运维团队集中掌握基础设施与中间件运行状态、快速定位问题。以零侵入方式接入被监控目标,不改动业务,保障数据不出内网。

功能一览

登录后进入「概览」,可一眼看到系统健康度、监控任务数与当前告警分布:

运维平台概览

模块能力文档
概览系统健康度、监控任务统计、活跃告警与近 24 小时告警动态本页
资源监控主机、MySQL / MongoDB / Redis / Kafka / Elasticsearch 中间件、Kubernetes 集群、Flink 的可视化面板资源监控
告警七类场景原生告警规则,内置降噪,多渠道通知告警规则
日志基于 Loki 的容器日志与 HAP 微服务结构化日志检索日志查询
链路追踪
(仅集群部署)
基于 Tempo 的分布式调用链分析(请求量 / 错误率 / 延迟 / 瀑布图)。单机部署不具备该能力,见下方说明链路追踪
慢查询诊断MongoDB 慢查询自动分析与索引优化建议MongoDB 慢查询分析
Kubernetes 监控:平台在集群内即开箱可用,在集群外需装采集组件

运维平台以 K8s 形态部署时,自带的 Prometheus 直接采本集群(ENV_K8S_MONITOR_MODE=incluster), 经 ServiceAccount 自动发现,无需 Token 与 NodePort,装完即有数据

平台在集群外(如单机部署)或要监控多个集群时,在被监控集群里装一套采集组件, 指标经 remote_write 推回平台——只要求该集群能出站访问平台。 见Kubernetes 集群监控

链路追踪仅在集群部署下可用

单机(Docker Compose)部署不具备链路追踪能力ops-tempo 不会产生链路数据,「调用链分析」页面为空属正常现象; 也因此单机场景无需为 Tempo 配置对象存储。链路能力需要业务侧通过 OTLP 上报,属于集群部署场景, 接入步骤见接入链路追踪

开始部署单机部署(Docker Compose) · 集群部署(Kubernetes),历次变更见版本说明

所有被监控目标在 数据源 页面统一管理,资源监控与告警的可选类型均由已启用的数据源动态驱动。

技术架构

运维平台以 Prometheus + Grafana 为核心构建指标与可视化能力,并集成 Loki(日志聚合)、Tempo(分布式链路)、Grafana Alloy(统一采集代理),将指标、日志、链路汇聚到 Grafana 统一查询:

监控架构

数据流向:

  • 指标:node_exporter(主机)、各中间件 exporter、kube-state-metrics(K8s 对象)被 Prometheus 抓取存储。
  • 日志:容器 stdout 由 Alloy 采集、HAP 微服务日志由 serilog 直推,统一进入 Loki。
  • 链路:应用通过 OTLP 上报到 Alloy,转发进 Tempo。
  • 展示与告警:Grafana 统一读取上述数据源出图;平台自研告警子系统独立于 Grafana,按规则周期检查并多渠道通知。

1.4.0 起所有组件合并为单一镜像 ops-allinone,各服务通过 ROLE 环境变量区分角色,只需拉取一个镜像即可部署,离线交付也只是一个文件。

组件版本

组件版本作用
Prometheus3.1.0指标采集与存储
Grafana12.2.1统一可视化界面
Loki3.5.8日志聚合与检索
Tempo2.9.0分布式链路存储
Grafana Alloy1.11.3统一可观测性采集(容器日志 / OTLP)
node_exporter1.8.2主机资源指标
kube-state-metrics2.10.1Kubernetes 集群对象状态
中间件 exporterkafka 1.6.0 / elasticsearch 1.5.0 / redis 1.44.0 / mysqld 0.15.1 / mongodb 0.42.0中间件性能指标
MongoDB4.4.28告警子系统自有存储(与被监控目标解耦)