运维平台
运维平台是 HAP 私有部署版内置的一体化监控诊断系统,为私有化环境提供指标、日志、链路三大可观测性能力与智能告警,帮助运维团队集中掌握基础设施与中间件运行状态、快速定位问题。以零侵入方式接入被监控目标,不改动业务,保障数据不出内网。
功能一览
登录后进入「概览」,可一眼看到系统健康度、监控任务数与当前告警分布:

| 模块 | 能力 | 文档 |
|---|---|---|
| 概览 | 系统健康度、监控任务统计、活跃告警与近 24 小时告警动态 | 本页 |
| 资源监控 | 主机、MySQL / MongoDB / Redis / Kafka / Elasticsearch 中间件、Kubernetes 集群、Flink 的可视化面板 | 资源监控 |
| 告警 | 七类场景原生告警规则,内置降噪,多渠道通知 | 告警规则 |
| 日志 | 基于 Loki 的容器日志与 HAP 微服务结构化日志检索 | 日志查询 |
| 链路追踪 (仅集群部署) | 基于 Tempo 的分布式调用链分析(请求量 / 错误率 / 延迟 / 瀑布图)。单机部署不具备该能力,见下方说明 | 链路追踪 |
| 慢查询诊断 | MongoDB 慢查询自动分析与索引优化建议 | MongoDB 慢查询分析 |
Kubernetes 监控:平台在集群内即开箱可用,在集群外需装采集组件
运维平台以 K8s 形态部署时,自带的 Prometheus 直接采本集群(ENV_K8S_MONITOR_MODE=incluster),
经 ServiceAccount 自动发现,无需 Token 与 NodePort,装完即有数据。
平台在集群外(如单机部署)或要监控多个集群时,在被监控集群里装一套采集组件,
指标经 remote_write 推回平台——只要求该集群能出站访问平台。
见Kubernetes 集群监控。
链路追踪仅在集群部署下可用
单机(Docker Compose)部署不具备链路追踪能力,ops-tempo 不会产生链路数据,「调用链分析」页面为空属正常现象;
也因此单机场景无需为 Tempo 配置对象存储。链路能力需要业务侧通过 OTLP 上报,属于集群部署场景,
接入步骤见接入链路追踪。
开始部署:单机部署(Docker Compose) · 集群部署(Kubernetes),历次变更见版本说明。
所有被监控目标在 数据源 页面统一管理,资源监控与告警的可选类型均由已启用的数据源动态驱动。
技术架构
运维平台以 Prometheus + Grafana 为核心构建指标与可视化能力,并集成 Loki(日志聚合)、Tempo(分布式链路)、Grafana Alloy(统一采集代理),将指标、日志、链路汇聚到 Grafana 统一查询:

数据流向:
- 指标:node_exporter(主机)、各中间件 exporter、kube-state-metrics(K8s 对象)被 Prometheus 抓取存储。
- 日志