概述
运维平台是服务私有部署版本的一体化监控诊断系统,面向 HAP/HDP 私有化 环境提供 指标、日志、链路 三大可观测性能力与 智能告警。运维平台以旁路方式接入被监控目标,不改动业务系统,不采集业务数据,帮助运维团队在内网环境中统一查看基础设施、中间件、容器、Kubernetes 集群与业务微服务的运行状态。
运维平台重点解决以下问题:
- 统一监控入口:集中查看主机资源、中间件性能、Kubernetes 对象状态、Flink 运行状态与服务日志。
- 故障定位闭环:通过指标、日志、链路和慢查询诊断关联排查,减少在多套工具之间切换。
- 告警收敛:内置告警规则、状态降噪、通知渠道和告警历史,支持从异常发现到恢复确认的完整流程。
- 私有化交付:运维平台自身支持 Docker Compose 单机部署与 Kubernetes 集群部署,通常与被服务的 HAP/HDP 部署形态保持一致,数据默认保留在客户内网环境。
功能一览

| 模块 | 能力 | 文档 |
|---|---|---|
| 概览 | 系统健康度、监控任务统计、活跃告警与近 24 小时告警动态 | 本页 |
| 资源监控 | 主机、MySQL/MongoDB/Redis/Kafka/Elasticsearch 中间件、Kubernetes 集群、Flink 的可视化面板 | 资源监控 |
| 告警 | 七类场景原生告警规则,内置降噪,多渠道通知 | 告警规则 |
| 日志 | 基于 Loki 的容器日志与微服务结构化日志检索 | 日志查询 |
| 链路追踪(仅集群部署) | 基于 Tempo 的分布式调用链分析(请求量/错误率/延迟/瀑布图)。单机部署不具备该能力 | 链路追踪 |
| 慢查询诊断 | MongoDB 慢查询自动分析与索引优化建议 | MongoDB 慢查询分析 |
Kubernetes 监控:运维平台部署在 HAP/HDP Kubernetes 集群内时自动采集
运维平台以 Kubernetes 形态部署时,通常复用现有的 HAP/HDP Kubernetes 集群;此时自带的 Prometheus 直接采集该集群(ENV_K8S_MONITOR_MODE=incluster),
经 ServiceAccount 自动发现,无需 Token 与 NodePort,部署后自动采集数据。
运维平台未部署在目标 HAP/HDP Kubernetes 集群内(如运维平台为单机部署),或需要同时监控多个 Kubernetes 集群时,在每个被监控集群里部署一套采集组件,
指标经 remote_write 推回运维平台——只要求被监控集群能出站访问运维平台。
见 Kubernetes 集群监控。
技术架构
运维平台以 Prometheus + Grafana 为核心构建指标与可视化能力,并集成 Loki(日志聚合)、Tempo(分布式链路)、Grafana Alloy(统一采集代理),将指标、日志、链路汇聚到 Grafana 统一查询:

数据流向:
- 指标:node_exporter(主机)、各中间件 exporter、kube-state-metrics(Kubernetes 对象)被 Prometheus 抓取存储。
- 日志:容器 stdout 由 Alloy 采集、微服务日志由 serilog 直推,统一进入 Loki。
- 链路:应用通过 OTLP 上报到 Alloy,转发进 Tempo。
- 展示与告警:Grafana 统一读取上述数据源出图;运维平台自研告警子系统独立于 Grafana,按规则周期检查并多渠道通知。