在 Kubernetes 管理数百个微服务之后,你会发现传统的"监控"已经不够用了。一个请求从网关进入,经过 6 个服务、3 个中间件、2 次数据库调用,最后返回 500——问题出在哪?是网络抖动、数据库慢查询、还是某个 Pod OOM?如果没有一套完整的可观测性体系,排障就像在黑箱里摸象。本文系统梳理云原生可观测性的技术栈,从三大支柱到具体落地方案,帮你建立全局视角。
2026/6/13大约 12 分钟
在 Kubernetes 管理数百个微服务之后,你会发现传统的"监控"已经不够用了。一个请求从网关进入,经过 6 个服务、3 个中间件、2 次数据库调用,最后返回 500——问题出在哪?是网络抖动、数据库慢查询、还是某个 Pod OOM?如果没有一套完整的可观测性体系,排障就像在黑箱里摸象。本文系统梳理云原生可观测性的技术栈,从三大支柱到具体落地方案,帮你建立全局视角。
Grafana 是一个开源的数据可视化和监控平台,自 2014 年发布以来已成为云原生可观测性领域的事实标准。当前主流版本为 Grafana 11.x,其核心能力围绕「查询任何数据源、以任意方式可视化、在任何场景下告警」展开。
Grafana 通过插件化架构接入多种数据源,分为三类:
在云原生可观测性体系中,日志、指标、链路 tracing 构成三大支柱。Grafana Loki 作为日志聚合引擎,以"不索引日志正文"为核心设计哲学,将存储成本压到 Elasticsearch 的 1/5 到 1/10,同时与 Prometheus 标签体系完全对齐。本文深入解析 Loki 的架构设计、存储引擎、部署模式以及与 ELK 的对比选型。