Prometheus 单实例在可靠性和数据保留周期上都存在先天不足。进程崩溃、磁盘故障、节点宕机都会导致监控数据丢失;本地 TSDB 的存储容量也决定了数据保留时间有限。当监控规模从几十个节点扩展到数千个、合规要求将数据保留周期从 15 天拉长到 1 年甚至更久时,就必须引入高可用和长期存储方案。
Prometheus 高可用方案对比
目前社区的主流方案各有侧重,选型时需要在复杂度、成本和功能之间做权衡:
| 方案 | 高可用 | 长期存储 | 全局视图 | 多租户 | 复杂度 | 适用规模 |
|---|---|---|---|---|---|---|
| 多副本部署 | 部分(数据重复) | 否 | 否 | 否 | 低 | 中小规模 |
| 联邦(Federation) | 部分 | 否 | 部分 | 否 | 中 | 中等规模 |
| Remote Write | 是(依赖远端) | 是 | 依赖远端 | 依赖远端 | 中 | 中大规模 |
| Thanos | 是 | 是(对象存储) | 是 | 否 | 高 | 大规模 |
| Cortex | 是 | 是 | 是 | 是 | 高 | 大规模/多租户 |
| Grafana Mimir | 是 | 是 | 是 | 是 | 高 | 大规模/多租户 |
2026/6/13大约 11 分钟
