使用场景

从机柜到边缘,每一个节点都不容忽视

Netdata 已被部署在全球数百万节点上,覆盖从裸机服务器到边缘设备的所有典型运维场景。以下是六个高频场景的部署范式与最佳实践。

概览

六大典型场景

无论你的基础设施规模是单台还是数千节点,Netdata 都能通过同一套 Agent 与 Cloud 形成统一的可观测性平面。

物理与虚拟服务器

对裸机、KVM、VMware、Proxmox 节点进行深度监控,捕获硬件层、虚拟化层、操作系统层的所有关键指标。

服务器

容器与编排

原生支持 Docker、containerd、Podman,集成 Kubernetes、Nomad、Docker Swarm 编排层,自动发现 Pod 资源。

云原生

数据库性能监控

覆盖 MySQL、PostgreSQL、MongoDB、Redis、Elasticsearch 等 40+ 数据库,呈现 QPS、慢查询、连接池等核心指标。

数据库

公有云基础设施

对接 AWS、GCP、Azure、阿里云、华为云的监控 API,将云平台资源与主机侧指标统一汇聚到同一面板。

应用性能 APM

通过 OpenTelemetry、StatsD 接入应用指标,支持 Java、Go、Python、Node.js、Rust 应用的分布式追踪与请求分析。

APM

边缘与 IoT 设备

资源占用极低,可部署到树莓派、边缘网关、工业控制器乃至 OpenWRT 路由器,实现端到端设备健康监控。

边缘 / IoT

服务器健康矩阵

全部正常
cpu.load.1m1.24
mem.available8.4 GB
disk.iops2,180
net.throughput340 Mb/s
temp.cpu62 °C
案例 01

物理服务器:从硬件到应用,一屏全览

一台 Linux 物理服务器上,从 BMC 硬件传感器到 systemd 服务进程,从内核态 TCP 栈到用户态业务进程,Netdata 提供端到端的实时指标。无需配置额外探针,Agent 启动后即可看到 1500+ 指标。

  • IPMI / Redfish 硬件传感器:温度、风扇、电源、电压
  • CPU 微架构指标:每核频率、C-state、缓存命中率、IPC
  • 内存:NUMA 节点、大页、swap、OOM 事件
  • 存储:多路径、IOPS 队列深度、文件系统延迟
  • 网络:TCP 重传、连接追踪表、网卡中断分布
  • 进程级:cgroup 资源画像、systemd 单元状态
kubectl:~
$ kubectl get pods -A | wc -l
142 pods running across 6 nodes
$ helm install netdata netdata/netdata
[OK] Netdata deployed to monitoring namespace
> auto-discovering pods ...
> attaching collectors to 142 pods
[OK] Dashboard: https://app.netdata.cloud/p/k8s-prod
[INFO] Streaming per-second metrics ...
案例 02

容器编排:K8s 集群的全栈可观测

通过官方 Helm Chart,Netdata 可以 DaemonSet 形式部署到 Kubernetes 集群的每个节点,自动发现 Pod、Service、Deployment、DaemonSet、StatefulSet 资源,并采集 kubelet、kube-proxy、coredns、etcd 等控制面组件指标。

  • 支持 K8s 1.20+,原生集成 kubelet API 与 cAdvisor
  • 自动关联 Pod / Container / Namespace 标签
  • 支持 Helm / kustomize / manifest 三种部署方式
  • 提供 Pod 级 CPU / Mem / Net 限额使用率与超额预警
  • 对 etcd、API server、scheduler 提供专属仪表盘

MySQL · PostgreSQL · Redis

慢查询告警
mysql.qups3,420
mysql.slow_queries12 / min
pg.connections82 / 100
redis.hit_rate97.4%
replication.lag2 ms
案例 03

数据库:从慢查询到复制延迟,全维度透视

Netdata 内置 40+ 数据库采集器,覆盖 MySQL、MariaDB、PostgreSQL、MongoDB、Redis、Memcached、Elasticsearch、Cassandra、CockroachDB 等主流数据库。从连接池到查询性能,从主从复制到分片集群,所有关键指标实时呈现。

  • MySQL:QPS、TPS、慢查询、InnoDB 缓冲池、复制延迟
  • PostgreSQL:连接数、表膨胀、锁等待、WAL 写入
  • MongoDB:opcounters、复制集状态、shard 分布
  • Redis:命中率、内存碎片、持久化延迟、客户端连接
  • Elasticsearch:索引大小、查询延迟、节点健康

多云矩阵

5 家云厂商
aws.ec2.ap-east-1[OK] 28 nodes
aws.ec2.us-west-2[OK] 14 nodes
gcp.gce.asia-east1[OK] 9 nodes
azure.vm.chinaeast[OK] 5 nodes
aliyun.ecs.cn-hangzhou[OK] 22 nodes
huawei.ecs.cn-north-4[OK] 6 nodes
on-prem.kvm[OK] 4 nodes
TOTAL88 nodes
案例 04

公有云:跨云跨地域统一视图

当业务横跨多个云平台与地域,Netdata Cloud 提供统一聚合视图。每个云中的 Netdata Agent 本地采集后,通过加密 stream 协议将数据汇总到 Netdata Cloud,无需打通 VPC、无需公网暴露、无需复杂网络配置。

  • 支持 AWS、GCP、Azure、阿里云、华为云、腾讯云
  • 对接 CloudWatch / Stackdriver / Monitor API 补足 PaaS 指标
  • 跨节点聚合:同一指标多节点对比、同节点跨时间趋势
  • 支持按 region / az / tag 进行分组与下钻
  • 跨云告警,基于全局视角而非单节点
app-deploy:~
$ curl -X POST http://localhost:19999/api/v2/export
{"service":"checkout-api","version":"2.4.1"}
$ otel-cli span -n checkout-api
[OK] OpenTelemetry trace exported
> span_id: 7f3a92c4...
> duration: 142 ms (p99: 280 ms)
[OK] Correlated with system metrics
[INFO] Anomaly detected on db_query span
案例 05

应用性能:从请求到 SQL,全链路透视

通过 OpenTelemetry SDK 或 StatsD 协议,应用业务指标可与系统指标在同一面板呈现。配合 ML 异常检测,当业务请求耗时偏离基线时,自动关联同一时刻的 CPU、内存、数据库指标,快速锁定根因。

  • 支持 OTel / StatsD / Prometheus exporter / Graphite 多协议接入
  • 语言无关:Java、Go、Python、Node.js、Rust、PHP 均可集成
  • 自动关联应用指标与系统指标,根因链路一目了然
  • 支持自定义业务 KPI:订单量、转化率、API 调用量
  • 分布式追踪与主机指标时间轴对齐

边缘集群 · 2,400 节点

ARM64 · 30MB
node.beijing.001[OK]
node.beijing.002[OK]
node.shanghai.014[WARN]
node.guangzhou.088[OK]
node.shenzhen.120[OK]
avg.cpu3.2%
avg.mem28 MB
avg.uptime99.94%
案例 06

边缘 IoT:数千设备统一管理

Netdata Agent 在 ARM 设备上常驻内存仅 30MB,CPU 占用低于 1%,可长期部署到树莓派、工业网关、智能售货机、充电桩等边缘设备。配合 Netdata Cloud 的 fleet 视图,数千台设备一屏全览。

  • 支持 ARMv7、ARM64、RISC-V、x86_64 多架构
  • 断网自动缓存,网络恢复后回填历史数据
  • 边缘节点本地告警,云端聚合视图
  • 支持通过 MQTT / webhook 与 IoT 平台集成
  • 对温度、电源、传感器等硬件指标原生采集
你的场景

你的场景,我们都有标准答案

无论你的基础设施形态如何,Netdata 都能在一分钟内完成部署并开始采集。立即下载,亲身体验实时监控的极致细节。