核心能力 · v2.10

六项核心能力
覆盖完整可观测性栈

从数据采集到异常识别,从可视化到智能排障,Netdata 将监控系统的所有关键环节融合为一个轻量级 Agent,无需搭建复杂的数据栈即可开箱即用。

实时指标流

200ms 延迟
cpu.user62.4%
cpu.system18.7%
mem.used68.3%
net.rx128 MB/s
实时

每秒级指标采集

传统监控系统的采集间隔通常为 30-60 秒,这意味着你只能看到"过去的过去"。Netdata 以每秒一次的频率采集所有指标,采样到上屏延迟低于 200ms,让 SRE 真正掌握瞬态变化,捕获瞬时尖刺与短时抖动。

  • 每条指标以 1 秒粒度保留原始数据,最长可保留数月
  • 新增指标自动发现并加入采集队列,无需人工干预
  • 采样、压缩、存储全在 Agent 本地完成,零外发开销
  • 支持 stream 协议将数据转发到 Netdata Cloud 或自建中心节点

采集器 · 800+

自动发现
system.cpu[OK]
system.ram[OK]
system.net[OK]
system.disk[OK]
docker.container[OK]
k8s.kubelet[OK]
mysql[OK]
postgres[OK]
redis[OK]
nginx[OK]
... 790 more[OK]
采集器

800+ 内置采集器,自动发现

从底层 CPU 微架构到上层应用进程,从云原生组件到数据库引擎,Netdata 内置超过 800 个采集器,覆盖了几乎所有主流技术栈。Agent 启动时自动扫描系统环境,识别已安装的组件并启用对应采集器,实现真正的零配置。

  • 覆盖系统、容器、编排、数据库、消息队列、Web 服务器、APM 等全栈
  • 支持 Prometheus exporter、StatsD、OpenTelemetry 协议接入自定义指标
  • 每条采集器独立线程,故障隔离,单点失败不影响整体采集
  • 支持 Python 与 Go 两种 SDK,自定义采集器开发门槛极低

机器学习异常引擎

训练 6h
anomaly_prob0.97
window60s
modeltrained
dimension112
机器学习

机器学习异常检测,告警噪声降低 90%

Netdata Agent 内置无监督机器学习引擎,为每条指标时间序列独立训练概率模型,识别正常行为基线。当系统行为偏离基线时,即时输出异常概率分数并触发告警,告警准确率远高于传统阈值法。

  • 基于 DLIB 概率峰值过阈算法,无需人工标注数据
  • 每节点本地训练,数据不出主机,符合数据驻留合规
  • 支持单变量与多变量联合异常检测
  • 异常分数与原始指标一同可视化,根因一目了然
netdata-assistant:~
> why did CPU spike at 03:14?
Analyzing 1,200+ metrics from 03:10 to 03:20...
[ROOT CAUSE] 03:14:22 - cron job "backup_full.sh"
triggered gzip process (pid 8231) consuming 92% CPU.
disk iowait peaked at 38% simultaneously.
[RELATED] MySQL slow queries +340%
[RELATED] nginx 5xx errors +12
[SUGGESTION] Move backup to off-peak hours.
AI 助手

AI 智能故障排查

Netdata Assistant 集成大语言模型,可直接对监控数据用自然语言提问:"昨晚为什么 CPU 飙升?"、"数据库的响应延迟为什么升高?"。AI 自动关联相关指标、日志与事件,生成可读的诊断报告。

  • 支持自然语言提问,无需学习查询语法
  • 自动跨指标关联,呈现根因链路
  • 提供可执行的修复建议,辅助决策而非替代决策
  • 所有查询在本地上下文中执行,数据不外发

仪表盘编排

拖拽编排
CPU OVERVIEW
MEM USAGE
NET I/O
DISK IOPS
仪表盘

可组合可视化仪表盘

内置 300+ 现成仪表盘模板,覆盖主流技术栈。支持拖拽式自定义,将任意指标组合到单一面板,快速构建业务全景视图。仪表盘可分享给团队成员或对外公开,助力协作排障。

  • 300+ 预置模板,涵盖 Linux、K8s、数据库、Web 服务器等
  • 支持变量、模板、deep-link,可构建交互式导航
  • 跨节点聚合视图,千节点集群一屏全览
  • 导出 PNG / CSV / JSON,便于纳入工单与汇报

告警路由

12 个渠道
email[OK]
slack[OK]
discord[OK]
pagerduty[OK]
webhook[OK]
teams[OK]
telegram[OK]
rocketchat[OK]
twilio[OK]
... 3 more[OK]
告警

智能告警,12+ 渠道分发

内置 100+ 预置告警规则,基于行业最佳实践。结合 ML 异常检测,告警准确率显著优于阈值法。支持告警路由、抑制、分组、升级等高级策略,与 Slack、PagerDuty、Discord、Teams、Webhook 等 12+ 通道无缝对接。

  • 支持 hysteresis、cooldown、flapping detection 等高级特性
  • 告警模板基于 Go template,可编程定制消息内容
  • 跨节点告警聚合,避免雪崩式通知
  • 与 Netdata Cloud 联动,支持跨节点根因关联
性能

极致轻量,单进程承担一切

Netdata Agent 采用 C 语言编写,资源占用极低。常驻内存约 30MB,CPU 占用通常低于 1%,可在树莓派、OpenWRT 路由器乃至工业控制器上长期运行,而不会拖累宿主业务。

极低 CPU 占用

常驻 CPU 占用通常低于 1%,即使在高负载下也不会影响业务进程调度。

内存约 30MB

常驻内存约 30MB,即使采集 1000+ 指标也能保持稳定,适合资源受限场景。

启动 < 3 秒

系统冷启动到首屏指标呈现小于 3 秒,容器秒级扩容即可同步可见。

无需外部依赖

无需数据库、无需消息队列、无需时序存储,所有指标本地存储,开箱即用。

对比

与传统监控方案对比

为什么全球开发者选择 Netdata 而非自建监控栈?以下是基于公开资料的客观对比。

能力维度 Netdata Prometheus + Grafana Datadog
采集粒度 每秒 15-60 秒 10-60 秒
部署难度 一条命令 需搭建 server + 多个 exporter Agent + 网络配置
内置采集器 800+ 约 200 (含 exporter) 700+ (集成)
ML 异常检测 原生内置 需额外组件 需 Watchdog 付费
本地存储 内置数据库 需部署 TSDB 仅云端
数据隐私 本地存储 本地存储 需上传云
开源协议 GPL v3 Apache 2.0 商业闭源
免费版成本 完全免费 完全免费 5 主机限制

对比数据基于各产品官方文档与公开评测,2026 年 8 月整理。

一分钟即可上线

体验所有功能,无需付费

所有核心能力 — 实时监控、ML 异常检测、AI 排查、仪表盘、告警 — 在开源版本中均完全开放,无功能限制、无主机数量限制。

查看使用场景