检测指标异常
您可以创建机器学习作业来检测和检查主机及 Kubernetes Pod 的内存使用情况和网络流量异常。
您可以对系统内存使用情况以及主机或 Pod 之间的入站和出站网络流量进行建模。您可以检测主机或 Pod 内存使用量的异常增长,以及异常高的入站或出站流量。
要创建用于检测指标异常的 ML 作业,您需要满足以下要求
- 对于 Observability 无服务器项目,需要 Editor 角色或更高权限才能创建机器学习作业。要了解详情,请参考 分配用户角色和权限。
- 指标异常检测不适用于 OpenTelemetry 主机。
创建一个机器学习作业以自动检测异常的内存使用情况和网络流量。
创建机器学习作业后,您将无法更改其设置。您可以稍后重新创建这些作业,但这会清除之前检测到的所有异常。
要打开 Infrastructure inventory,请在主菜单中找到 Infrastructure 或使用 全局搜索框。
点击页面顶部的 Anomaly detection 链接。
系统将提示您为 Hosts 或 Kubernetes Pods 创建机器学习作业。点击 Enable。
选择机器学习分析的开始日期。
机器学习作业会分析过去四周的数据,并持续运行。
选择分区字段。
注意默认情况下,会选中 Kubernetes 分区字段
kubernetes.namespace。通过分区,您可以为具有相似行为的不同数据组创建独立模型。例如,您可能希望为不同的机器类型或云可用区构建单独的模型,以便异常不会在不同组之间被赋予相同的权重。
默认情况下,机器学习作业会分析您的所有指标数据,结果会列在 Anomalies 选项卡下。您可以筛选此列表,仅查看您感兴趣的作业或指标。例如,您可以按作业名称和节点名称进行筛选,以查看该主机的特定异常检测作业。
点击 Enable jobs。
现在,您已准备好探索指标异常。点击 Anomalies。
- 在您的 Elastic Observability Serverless 项目中,转到 Infrastructure → Infrastructure inventory,然后点击页面顶部的 Anomaly detection 链接。
- 在 Hosts 或 Kubernetes Pods 下,点击 Enable 创建机器学习作业。
- 选择机器学习分析的开始日期。机器学习作业会分析过去四周的数据,并持续运行。
- 选择分区字段。通过分区,您可以为具有相似行为的不同数据组创建独立模型。例如,您可能希望为不同的机器类型或云可用区构建单独的模型,以便异常不会在不同组之间被赋予相同的权重。
- 默认情况下,机器学习作业会分析您的所有指标数据。您可以筛选此列表,仅查看您感兴趣的作业或指标。例如,您可以按作业名称和节点名称进行筛选,以查看该主机的特定异常检测作业。
- 点击 Enable jobs。
- 现在,您已准备好探索指标异常。点击 Anomalies。
Anomalies 表格列出了针对特定主机或 Kubernetes Pod 的每个单一指标异常检测作业。默认情况下,异常作业按时间排序,以显示最近的作业。
除了每个异常作业和节点名称之外,还会列出严重性评分等于或高于 50 的检测到的异常。这些评分表示在选定时间段内的“警告”或更高严重性级别。summary 值表示异常记录结果中指标的实际值与预期(“典型”)值之间的增长幅度。
要深入钻取并分析指标异常,请选择 Actions → Open in Anomaly Explorer 查看 Anomaly Explorer。您还可以选择 Actions → Show in Inventory 查看主机或 Kubernetes Pods Inventory 页面,并按特定指标进行筛选。
这些预定义的异常检测作业使用自定义规则。要在 Anomaly Explorer 中更新规则,请选择 Actions → Configure rules。这些更改仅对新结果生效。如果要将更改应用于现有结果,请克隆并重新运行该作业。
在 Infrastructure inventory 页面上,点击 Show history 以查看选定时间范围内的指标值。异常评分等于或高于 50 的检测到的异常会以红色高亮显示。要检查检测到的异常,请使用 Anomaly Explorer。