加载中

创建错误计数阈值规则

创建错误计数阈值规则,以便在服务中的错误数量超过定义阈值时向您发出警报。可以为不同级别设置阈值规则:环境、服务、事务类型和事务名称。

Create rule for error count threshold alert

要创建错误计数阈值规则,您需要以下内容

此规则从 APM 索引设置中查询错误索引。默认值为 logs-apm*apm-*logs-*.otel-*。您无法针对每个规则覆盖这些索引。

本节中的步骤展示了如何使用 Alerts UI。您还可以直接从 Applications 内的任何页面创建错误计数阈值规则。单击 Alerts and rules 按钮,然后选择 Create error count rule。通过这种方式创建规则时,NameTags 字段将被预填充,但您仍然可以更改它们。

要创建您的错误计数阈值规则

  1. 在 Observability UI 中,转到 Alerts
  2. 警报页面中选择管理规则,然后选择创建规则
  3. 为您的规则输入名称,以及用于更精细报告的任何可选标签(如果不确定,请留空)。
  4. 从 APM 用例中选择 Error count threshold 规则类型。
  5. 选择适当的 ServiceEnvironmentError Grouping Key(或保留 ALL 以包含所有选项)。或者,您也可以选择 Use KQL Filter 并输入 KQL 表达式以限制规则的范围。
  6. Is Above 中输入错误阈值(默认为 25 个错误)。
  7. For the last 中定义要评估的时间段(默认为最近 5 分钟)。
  8. 选择如何按以下项对警报分组。每个唯一值都将创建一个警报。
  9. 定义检查规则的时间间隔(例如,每 1 分钟检查一次)。
  10. (可选)设置操作
  11. 保存您的规则。

您可以使用与第三方系统交互、写入日志或索引或发送用户通知的操作来扩展您的规则。您可以随时向规则添加操作。您可以在不添加操作的情况下创建规则,也可以为单个规则定义多个操作。

要向规则添加操作,您必须首先为该服务(例如电子邮件或外部事件管理系统)创建一个连接器,然后您可以将其用于不同的规则,每个规则都可以有其自己的操作频率。

当服务中的错误数量超过定义的阈值时,错误计数阈值警报会触发。由于某些错误比其他错误更重要,本指南将重点关注特定的错误组 ID。

在继续之前,请确定您要为其创建错误计数阈值规则的服务名称、环境名称和错误组 ID。

本指南将根据以下标准为错误组 ID 创建警报

  • 服务:{your_service.name}
  • 环境:{your_service.environment}
  • 错误分组键:{your_error.ID}
  • 最近五分钟内错误计数超过 25 个错误
  • service.nameservice.environment 对警报进行分组
  • 每 1 分钟检查一次
  • 通过电子邮件将警报发送给站点可靠性团队

Applications 中的任何页面,选择 Alerts and rulesCreate threshold ruleError count rule。更改警报的名称(如果需要),但不要编辑标签。

根据上述标准,定义以下规则详细信息

  • 服务{your_service.name}
  • 环境{your_service.environment}
  • Error Grouping Key: {your_error.ID}
  • Is above: 25 个错误
  • 最近: 5 分钟
  • 警报分组依据: service.name service.environment
  • 检查频率: 1 分钟

接下来,选择电子邮件连接器并点击创建连接器。填写所需详细信息:发件人、主机、端口等,然后选择保存

提供了一条默认消息作为警报的起点。您可以使用 Mustache 模板语法 ({{variable}}) 在检测到条件时将附加的警报值传递给操作。点击“添加变量”图标 添加变量 可以查看可用变量列表。

选择保存。警报已创建,现已处于活动状态!

© . This website operates independently and is not affiliated with or endorsed by Elasticsearch B.V. All brand names, logos, and trademarks are the property of their respective owners.