加载中

数据集质量

数据集质量 (Data Set Quality) 页面提供了日志、指标、链路追踪和合成数据集的概述。您随后可以使用此信息来了解整体数据集质量,并查找包含错误解析文档的数据集。

要打开数据集质量 (Data Set Quality) 管理页面,请在导航菜单中找到它,或使用全局搜索栏

默认情况下,该页面仅显示日志数据集。要查看其他类型的数据集,请从类型 (Type) 菜单中进行选择。

拥有 viewer 角色的用户只能查看数据集质量 (Data Set Quality) 摘要。要查看活动数据集 (Active Data Sets) 和估计数据 (Estimated Data) 摘要,您需要拥有针对 logs-*-* 索引的 monitor 索引权限

数据集的质量取决于每个数据集中降级文档的百分比。数据集中的降级文档包含 _ignored 属性,因为其一个或多个字段在索引期间被忽略了。字段被忽略的原因有多种。例如,当 ignore_malformed 参数设置为 true 时,如果文档字段包含错误的数据类型,则格式错误的字段将被忽略,而文档的其余部分会被索引。

在数据集表格中,您可以找到每个数据集的信息,例如其命名空间、数据集上次处于活动状态的时间以及降级文档的百分比。降级文档的百分比根据以下等级决定了数据集的质量:

  • 良好 (Good icon):数据集中 0% 的文档降级。
  • 降级 (Degraded icon):数据集中大于 0% 且不超过 3% 的文档降级。
  • 差 (Poor icon):数据集中大于 3% 的文档降级。

打开特定数据集的详细信息将显示降级文档历史记录、数据集摘要以及其他有助于您确定是否需要调查任何问题的详细信息。

“数据集质量”页面提供了几种方法来帮助您调查问题。在数据集表格中,您可以打开数据集的详细信息页面、打开发送到 Discover 中失败存储 (failure store) 的失败文档(仅限 serverless),以及查看被忽略的字段。

为了帮助诊断摄取或映射问题,在摄取期间被拒绝的文档会被发送到一个名为失败存储 (failure store) 的专用数据流。在数据集质量 (Data Set Quality) 页面上,失败存储中有文档的数据流将在失败文档 (%) (Failed docs (%)) 列中显示一个百分比。失败文档百分比让您可以快速了解摄取过程中潜在问题的严重程度。

访问失败存储需要 read_failure_storeall 索引权限

选择特定数据流的失败文档 (%) (Failed docs (%)) 列中的百分比以打开 Discover,并查看发送到失败存储的原始文档。

要了解问题的持续性,请参考文档趋势 (Document trends) 以获取选定时间范围内失败文档的数量

  1. 从主表格中选择数据集名称。
  2. 选择文档趋势 (Document trends) 下方的失败文档 (Failed docs) 选项卡。

要帮助诊断导致问题的原因,请参考质量问题 (Quality issues) 以查看与您的文档相关的错误消息和失败类型

  1. 从数据集表格中选择一个数据集名称。
  2. 向下滚动到质量问题 (Quality issues)。
  3. 单击展开图标以打开有关文档失败原因的摘要。

要打开质量较差或降级的数据集的详细信息页面并查看被忽略的字段和失败的文档

  1. 从数据集表格中选择一个数据集名称。
  2. 向下滚动到质量问题 (Quality issues)。

质量问题 (Quality issues) 部分显示了已被忽略的字段、包含被忽略字段的文档数量、该字段最后一次被忽略的时间戳以及失败的文档(仅限 serverless)。

要使用 Discover 在单个日志中查找被忽略的字段

  1. 从“数据集质量”页面上,使用降级文档 (Degraded Docs) 列查找包含降级文档的数据集。
  2. 选择降级文档 (Degraded Docs) 列中的百分比,在 Discover 中打开该数据集。

Discover 中的文档 (Documents) 表格会自动进行筛选,以显示未被正确解析的文档。您会在未正确解析的文档旁边找到降级文档图标 (degraded document icon)。您也可以直接转到 Discover 并查找此图标,以找到未被正确解析的文档。

既然您已经知道哪些文档包含被忽略的字段,请仔细检查它们以找到问题的根源

  1. 操作 (actions) 列下,单击 expand icon 以打开文档详细信息。
  2. 选择JSON 选项卡。
  3. 向下滚动到 JSON 的末尾以找到 ignored_field_values

在这里,您将找到文档中的所有 _ignored 字段及其值,这应能为字段被忽略的原因提供一些线索。

© . This website operates independently and is not affiliated with or endorsed by Elasticsearch B.V. All brand names, logos, and trademarks are the property of their respective owners.