加载中

Elastic 机器学习数据帧分析概述

数据帧分析使您能够对数据执行不同的分析,并利用结果进行标注。通过这种方式,它提供了对数据的额外洞察。异常值检测可识别数据集中的异常数据点。回归在确定数据点之间的特定关系后,对您的数据进行预测。分类可预测数据集中给定数据点的类别或分类。推理使您能够持续地将训练好的机器学习模型应用于传入的数据。

该过程不会更改源索引,它会创建一个包含源数据副本和标注数据的新索引。您可以像处理任何其他数据集一样,对扩展了结果的数据进行切片和切块。阅读“数据帧分析作业的工作原理”以获取更多信息。

您可以使用“评估数据帧分析 API”针对已标注的数据集来评估数据帧分析的性能。这有助于您了解误差分布,并确定数据帧分析模型表现良好或不够可靠的节点。

请参阅“监督学习简介”以了解更多关于如何使用监督学习进行预测的信息。

数据帧分析类型 学习类型
异常值检测 无监督
回归 监督
分类 监督

Elastic 监督学习使您能够基于您提供的训练示例来训练机器学习模型。然后,您可以使用模型对新数据进行预测。本页面总结了训练、评估和部署模型的端到端工作流程。它简要概述了使用监督学习识别和实施解决方案所需的步骤。

监督学习的工作流程包含以下几个阶段

Supervised learning workflow

这些是迭代阶段,意味着在评估每个步骤后,您可能需要先进行调整,然后再继续下一步。

花点时间思考机器学习在何处能发挥最大影响力非常重要。考虑您拥有什么类型的数据以及它具有什么价值。您对数据了解得越深,就越能快速创建出能生成有用洞察的机器学习模型。您想在数据中发现什么样的模式?您想预测什么类型的值:类别还是数值?这些问题的答案将帮助您选择适合您用例的分析类型。

在确定问题后,考虑哪些机器学习功能最有可能帮助您解决它。监督学习需要一个包含已知值的数据集,模型可以在该数据集上进行训练。无监督学习(例如异常检测或异常值检测)则没有此要求。

Elastic Stack 提供以下几种监督学习类型

您已经定义了问题并选择了合适的分析类型。下一步是在 Elasticsearch 中生成一个与您的训练目标有明确关系的高质量数据集。如果您的数据还不在 Elasticsearch 中,那么这是您开发数据管道的阶段。如果您想了解更多关于如何将数据摄入到 Elasticsearch 中的信息,请参考“摄入节点文档”。

回归和分类是监督机器学习技术,因此您必须提供用于训练的标记数据集。这通常被称为“事实依据”(ground truth)。训练过程利用这些信息来识别数据特征与预测值之间的关系。它在模型评估中也起着至关重要的作用。

一个重要的要求是数据集必须足够大以训练模型。例如,如果您想训练一个分类模型来判断电子邮件是否为垃圾邮件,您需要一个包含每个可能类别中足够多数据点的标记数据集来训练模型。什么是“足够”取决于各种因素,例如问题的复杂性或您选择的机器学习解决方案。没有适合每个用例的确切数字;决定多少数据是可以接受的,是一个通常涉及迭代试验的启发式过程。

在训练模型之前,考虑对数据进行预处理。在实践中,预处理的类型取决于数据集的性质。预处理可以包括但不限于:减少冗余、降低偏差、应用标准和/或规范、数据标准化等。

回归和分类需要特定结构的源数据:二维表格数据结构。因此,您可能需要转换您的数据以创建一个可用作这些数据帧分析类型源的数据帧。

在您的数据准备好并转换为正确的格式后,就该训练模型了。训练是一个迭代过程——每次迭代之后都会进行一次评估,以查看模型的表现。

第一步是定义特征——即数据集中将用于训练模型的相关字段。默认情况下,所有支持类型的字段都会自动包含在回归和分类中。但是,您可以选择从流程中排除不相关的字段。这样做可以使大型数据集更易于管理,从而减少训练所需的计算资源和时间。

接下来,您必须定义如何将数据拆分为训练集和测试集。测试集不会用于训练模型;它用于评估模型的表现。没有适合所有用例的最佳百分比,这取决于数据量和您用于训练的时间。对于大型数据集,您可能需要从较低的训练百分比开始,以便在短时间内完成端到端的迭代。

在训练过程中,训练数据被送入学习算法。模型预测该值并将其与事实依据进行比较,然后对模型进行微调,以使预测更加准确。

模型训练完成后,您可以使用模型泛化误差来评估其对以前未见数据的预测效果。回归和分类分析还有其他评估类型,可提供关于训练性能的指标。当您对结果满意时,就可以部署模型了。否则,您可能需要调整训练配置,或考虑预处理和表示数据的替代方法。

您已经训练好了模型并对性能感到满意。最后一步是部署您训练好的模型并开始在新数据上使用它。

Elastic 机器学习功能“推理”(inference)使您能够通过将其用作摄入管道中的处理器、连续转换或搜索时的聚合,来对新数据进行预测。当新数据进入您的摄入管道,或者您使用推理聚合对数据运行搜索时,模型将被用于对数据进行推理并进行预测。

© . This website operates independently and is not affiliated with or endorsed by Elasticsearch B.V. All brand names, logos, and trademarks are the property of their respective owners.