Elastic 可观测性解决方案概述
Elastic 可观测性(Elastic Observability)提供了跨应用程序和基础设施的统一可观测性。它将日志、指标、应用程序追踪、用户体验数据等汇聚到一个单一的集成平台中。这种整合支持强大且互相关联的分析,使团队能够从发现问题快速、高效地过渡到理解其根本原因。通过利用 Elasticsearch 的搜索和分析功能,它能够提供系统行为的整体视图。
Elastic 可观测性采用 OpenTelemetry 等开放标准来实现灵活的数据收集,并通过分层存储提供可扩展且具成本效益的数据保留。
不熟悉 Elastic?请参考 Elastic 基础知识以了解 Elastic Stack、其组件以及您的部署选项。
将可观测性应用于各种场景,以提升运维感知能力和系统可靠性。
使用场景
- 日志监控与分析:集中化并分析来自任意来源的 PB 级日志数据。这支持快速搜索、使用 ES|QL 进行即席查询,以及通过预构建的仪表板进行可视化以诊断问题。
- 应用性能监控 (APM):获得应用程序性能的代码级可见性。通过借助对 OTel 的原生支持来收集和分析追踪数据,团队能够识别瓶颈、跟踪错误并优化最终用户体验。
- 基础设施监控:监控来自服务器、虚拟机、容器和无服务器(Serverless)环境的指标,提供 400 多个开箱即用的集成(包括 OpenTelemetry)。这为资源利用率和整体系统运行状况提供了深入的洞察。
- 利用 Streams 进行 AI 驱动的日志分析:将任何格式的原始日志直接摄取到单个端点,而无需复杂的代理管理或手动解析管道。Streams 利用 AI 自动动态解析、构建和分析日志数据。
- 数字体验监控
- 真实用户监控 (RUM):捕获并分析真实用户与 Web 应用程序交互的数据,以提升感知性能。
- 合成监控:主动模拟用户历程和 API 调用,以测试应用程序的可用性和功能。
- 可用性监控:持续检查服务和应用程序的状态以确保它们可用。
- LLM 可观测性:深入了解大语言模型 (LLM) 提示词和响应的性能、使用情况及成本。
- 事件响应与管理:通过关联来自多个源的数据来调查运维事件,从而加速根本原因分析和解决。
- 通用性能剖析 (Universal Profiling):无需对应用程序进行插桩即可深入了解系统性能并识别消耗资源的行代码,从而帮助提高 CPU 效率并降低云成本。
要开启您的可观测性之旅,请阅读 入门 指南,其中介绍了所有基本步骤以及指向宝贵资源的链接。您还可以浏览可观测性 快速入门指南。
Elastic 可观测性的核心是几个启用其各项功能的关键组件。
概念
可观测性的三大支柱是
OpenTelemetry:可观测性为 OpenTelemetry 提供顶级、生产级别的支持。这使组织能够使用供应商中立的插桩并在无需专有代理的情况下流式传输原生 OTel 数据,从而利用 OpenTelemetry 的 Elastic 发行版 (EDOT)。
AIOps 和 AI 助手:利用预测分析和基于 LLM 的 AI 助手来减少检测、调查和解决事件所需的时间。这包括零配置异常检测、模式分析,以及揭示关联性和根本原因的能力。
警报:允许您创建规则以检测复杂条件并执行操作。
案例 (Cases):案例使团队能够关注潜在问题、跟踪调查详情、分配任务并在解决方案上进行协作。
服务级别目标 (SLO):用于定义和监控服务可靠性的框架。Elastic 可观测性允许创建和跟踪 SLO,以确保您达到性能目标。
可观测性参考文档可在 Elastic 参考文档中找到。
您还可以浏览以下组件的参考文档
浏览最新的 可观测性发行说明以获取有关新功能、增强功能和修复程序的更多信息。