加载中

LLM 和智能体 AI 可观测性

尽管 LLM 拥有令人惊叹的变革潜力,但也带来了可靠性、性能和成本管理方面的复杂挑战。传统的监控工具需要具备升级的可观测性功能,以确保这些模型高效、有效地运行。为了确保您的 LLM 驱动型应用程序具备可靠性、高效性、成本效益且易于排查故障,Elastic 提供了一个强大的 LLM 可观测性框架,其中包括关键指标、日志和链路追踪,以及预配置的开箱即用仪表板,可深入洞察模型的提示词与响应、性能、使用情况和成本。Elastic 的端到端 LLM 可观测性通过以下方法实现

  • LLM API 的指标和日志摄取(通过 Elastic 集成
  • LLM 模型的 APM 链路追踪(通过 插桩
可用的 Agent 技能

有一个技能可用于帮助 AI 智能体处理此主题。

详细了解适用于 Elastic 的 Agent 技能

获取此技能

Elastic 的 LLM 集成现已支持最广泛采用的模型,包括 Anthropic、OpenAI 以及托管在 Amazon Bedrock 和 Google Vertex AI 上的各种模型。根据您选择的 LLM 提供商,下表显示了您可以收集的数据类型(日志或指标)。

LLM 或智能体 AI 平台 指标聚合 (Metrics) 日志
Amazon Bedrock
Amazon Bedrock AgentCore
Anthropic(指标 / 日志
Azure AI Foundry
Azure OpenAI
GCP Vertex AI
OpenAI 🚧

Elastic 为利用托管在 Amazon Bedrock、OpenAI、Azure OpenAI 和 GCP Vertex AI 上的 LLM 模型的应用程序提供专门的 OpenTelemetry 协议 (OTLP) 链路追踪,从而提供请求流的详细视图。此链路追踪功能可捕获关键洞察,包括所使用的具体模型、请求持续时间、遇到的错误、每个请求的 Token 消耗量以及提示词与响应之间的交互。APM 链路追踪非常适合进行故障排查,可让您在基于 LLM 的应用中精准、高效地定位问题发生的位置。

您可以使用以下任一 Elastic OpenTelemetry 发行版 (EDOT) 对应用程序进行插桩

EDOT 包含多种类型的 LLM 插桩。此 表格 列出了支持的技术。

请查看 这些说明,了解如何为您的 LLM 应用设置和收集 OpenTelemetry 数据。

对于优化由 Azure OpenAI 提供支持的客户支持系统的 SRE 团队而言,Elastic 的 Azure OpenAI 集成 提供了关键的洞察。他们可以快速识别哪些模型变体经历了更高的延迟或错误率,从而根据实时性能指标对模型部署做出更明智的决策,甚至决定切换服务商。

LLM performance and reliability

考虑一家利用 OpenAI 模型进行实时用户交互的企业。当遇到无法解释的延迟时,SRE 可以使用 OpenAI 链路追踪来剖析事务路径,识别某个特定的 API 调用或模型调用是否为瓶颈,并监控请求以查看用户与 LLM 之间的确切提示词和响应。

Troubleshoot OpenAI-powered applications

对于成本敏感的部署而言,敏锐地了解哪些 LLM 配置更具成本效益至关重要。Elastic 的仪表板预先配置为显示模型使用模式,有助于有效减少不必要的开支。您可以使用针对指标、日志和链路追踪的开箱即用仪表板。

LLM cost and usage concerns

借助 Elastic 的 Amazon Bedrock 护栏集成,SRE 可以迅速解决安全问题,例如验证某些用户交互是否引发了策略违规。Elastic 的可观测性日志阐明了护栏是否正确阻止了潜在有害的响应,从而增强了合规性保障。

Elastic Amazon Bedrock integration for Guardrails
© . This website operates independently and is not affiliated with or endorsed by Elasticsearch B.V. All brand names, logos, and trademarks are the property of their respective owners.