针对搜索应用场景的数据摄入
注意
本页专门介绍针对搜索用例的数据摄取方法。如果您使用的是不同的用例,请参考数据摄取概述了解更多选项。
搜索用例通常侧重于通用内容,通常是文本密集型且没有时间戳的数据。这可以是知识库、网站内容、产品目录等数据。
一旦您决定了如何部署 Elastic,下一步就是将内容导入 Elasticsearch。您选择的摄取方法取决于您的内容存储在哪里以及您需要如何访问它。
有几种方法可以将数据摄取到 Elasticsearch 中用于搜索用例。根据您的需求选择一种或多种
- 原生 API 和语言客户端:使用 Elasticsearch REST API 或 Python、Java、Go 等语言的官方客户端直接索引任何 JSON 文档。
- 网页爬虫:从公共或私有网站摄取内容以使其可搜索。
- 企业连接器:使用预构建的连接器将来自 SharePoint、Confluence、Jira 等外部内容源以及 MongoDB 或 PostgreSQL 等数据库的数据同步到 Elasticsearch 中。
提示
如果您只是想进行快速测试,可以使用 UI 将示例数据加载到您的 Elasticsearch 集群中。
您可以使用 _bulk API 将数据添加到 Elasticsearch 索引中,支持任何 HTTP 客户端,包括 Elasticsearch 客户端库。
提示
要连接到 Elasticsearch Serverless 项目,您必须查找连接详细信息。
虽然 Elasticsearch API 可用于任何数据类型,但 Elastic 提供了针对特定用例优化摄取流程的专用工具。
您可以使用这些专用工具将通用内容添加到 Elasticsearch 索引中。
| 匹配文件类型 | 描述 | 注意 |
|---|---|---|
| Elastic Open Web Crawler | 以编程方式发现并索引来自网站和知识库的内容 | 抓取面向公众的网页内容或通过 HTTP 代理访问的内部站点 |
| 内容连接器 | 与数据库、云存储和业务应用程序等热门内容源的第三方集成 | 从一系列 Elastic 构建的连接器中进行选择,或使用 Elastic 连接器框架用 Python 构建您自己的连接器 |
| 文件上传 | 通过 UI 进行的一次性手动上传 | 适用于测试或极小规模的用例,但不建议用于生产工作流 |
您还可以在摄取时使用摄取管道转换和丰富您的内容。
Elastic UI 拥有一套用于创建和管理针对搜索用例优化的索引的工具。您还可以在此 UI 中管理您的摄取管道。在搜索用例的摄取管道中了解更多信息。