将阿里云 Elasticsearch 或 OpenSearch 向量检索版中的数据接入 AI 搜索开放平台,构建企业专属知识库。知识库支持文档自动解析、文件导入和数据查询,并可在 Agentic Search 中基于知识库构建智能问答与检索应用。
创建知识库
登录AI搜索开放平台控制台。
在左侧导航栏单击知识库,进入知识库列表页,单击创建知识库。
配置以下参数:
基础信息
参数
说明
知识库名称
知识库的唯一名称,长度为 1~30 个字符,以字母开头,可包含小写字母、数字和下划线,不能与同一工作空间内的其他知识库名称重复。
描述
知识库的用途说明,最多 1024 个字符。
知识库引擎配置
参数
说明
引擎
知识库所使用的底层搜索引擎,可选:
阿里云 Elasticsearch
阿里云 OpenSearch向量检索版
网络类型
访问引擎的网络方式,默认为公网。
域名
引擎实例的访问地址。选择 Elasticsearch 时,填写实例的公网或 VPC 域名;选择 OpenSearch 向量检索版时,填写实例的公网访问地址。需要将 AI 搜索开放平台的 IP 加入引擎实例的白名单,具体 IP 以控制台提示为准。
鉴权信息
访问引擎的认证凭证。Elasticsearch 填写格式为
用户名:密码;OpenSearch 向量检索版填写 AccessKey。数据授权
勾选同意授权平台读取所选引擎中的数据,用于知识库的构建与检索。
文档处理配置
参数
说明
文件解析模型
文档内容解析所使用的服务,固定为 ops-document-analyze-002。该服务对表格、公式、图表等复杂元素的识别能力出色。处理 PDF 文件时,页数不超过 400 页。
文档切片
默认开启。开启后将文档按单句进行切片,适合需要精细粒度检索的场景。
图片内容解析
默认开启。开启后将对文档中的图片进行识别与理解,提升含图文档的检索质量。
理解增强
默认开启。启用文本增强、文档摘要与章节摘要功能,对文档内容进行语义理解增强,并自动生成文档摘要与各章节摘要,提升检索相关性与全局理解能力。
向量化模型
将文档内容嵌入为向量的模型。可选 text-embedding-v4 或 ops-qwen3-embedding-0.6b,需与引擎中的向量索引保持一致。
多模态向量化模型
用于处理文档中图片等多模态内容的向量化模型。可选 qwen3-vl-embedding 或 qwen3-vl-plus。
模型服务配置
参数
说明
API Key 配置
配置模型服务所需的 API Key、工作空间和连接域名。单击未配置按钮打开配置面板,选择工作空间、API-KEY 和连接域名(支持 VPC 和公网两种方式),确认后按钮变为已配置。
风险提示
勾选确认已阅读风险提示。
计费提示
此配置将产生 AI 搜索开放平台相关费用,需确认已了解计费方式和计费项。
参数配置完成后,单击确定完成知识库创建。创建成功后,知识库将出现在列表页中。
导入文件
知识库创建完成后,可通过文件导入功能将文档数据导入知识库。在知识库列表页,单击目标知识库操作列中的文件导入。
本地文件上传
支持以下两类文件的上传:
非结构化数据:支持 doc、docx、pdf、html、txt、ppt、pptx、xls、xlsx、mp4、avi、mkv、mov 格式,单个文件不超过 1 GB。
结构化数据:支持 JSON、EXCEL(UTF-8 编码)格式,单个文件不超过 1 GB。
从数据源上传(OSS)
支持从对象存储 OSS 导入文件。选择从数据源上传页签,配置 OSS 访问域名、OSS 路径和 OSS 存储空间(Bucket)。
数据查询
在知识库列表页,单击目标知识库操作列中的数据查询,查看已导入文件的处理详情。面板中展示以下信息:
概览统计:总文件数、解析成功数、总切片数、总向量数。
文件列表:每个文件的处理状态(成功/失败)、切片数、向量数、耗时,以及处理结果详情(支持展开查看切片内容)。支持按文件名搜索和分页浏览。
编辑知识库
在知识库列表页,单击目标知识库操作列中的编辑,可修改知识库的引擎配置、文档处理配置和模型服务配置。修改后可选择是否将变更应用于已处理的文档(勾选后将重新解析并建立索引,耗时较长)。
删除知识库
在知识库列表页,单击目标知识库操作列中的 ⋮ 图标,选择删除。在确认对话框中单击确定删除。删除后数据无法恢复。