管理ChatBI数据集

更新时间:
复制 MD 格式

ChatBI中进行交互式会话之前,需要通过数据集来圈定开展分析的数据范围。数据集可以是目标数据源中的数据表,也可以是本地文件。

准备工作

已在使用ChatBI功能的对应地域创建Serverless资源组

适用范围

  • 数据源类型的数据集,仅支持选择Hologres、MaxCompute、StarRocksMySQL类型的数据源。

  • 本地文件类型的数据集,仅支持xlsxlsxcsv格式,且最多上传10个文件,每个文件不超过1GB。

  • 数据源类型的数据集支持工作空间管理员和普通成员角色创建,普通成员可将DataWorks数据源引用为ChatBI数据集。

新建数据集

  1. 进入ChatBI功能入口。

    您需要先登录阿里云,然后通过浏览器访问ChatBI智能数据洞察页面。请根据您的DataWorks资源组、数据集等业务所在地域按需选择。

    华东1(杭州)ChatBI入口

    华东2(上海)ChatBI入口

    华南1(深圳)ChatBI入口

    华北2(北京)ChatBI入口

    西南1(成都)ChatBI入口

    华北3(张家口)ChatBI入口

    华北6(乌兰察布)ChatBI入口

    中国香港 ChatBI入口

    新加坡 ChatBI入口

    印度尼西亚(雅加达)ChatBI入口

    日本(东京)ChatBI入口

  2. 在页面左侧导航栏单击数据集,进入数据集页面,单击新建数据集

  3. 新建数据集页面,填写数据集相关信息:

    • 数据集类型为数据源

      参数

      描述

      基本信息

      名称

      自定义数据集名称。

      类型

      数据集类型,包括:

      • 数据源

      • 本地文件

      此处选择数据源类型。

      数据源类型

      数据源类型,包括:

      • Hologres

      • MaxCompute

      • StarRocks

      • MySQL

      数据源相关信息

      不同数据源配置参数有差异。

      Hologres为例,需要配置地域Hologres实例数据库名称

      资源组

      选择一个DataWorks Serverless资源组名称,用于在后续会话中使用该资源组访问数据源以进行数据查询。

      测试连通性

      测试目标DataWorks Serverless资源组和当前数据源之间的连通性。

      语义分析

      勾选开启语义分析后,新建或编辑数据集保存时,平台将自动创建或更新语义任务,对数据集中的数据表进行语义解析,从而在 ChatBI 会话中实现语义知识召回,提升问答准确度。

      说明

      仅支持MaxCompute数据源。

      选择目标表

      选择目标表

      配置完基本信息后,单击下一步,进入选择目标表步骤。

      待选择列表中选中目标数据表,单击image,将其添加至已选择列表中,表示将目标数据表加入当前数据集。

    • 数据集类型是本地文件

      参数

      描述

      基本信息

      名称

      自定义数据集名称。

      类型

      数据集类型,包括:

      • 数据源

      • 本地文件

      此处选择本地文件类型。

      上传本地文件

      上传本地文件时支持xlsxlsxcsv格式,最多上传10个文件,每个文件不超过1GB。

  4. 当完成数据集配置后,单击下一步进入数据洞察步骤,将自动开始对数据集进行扫描,获取数据取值特征,有助于提升会话过程中的分析准确性。

  5. 数据洞察可能耗时较久,您可以直接单击完成,后续可在数据集中查看。

查看数据集

  1. 在页面左侧导航栏单击数据集,进入数据集页面。

  2. 找到目标数据集卡片,单击进入数据集详情页。

    对于 MaxCompute 类型且已开启语义分析的数据集,数据集卡片上会展示语义解析状态,包含等待语义解析、语义解析中、语义解析完成、语义解析失败。

  3. 在数据集详情页中,顶部是数据集的基础信息(包括:类型、表/文件数量、创建者),左侧是表/文件列表,右侧是表/文件的基础信息和数据预览(可预览20条数据记录)。

查看语义分析结果

对于 MaxCompute 类型且已开启语义分析的数据集,进入数据集详情页后,可单击语义分析页签查看语义任务的运行情况和解析结果。

说明

语义分析页签仅在数据集同时满足以下两个条件时显示:数据集为 MaxCompute 数据源类型,且创建或编辑时已勾选开启语义分析

语义分析页签结构如下:

  • 状态栏(顶部):展示语义解析的当前状态和同步状态。语义解析状态包括语义解析中语义解析完成语义解析失败

  • 结果文件(左栏):列出语义解析产出的结果文件列表,包括索引文件(_index.json)和语义模型 YAML 文件。单击文件名可在右栏查看对应文件内容。

  • 内容查看器(右栏):展示当前选中文件的详细内容。对于语义模型 YAML 文件,内容查看器提供两种视图:

    • 语义图谱:以可视化图谱方式展示语义模型中的数据表和指标之间的关联关系,并显示数据表数量和指标数量等统计信息。

    • YAML 源码:展示语义模型 YAML 文件的原始内容,便于查阅模型中的字段定义、指标口径和业务说明。

您可以在语义分析页签中执行以下操作:

操作按钮

说明

重跑

重新触发语义解析任务。适用于数据集中的表结构发生变化、需要更新语义模型时使用。

刷新

刷新语义解析状态和结果文件列表。

下载

下载当前选中的语义模型 YAML 文件到本地。仅在语义解析完成后可用。

关于语义分析功能的详细说明(包括语义模型 YAML 结构详解、语义图谱的使用方式等),请参见Data Agent 语义分析

编辑数据集

  1. 在页面左侧导航栏单击数据集,进入数据集页面。

  2. 找到目标数据集卡片,您可以通过两种方式进入数据集编辑页。

    • 鼠标悬停在目标数据集卡片上,在卡片右上角单击image > 编辑

    • 单击目标数据集卡片,进入数据集详情页,在右上角单击编辑按钮。

  3. 修改数据集相关配置。相关参数解释同新建数据集

    说明

    编辑已有数据集配置时,类型、数据源类型不可修改。

  4. 当完成数据集编辑后,单击下一步进入数据洞察,重新对数据集中的数据进行数据洞察。

删除数据集

  1. 在页面左侧导航栏单击数据集,进入数据集页面。

  2. 鼠标悬停在目标数据集卡片上,在卡片右上角单击image > 删除。删除数据集后,相关联的会话和图表均无法正常显示数据。

后续步骤:基于数据集开始会话

  1. 您可以通过如下两种方式基于指定数据集开始会话。

    • 在页面左侧导航栏单击数据集,进入数据集页面。鼠标悬停在目标数据集卡片上,在卡片右上角单击image开始对话。

    • 在页面左侧导航栏单击新建会话,进入ChatBI会话窗口。然后在会话窗口中,单击选择数据集

  2. 进入会话页面,通过输入需求或问题后,即可开始数据分析。详情请参见ChatBI会话

    说明

    如果会话中使用了已开启语义分析的数据集,ChatBI 将在问答过程中自动进行语义知识召回,提升分析准确度。若数据集仍在语义解析中,您可以先开始提问,复杂问题建议在解析完成后再次提问以获得更准确的回答。