数据同步规则最佳实践,帮助您理解不同数据来源的同步机制、选择合适的同步周期,并解答常见问题。
概述
数据同步规则是阿里云百炼平台提供的自动化数据同步功能。通过创建同步规则,您可以将外部数据源(OSS、飞书、钉钉、语雀、SharePoint)中的文件和文档自动同步到百炼平台,无需手动上传。
每条同步规则包含以下核心要素:
同步类目:指定同步数据在百炼平台中的存储类目。
同步来源:数据来源类型(OSS、飞书、钉钉、语雀、SharePoint)。
来源凭证:访问数据源所需的认证信息(如 OSS 路径、飞书 App ID/Secret、钉钉应用凭证等)。
同步周期:数据自动同步的频率(一分钟、一小时、一天)。
关于如何创建同步规则的详细操作步骤,请参见数据连接 — 同步数据规则。
入口路径
同步数据规则功能位于文件连接器的文件管理页面中。按以下步骤进入同步规则创建页面:
访问百炼控制台 — 数据连接页面,查看已创建的数据连接器列表。

在数据连接列表中,找到目标文件连接器,点击卡片上的详情,进入文件管理页面。

在文件管理页面中,点击右上角的同步数据规则按钮,打开同步规则列表。

在弹出的同步规则列表对话框中,点击创建同步规则按钮,进入规则创建表单。

创建完成后,同步规则将显示在同步规则列表中。您可以在列表中启用、禁用或删除规则,也可以在文件管理页面查看已同步的文件。
同步机制说明
同步流程
同步规则按照配置的同步周期自动运行。每次同步执行时,系统会连接到指定的数据源,检查源路径下的文件状态,并将新增或更新的文件同步到百炼平台。
同步流程包含以下阶段:
连接:使用配置的凭证连接到数据源。
扫描:检查源路径下的文件列表,识别新增和更新的文件。
导入:将新增或更新的文件同步到百炼平台,并触发解析和向量化处理。
确认:同步完成后,可在文件管理页面查看同步结果。
同步的文件将作为独立副本存储在百炼平台的安全存储中,与原始数据没有关联。即使源文件被删除,百炼平台中的副本仍会保留,需手动删除。
各来源同步行为
不同同步来源在文件更新检测、同步范围和特殊限制方面存在差异:
同步来源 | 文件更新检测 | 同步范围 | 说明 |
OSS | 按同步周期检查指定路径,自动同步新增和更新的文件。 | 指定的 OSS 对象路径下的所有文件(目录或单个文件)。 | 基于阿里云服务关联角色(SLR)访问,无需配置 AccessKey。需为目标 Bucket 添加 |
飞书 | 按同步周期访问指定知识库/目录/文档,同步新增和更新的内容。 | 指定的飞书知识库、目录或文档。 | 需创建飞书自建应用并配置权限。不支持 MindNote 文档导出。 |
钉钉 | 按同步周期访问指定知识库/文件夹/文档,同步新增和更新的内容。 | 指定的钉钉知识库、文件夹或文档。 | 每次同步消耗钉钉 API 配额,建议提前评估配额。支持同步钉钉文档、表格和 AI 表格。 |
语雀 | 按同步周期访问指定 URL 列表,同步新增和更新的文档。 | 指定的语雀文档或知识库 URL。 | 支持配置文档权限等级筛选。仅支持公网版本语雀。 |
SharePoint | 按同步周期访问指定分享链接,同步新增和更新的文档。 | 指定的 SharePoint 文档或文件夹分享链接。 | 需注册 Azure AD 应用并配置权限。支持全球公有云和中国世纪互联云。 |
同步周期建议
同步周期决定了数据从来源同步到百炼平台的频率。选择合适的同步周期需要在数据实时性和资源消耗之间取得平衡:
同步周期 | 适用场景 | 优势 | 注意事项 |
一分钟 | 需要近实时更新的场景,如在线协作文档频繁变更。 | 数据更新延迟最低。 | 同步频率高,资源消耗较大。对于钉钉同步,会更快消耗 API 配额。 |
一小时(默认) | 大多数业务场景,数据变更频率适中。 | 兼顾数据实时性和资源消耗,适合绝大多数场景。 | 最长延迟 1 小时。 |
一天 | 数据变更频率低,如定期更新的文档或报告。 | 资源消耗最低,对 API 配额影响最小。 | 最长延迟 1 天,不适合需要及时更新的场景。 |
对于钉钉同步,每次同步会消耗钉钉开放平台 API 配额。同步频率越高,配额消耗越快。建议根据知识库中文档数量评估配额是否充足,并参考钉钉 API 调用数量说明进行估算。