什么是湖流一体

更新时间:
复制 MD 格式

湖流一体是一种融合数据湖与实时流的新型数据架构理念。

湖流一体

image

传统湖仓与流处理的痛点

  • 存储孤岛:系统无法通过单一存储层同时满足实时性与低成本的需求

  • 架构复杂:Lambda 架构迫使开发团队维护两套完全独立的系统

  • 存储冗余:数据在不同系统间重复存储,导致存储资源与计算资源的双重消耗。

  • 查询割裂:无法获得统一的数据视图,不同的计算引擎和处理逻辑,极易产生数据语义歧义。

湖流一体的核心理念与价值

湖流一体是一种融合数据湖与实时流的新型数据架构理念,旨在打破传统批处理与流处理的边界,实现统一存储、统一元数据、统一访问下的实时与离线一体化数据处理。常用于解决数据湖数据时效性问题(如分钟级延迟提升至毫秒级),以及解决数据流 OLAP 分析的能力。

它通过将实时流式存储(Fluss)与基于 Paimon 的数据湖(由 DLF 统一管理元数据)进行深度集成,实现“一份数据,两种视图”,即在同一个逻辑表中,同时提供低延迟的实时数据访问和高吞吐的历史数据分析能力。

核心原理

  • 自动同步:Fluss 集群开启该功能后,系统自动创建 Flink 同步作业,将 Fluss 中的实时事件流持续写入至 Paimon 表。

  • 联合读取 (Union Read):Flink 查询引擎支持对同一张表发起查询时,自动合并来自 Fluss 的实时自 Paimon 的历史数据,按主键进行去重,对外呈现为一张完整、一致、最新的表。

  • 元数据统一:DLF 作为统一元数据服务,管理 Paimon 表的表结构、分区、权限等信息,确保数据可被多种计算引擎(如 Flink, Spark, Presto)无缝访问。

  • 数据共享:Fluss 与 Paimon 协同构建流批一体存储架构,Fluss 作为实时数据层,提供毫秒级延迟的热数据写入与访问能力;Paimon 作为历史数据层,承载长周期、高性价比的历史数据存储。两者数据相互共享,避免重复数据存储。

关键能力

  • 降低架构复杂度:消除传统“流批分离”带来的双链路开发、双份存储、双重运维成本。

  • 保障数据一致性:通过统一的数据模型和计算引擎,确保实时与离线分析结果的一致性。

  • 简化运维:提供端到端的监控面板,包含同步延迟、作业状态、健康分等指标,并集成一键启停、报警设置等运维入口。

  • 提升敏捷性:开发者无需关心底层数据物理位置,仅需关注业务逻辑,即可快速构建实时数仓、实时报表、AI 特征工程等场景。