2026-06-11版本

更新时间:
复制 MD 格式

本文介绍20260611日发布的实时计算Flink版公测预览版本。

重要

VVR 11.8.0.preview.1为公测预览版本,根据阿里云预览版产品使用条款,不纳入SLA,仅供提前了解并测试相关功能,建议仅在开发测试环境中试用,待后续主版本发布后再正式用于生产环境。如在使用过程中遇到问题,请提交工单反馈。

概述

20260611日,实时计算Flink版同步发布平台侧与引擎侧升级。引擎侧同步发布新引擎版本VVR 11.8.0.preview.1(公测),重点推出PyFlink DataFrame API,面向Python用户提供更自然、更贴近数据科学开发习惯的实时数据处理接口;同步增强AI推理能力,AI Functionai_embed函数新增Fluss外部缓存能力,复用已计算的Embedding结果,减少重复模型调用和Token消耗。

引擎侧

本版本以PyFlink DataFrame API为核心,持续增强Python生态、AI Function、多模态数据处理与模型服务接入能力,为实时智能分析场景提供更完整的开发体验。

新增PyFlink DataFrame API:提供Python风格的数据处理抽象,支持通过链式调用组织数据读取、清洗、变换、聚合、分析与写出逻辑,降低Python用户使用Flink构建实时作业的门槛。

  • DataFrame数据处理

    • 支持Kafka、FileSystem(Parquet Format)和ODPSConnector。

    • 支持selectfilterwith_column(s)drop_column(s)rename_columnsmapmap_batchesdrop_nulldrop_nanfill_nullfill_nan等基础数据变换操作。

    • 支持sql方法,直接在DataFrame上执行SQL表达式,兼容Flink SQL语义。

    • 支持group_byaggjoinpipe等聚合、关联与管道式处理能力。

    • 支持collectlimitoffsetheaditer_rowsiter_batches等数据探查能力,便于开发调试阶段进行抽样与遍历。

    • 支持explain查看物理执行计划,支持通过schemacolumns查看字段元信息。

  • UDF框架

    • 支持Scalar Function。

    • 支持同步UDF与异步UDF两种模式。

    • 支持行式UDF和批式UDF,包括Arrow UDFPandas UDF。

    • 支持为批式UDF配置Batch Size和并发度,便于进行吞吐与延迟调优。

    • 支持自动类型推导,减少手动声明输入输出类型的样板代码。

  • AI Function与多模态处理:PyFlink DataFrame APIAI Function、多模态算子结合使用,在同一条DataFrame链路中完成数据处理与模型推理。

    • 支持自定义Model Provider、OpenAI Model Provider、Triton Model Provider、DashScope Model Provider。

    • 支持ai_classifyai_sentimentai_extractai_translateai_summarizeai_maskai_embedAI Function。

    • 支持tensorimage等多模态数据类型。

    • 支持detect_objectsdecode_imageencode_imageresize_image等多模态算子。

  • 作业配置:提供Python风格的便利配置接口,在代码中直接设置Flink作业配置(如并发度等常用参数),减少配置切换成本。

Flink AI服务

新增Flink AI服务(内置模型),开箱即用调用主流大模型:此前 AI Function 仅支持 BYOK(用户自带 API Key)模式调用模型,本期新增 Flink 托管的内置模型服务,无需配置 API-Key、Endpoint 或私网连接,在 CREATE MODEL 语句中指定 taskmodel 即可在 Flink SQL 作业和 Flink Agent 中调用。

  • 多模型覆盖:内置 qwen3.6-plus、qwen3.6-flash、qwen3.5-plus、qwen3.5-flash 等推理模型,以及 text-embedding-v4、qwen3-vl-embedding 等向量模型,覆盖文本生成、视觉理解、翻译、OCR、向量化等场景。

  • 阿里云内网直连:流量不出 VPC,相比 BYOK 模式的公网调用,延迟更低、稳定性更好,且省去 NAT 网关、EIP 等网络配置成本。

  • 按 Token 统一计费:账单合并在 Flink 账单中,无需在多个模型服务商之间分别结算。公测期间免费。

  • 全地域覆盖:支持华北、华东、华南、西南共 7 个中国内地地域,以及新加坡、东京、伦敦、法兰克福等海外地域,跨地域访问自动打通。

AI Function

  • ai_embed函数新增Fluss缓存支持:在全量回填(Backfill)、历史数据重放及实时增量处理链路中,相同文本可能被多次计算Embedding。ai_embed函数现支持以Fluss作为外部向量缓存层,调用Embedding模型前先按内容Key查询Fluss缓存:命中则直接返回向量结果并跳过模型推理;未命中则调用模型生成Embedding,并将结果异步写回Fluss。该能力可降低重复计算带来的Token消耗,提升历史数据处理和实时增量场景的整体效率。

Flink Agents

  • 支持使用百炼内置模型服务:Flink Agent支持直接调用大账号百炼提供的内置模型服务,无需自行配置模型服务EndpointAPI Key,即可在VVR作业中使用模型推理能力,降低模型接入门槛和运维复杂度。模型调用同时补充必要的统计标识参数,便于后续进行Token消耗统计与成本分析。