Dataphin V5.4发布:拥有「最强大脑」的数据治理平台,究竟智能在哪儿?
关于Dataphin
Dataphin 是阿里巴巴十余年内部实践及方法论的产品化输出,为企业提供数据建设、治理、运营、消费的Data x AI全链路服务,深度适配湖仓一体架构,灵活兼容多云复杂环境,助力企业高效构建标准化数据资产体系,加速释放数据价值。
关于Dataphin V5.4
您是否曾设想,一个理想的数据平台应该是什么模样?
它应该足够强大,能轻松应对从API、FTP到各类数据源的复杂集成;它应该足够智能,能主动发现数据隐患并给出药方;它更应该足够贴心,让权限申请、资源监控、数据操作都像日常对话一样简单。
现在,这个理想的模样已清晰可见。
近日,Dataphin V5.4 正式登场,旨在成为您团队中无所不能拥有[最强大脑]的数据治理平台。 本次更新,我们围绕“集成、治理、安全、运维”四大核心场景,为您带来一系列重磅能力升级!
新版本重点特性详解及应用场景如下
特性1:API组件升级:新增支持多个签名函数以及支持自定义签名串
背景:
在 ToB/ToG 多场景 API 集成过程中,不同合作方的接口签名规则存在显著差异 —— 部分场景需特定加密算法保障数据安全,部分场景要求灵活配置参数分隔符、键值连接符以适配个性化签名格式,传统 API 组件固定的签名逻辑和有限的算法支持,难以满足多样化对接需求,导致用户在集成不同来源 API 时需额外开发适配代码,效率低下且易出错。
功能概览:
1. 支持自定义参数分隔符、建值连接符
2. 签名函数新增支持SHA1HEX、SHA256、SHA256HEX、SHA512HEX、HMAC_SHA512
3. 支持自定义签名串,通过“#{param}”方式引用参数,支持通过“@”可触发参数提示
特性2:FTP 组件升级:支持tar.gz 解压 、压缩包下文件筛选以及JSONL文件读取
背景:
在企业数据集成场景中,FTP 作为常用文件传输工具,常需处理 tar.gz、zip 等压缩包文件。过去 FTP 组件仅支持基础文件传输,缺乏压缩包直接解压能力,需用户额外手动处理;并且面对压缩包内海量文件时,无法精准筛选目标文件,导致数据处理效率低下;在文件类型上缺乏对JSONL 格式支持,一般需借助第三方工具转换,增加了数据集成的复杂度与成本。
功能概览:
1. 支持读取tar.gz压缩格式的文件
2. 当压缩格式为tar.gz、zip格式时,支持配置文件匹配规则筛选压缩包下的文件
3. 支持读取JSONL格式的文本数据,按行读取文本中的JSON数据
特性3:数据源扩展:离线集成、实时集成数据源扩展
背景:
为满足企业对国产化适配、数据库新版本及湖表流读的需求,扩展离线与实时集成数据源,新增并优化多类核心引擎支持。
功能概览:
1. 离线集成:输入输出组件支持Easysearch(国产化适配)、适配Hudi-1.0.2、人大金仓(国产化适配)特殊类型支持
2. 实时集成:来源端自持MySQL8.4.4(适配特殊语法)、PolarDB-MySQL(全新支持)、Hudi(全新支持,单湖表流读)
特性4:X-数据质量,智能分析质量问题并推荐整改建议
背景:
在数据治理的实际工作中,数据质量问题不仅影响数据的准确性和可信度,还直接影响业务分析和决策的可靠性。传统治理方式主要依赖人工异常排查,面对复杂的数据血缘关系和庞大的数据体量,难以及时发现质量缺陷、精准定位问题根因和高效完成整改,导致治理效率低下。
功能概览:
1. 问题分析,根因追溯:依托AI驱动自动分析数据质量异常,层层深入查找问题根因,实现质量问题的精准溯源定位。
2. 数据支撑,证据确凿:智能采样数据、解析数据血缘,构建问题分析证据链,为根因推断和决策提供有力数据依据。
3. 整改建议,报告闭环:基于根因分析和证据链,自动生成质量问题整改建议及影响评估,形成完整质量报告,实现治理流程闭环。
特性5:支持注册外部血缘关系
背景:
血缘关系是追溯数据来源、分析影响范围及资产价值的关键依据。当前大部分数据开发与治理平台的血缘关系仅支持基于任务自动解析或手动配置,无法覆盖外部系统的血缘信息,导致数据血缘存在断层。亟需实现外部系统血缘的批量导入和灵活配置,补全端(first mile ETL)到端(last mile BI)的血缘关系。
功能概览:
1. 支持通过OpenAPI注册表级、字段级血缘关系
2. 支持通过OpenAPI删除表级、字段级血缘关系
特性6:支持增删改的数据操作类API
场景:
在数字化转型和智能化升级的浪潮中,企业对数据驱动能力的需求日益增长。为了帮助企业更高效、安全地管理和利用数据,Dataphin 5.4 版本推出了全新的增删改 API 功能,让开发团队能够以更低的成本和更短的时间将数据库中的数据转化为可管理且安全的 API 接口。
● AI 编程与智能应用:快速为智能助手、自动化脚本或微服务提供结构化数据接口,简化API编程和数据应用中的数据接入工作,减少定制开发成本。支持实时或批量的数据读取/写回,确保数据访问的安全性和可追溯性。
● 数据集成与ETL:轻松构建用于数据迁移、同步或集成的增删改 API,实现不同系统间的数据流转。支持参数化查询与批量操作,简化定时任务与数据流水线的开发和维护,提高数据处理效率。
● 内部工具与业务中台:为后台管理系统、运营工具、BI 报表及移动端应用快速生成标准化的 CRUD 接口,缩短前后端联调周期。通过配置实现字段映射、输入校验与数据变换,提高一致性和安全性。
● 低代码/无代码与快速原型:非技术人员也能通过简单配置生成所需的数据 API,加速原型验证与业务流程自动化落地。自动生成详细的 API 文档、示例请求及返回结构定义,降低使用门槛。
借助 Dataphin 5.4 的新增删改 API 功能,企业可以更加高效地管理和利用数据资源,加速业务创新与发展,充分释放数据的价值。
功能概览:
1. 可视化创建:通过直观易用的界面,用户无需编写代码即可快速创建增删改 API,大大降低了技术门槛。
2. 参数校验与默认值填充:自动进行参数校验并填充默认值,确保数据的完整性和合法性。
3. 批量操作:支持单条和批量数据操作,性能更优,满足大规模数据处理需求。
4. 事务控制:灵活选择单事务、无事务或分批独立事务模式,保证数据的一致性和可靠性。
5. 错误处理与详细反馈:提供详尽的错误处理机制,支持部分成功和全部成功的选项,并返回具体的成功和失败记录,便于问题排查。
6. 性能优化:针对不同数据量和并发情况自动优化性能,如批量操作时自动调整 JDBC 连接设置。
7. 权限管理:支持 API 级别的权限申请,保障数据安全,目前暂不支持行级权限。
8. 多种数据源支持:兼容 MySQL、Oracle、Microsoft SQL Server 和 PostgreSQL 等主流数据库,满足多样化的企业需求。
特性7:行级权限支持申请
当前问题:
分析师在取数时发现,编写的SQL在执行后总是返回空数据。一番查找后,发现自己所查询的表命中了行级权限,系统自动添加了Where语句。在之前的版本中,分析师只能找管理员进行授权,无法自行申请。
功能概览:
1. 清晰可见:代码开发者能清晰知道自己所查询的哪张表开启了行级权限、命中什么行级权限规则;
2. 操作简便:支持用户一键申请字段权限+行级权限,也支持单独申请行级权限。
特性8:支持查看注册调度集群的资源消耗趋势
场景:
Dataphin支持通过注册调度集群连接其余网络中的数据源,从而避免任务调度需要跨网络传输数据。为了高效分配和管理任务资源,集群管理员期望可以看见整个集群和不同资源组的资源消耗趋势。
功能概览:
1. 界面配置:支持界面配置注册调度集群的Prometheus HTTP API和认证方式;
2. 灵活操作和指标丰富:支持将注册调度集群设置为默认展示集群,支持查看集群下不同资源组的资源消耗趋势。
--使用须知:需要提前在注册调度集群中安装Prometheus组件
Dataphin 将持续迭代技术深度与场景覆盖能力,更多精彩功能,敬请期待!