AI数据湖服务(LAS)元数据为您提供统一的数据湖元数据中心,把您可以把数据湖里的数据对象(表、函数等)统一注册至 LAS 元数据中,在 LAS 元数据中进行统一的组织、管理、治理,让数据能被更容易地发现、理解、访问和跨引擎协同。
AI数据湖服务(LAS)元数据管理采用三层实体结构,即Catalog/Database/Table,每个租户下面有1个默认Catalog(默认名称为hive),您也可以创建其他Catalog,Catalog下面可以有多个数据库(Database),每个数据库下面可以创建多个数据表(Table)和自定义函数(Function)。
主要适用于元数据隔离的场景,比如不同的集群、业务单元、组织团队等,绑定不同的Catalog,不同Catalog元数据互不可见。
术语 | 概念说明 |
|---|---|
数据目录(Catalog) | 数据目录是元数据管理的顶层逻辑实体,用于按照层级结构组织数据库、数据表和函数等元数据资源。不同的数据目录之间相互隔离,可用于区分不同组织、业务,并进行独立的权限管控和数据管理 |
数据库 | 数据库是数据目录下的逻辑分组,用于进一步组织和管理数据表、函数等元数据对象。用户可以按照业务应用或数据用途创建数据库,实现更精细的数据分类与访问控制 |
数据表 | 数据表是用于存储和管理结构化或多模态数据的基本对象,由字段、数据类型、存储位置等信息组成。las Catalog 支持多种表类型,并支持计算引擎对数据表进行查询、写入和维护 |
函数 | 函数是注册并持久化在 Catalog 中的计算逻辑,当前支持 Hive UDF 函数,可在SQL 查询或数据处理任务中调用,用于实现数据转换、计算和处理,支持 EMR Spark 、Presto、运行 |
以下为您介绍在使用LAS Catalog 过程中的关键限制。
限制项 | 数值或范围 | 建议 |
|---|---|---|
单批返回分区最大数 | 200000 | 分批拉取分区列表,避免单次请求返回超大结果集。 |
表加密文件格式 | 仅支持 PARQUET | 建表时选择 PARQUET 格式后再开启表加密功能。 |
授权/回收请求列表上限 | 100 条/次 | 一次调用中请求列表的总长度最多 100 条,超出请拆分多次提交。 |
单条请求中的主体数量上限 | 20 个/条 | 一条请求中可包含的主体(用户/角色)最多 20 个,主体很多时按主体拆分为多条请求。 |
单主体一次授予权限上限 | 5000 条/主体/次 | 针对同一主体一次最多授予 5000 条权限点,超大权限集请分多次执行。 |