MagicCube 数据门户 — 产品说明与使用指南 #
面向:数据分析师、业务人员、数据管理员 | 更新日期:2026 年 8 月
目录 #
一、产品简介 #
MagicCube 数据门户是一个统一的数据资产管理和自助取数平台。它把企业散落在各处的数据表、报表、指标、API 接口集中到一起,让业务人员可以方便地找到数据、理解数据、使用数据。
打个比方:如果数据是一座图书馆,MagicCube 就是图书馆的检索系统 + 借阅系统 + 新书推荐。
二、我能用这个系统做什么 #
| 我想…… | 在哪里做 | 怎么做 |
|---|---|---|
| 找一张数据表 | 数据地图 | 搜索关键词,按业务域/数据层筛选 |
| 了解一个指标的口径 | 指标中心 / 数据地图 | 点击指标卡片查看详细定义和计算逻辑 |
| 直接查数据 | 自助分析 | 选表 → 选字段 → 写查询 → 导出结果 |
| 申请某个表的访问权限 | 数据地图 | 点击「申请权限」按钮 |
| 提一个新指标需求 | 我的申请 | 填写指标需求表单,等待审批 |
| 可视化构建数据集 | 数据集构建器 | 拖拽关联多表 → 选字段 → 发布为数据集 |
| 管理所有数据资产 | 管理端-资产管理 | 编辑属性、打标签、同步元数据 |
| 追踪数据从哪来、到哪去 | 管理端-数据血缘 | 查看上下游依赖关系图 |
| 审批别人的权限申请 | 管理端-审批管理 | 查看待处理、通过或驳回 |
三、系统入口与角色 #
3.1 页面入口 #
| 页面 | 地址 | 面向角色 | 说明 |
|---|---|---|---|
| 用户端门户 | /portal/ |
所有用户 | 首页、数据地图、自助分析入口 |
| 自助分析 | /portal/self/ |
分析师 | 拖拽式查询分析独立页面 |
| 管理端门户 | /portal/admin/ |
管理员 | 资产管理、审批、血缘等管理功能 |
| 指标中心 | /portal/index/ |
数据开发/指标管理员 | 指标定义、维度、业务限定、生命周期 |
| 数据质量 | /portal/quality/ |
数据管理员 | 质量规则配置、检测大盘 |
| 数据安全 | /portal/security/ |
数据管理员 | 字段级脱敏、行级过滤规则 |
| 使用分析 | /portal/usage/ |
数据管理员 | 自助分析查询统计、资产使用监控 |
| 数据集构建器 | /portal/design/ |
分析师/管理员 | 可视化数据集设计 |
3.2 角色与权限说明 #
Portal 基于 OA 权限码体系控制访问,OA 不可用时回退到 Django Group 角色。
OA 权限码:
| 权限码 | 含义 | 可访问页面 |
|---|---|---|
data_map |
数据地图浏览 | 用户端首页、数据地图 |
data_analysis |
自助分析 | 自助分析页面、数据集构建器 |
data_manage |
数据管理 | 管理端资产管理、数据质量、数据安全、审批管理 |
metric_manage |
指标管理 | 指标中心、管理端部分功能 |
data_admin |
数据管理员 | 所有管理端页面、系统设置 |
Django Group 回退角色:
| 角色 | 权限 |
|---|---|
data_viewer |
浏览数据地图 |
data_analyst |
使用自助分析 |
asset_manager |
管理数据资产、审批、质量、安全 |
index_manager |
管理指标中心 |
- 普通用户:默认只能看到自己已授权的数据,如需更多数据需申请权限
- 数据管理员:可管理资产属性、审批申请、配置质量规则、配置脱敏规则
- 指标管理员:可创建和审核指标、管理维度和业务限定
- 系统管理员:拥有所有权限,可查看操作日志和系统设置
四、用户端使用指南 #
访问地址:
/portal/
4.1 首页概览 #
登录后首先看到首页,这里提供了数据平台的整体概览和常用入口。

页面上能看到什么:
| 区域 | 内容 | 说明 |
|---|---|---|
| 统计卡片 | 数据表数 / 指标数 / 业务域数 / 已授权数 | 了解平台整体规模和你的授权情况 |
| 热门指标 | Top 10 最近更新的指标 | 快速了解平台核心指标 |
| 业务域分布 | 各业务域的数据表数量 | 了解数据分布情况 |
| 快速入口 | 搜索数据 / 自助分析 / 我的申请 / 指标需求 | 一键跳转到常用功能 |
| 最近浏览 | 你最近查看过的数据表和指标 | 快速回到上下文 |
| 我的收藏 | 收藏的数据表和指标 | 常用数据一键可达 |
| 智能推荐 | 基于你的浏览和权限推荐相关数据 | 发现可能感兴趣的表和指标(AI 推荐) |
你可以做什么:
- 点击统计卡片或图表,跳转到对应的数据地图或指标中心
- 在顶部搜索框直接搜索表名、指标名
- 查看智能推荐,发现相关数据资产
- 点击右上角头像,进入个人设置或退出登录
4.2 数据地图 — 找数据 #
数据地图是找数据的核心入口,集成在用户端门户 /portal/ 中,支持多条件组合搜索和目录浏览。搜索范围覆盖数据表、指标、报表、数据集、API 等全部资产类型。
页面布局 #
- 左侧目录树:按业务域聚合展示数据表,点击业务域懒加载该域下的表
- 顶部搜索框:输入表名或指标名(支持模糊搜索)
- 筛选面板:按数据层、业务域、更新周期、安全等级、负责人、状态等筛选
- 结果区:卡片视图 / 表格视图切换
怎么搜索 #
- 输入关键词:在顶部搜索框输入表名或指标名(支持模糊搜索)
- 选择筛选条件(可多选组合):
- 数据层:原始数据层(ODS) / 明细数据层(DWD) / 汇总数据层(DWS) / 应用数据层(ADS) / 维度表(DIM)
- 业务域:如电商、金融、用户等
- 更新周期:实时 / 小时级 / 日级 / 周级 / 月级 / 手工
- 安全等级:L1 公开(绿色)/ L2 内部(蓝色)/ L3 敏感(橙色)/ L4 机密(红色)
- 负责人:输入姓名搜索
- 状态:上线 / 下线 / 草稿等
- 标签:按标签筛选(支持 AND / OR 逻辑切换)
- 切换类型:全部 / 仅数据表 / 仅指标 / 仅报表 / 仅数据集 / 仅 API
- 切换视图:卡片视图 / 表格视图
- 点击卡片查看详细信息
看懂搜索结果 #
每张卡片上会显示关键信息:
- 数据表卡片:表名、数据层标签、业务域、负责人、质量评分、最后更新时间
- 指标卡片:指标名、别名、类型(原子/派生/复合)、业务域、创建人、当前状态
权限状态 #
每张卡片右上角有权限状态图标:
| 图标 | 含义 | 你能做什么 |
|---|---|---|
| 🛡️ 绿色 | 已授权 | 可以直接在自助分析中使用 |
| ⏳ 黄色 | 审批中 | 请等待管理员审批 |
| 🔒 灰色 | 未授权 | 点击「申请权限」按钮提交申请 |
查看详情 #
点击卡片后弹出详情弹窗:
数据表详情包含:
- 基本信息:表名、数据层、业务域、负责人、安全等级、描述说明
- 字段列表:表中所有字段的名称、类型、说明(支持搜索)
- 样例数据:有权限时可预览部分数据
- 血缘关系:这张表的数据从哪些表来、被哪些表使用
- 关联指标:基于该表定义的原子/派生指标
- 评价与反馈:查看其他用户对该表的评价、点赞/点踩、评论,可提交自己的评价和投票
- 操作:收藏、申请权限、复制表名
指标详情包含:
- 指标说明:名称、别名、类型、业务域、创建人、业务说明
- 口径定义:聚合方式、数据来源、计算逻辑、SQL 表达式(可一键复制)
- 生命周期:当前状态(草稿/上线/下线/变更中等)
- 使用方式:当前权限状态、关联的数据表、派生指标列表
申请权限 #
对于未授权的数据表或指标:
- 点击卡片上的「申请权限」按钮
- 填写申请原因(如:用于月度经营分析报表)
- 选择申请有效期(如需要)
- 提交后可在「我的申请」中查看进度
4.3 自助分析 — 查数据 #
访问地址:
/portal/self/
自助分析提供可视化拖拽式查询,不需要写 SQL 就能分析已授权的数据表、数据集和指标。
入口与界面 #
- 顶部「我的表」标签:查看并选择已授权的数据表/数据集
- 点击任意表卡片或指标卡片进入分析面板
- 面板左侧为字段列表,右侧为配置区,下方为结果区
- 可点击配置区顶部按钮折叠左侧配置,聚焦结果表格
配置一次查询 #
1. 选择分析对象
- 在「我的表」中点击数据表或数据集卡片
- 左侧字段列表会展示该表所有字段及类型
- 可直接拖拽字段到维度、度量、筛选、排序区域
2. 拖拽配置
| 区域 | 作用 | 示例 |
|---|---|---|
| 维度 | GROUP BY 字段,按哪些维度看数据 | 日期、地区、商品类目 |
| 列维度 | 透视表行转列的维度 | 把「月份」值展开到列上 |
| 度量 | 聚合计算 | SUM(金额)、COUNT(订单数)、AVG(单价) |
| 筛选 | WHERE 条件 | 日期 >= ‘2026-01-01’、状态 = ‘已支付’ |
| 排序 | ORDER BY | 按金额降序 |
| 计算字段 | 自定义 SQL 表达式作为新字段 | amount * 0.8 |
- 时间字段拖拽到维度时,可选择按年/年月/季度/月/日/周聚合
- 支持字段别名设置、字段搜索、类型筛选
3. 执行查询
- 配置完成后点击「执行查询」
- 结果区默认以表格展示,可切换到图表视图
- 点击「查看 SQL」可查看系统自动生成的查询语句
结果区功能 #
结果表格
- 显示查询结果,支持分页浏览
- 点击表头可进行排序(部分场景)
- 右键/下拉表头可对数值列进行累计求和等快速分析
- 字段选择:可控制显示/隐藏哪些列,并拖拽调整列顺序
- 搜索:在结果中按关键字全局搜索
本地分析模式
- 默认每次只加载一页数据(如 50 条),保持页面响应速度
- 当触发下载、数据加工、累计求和等操作时,如果服务端数据超过当前页且不足 5000 条,系统会自动加载最多 5000 条数据,切换为「本地分析」模式
- 本地分析模式下,分页、筛选、加工都在已加载的 5000 条内进行
- 结果区会显示「本地分析」徽章和当前加载条数提示
图表与透视
- 切换到图表视图,可生成折线图、柱状图等
- 配置列维度后可生成透视表
数据加工 #
对查询结果可追加前端加工规则,生成新的显示列:
| 加工类型 | 常用功能 |
|---|---|
| 文本处理 | 去除空格、转大小写、截取、替换、正则提取、多列拼接 |
| 数值处理 | 绝对值、四舍五入、占比、增长率、空值替换 |
| 日期处理 | 取年/月/日/季度、日期差 |
| 分类分段 | 等宽分段、自定义分段、TOP N 归类、条件分组 |
| 排名累计 | 排名、累计求和、行求和、行差值、累计占比 |
| 格式显示 | 百分比显示、千分位数字、趋势箭头、趋势标签、增长率箭头、红绿灯标签、阈值标签 |
加工规则支持串联:例如先计算「累计占比」,再对该列做「百分比格式化(值)」显示为 15.38%。
保存与加载查询 #
- 点击「保存查询」可将当前分析配置(维度、度量、筛选、排序、计算字段、结果加工规则、显示列顺序等)保存到「我的查询」
- 在「我的查询」标签页或分析面板内的「加载查询」弹窗中,可快速恢复已保存的配置
- 保存时支持选择分类和共享范围(私有 / 同表共享 / 全局公开)
- 导入 / 导出:支持将保存的查询配置导出为 JSON 文件,也可从 JSON 文件导入查询配置,方便跨环境迁移和团队共享
导出结果 #
- 结果区上方提供「导出 CSV」和「导出 Excel」按钮
- 导出时会基于当前结果数据(本地分析模式下包含已加载的最多 5000 条)生成文件
- 如果配置了透视表,可导出透视结果
预测分析 #
对时间序列数据,可使用内置预测功能:
- 选择时间维度和目标数值字段
- 系统自动检测轴类型(时间轴 / 数值轴 / 隐式轴)并推荐合适的算法
- 支持多种预测算法,根据数据特征和可用库自动选择最优方案
- 设置预测步长(最多 12 期)
- 系统会在结果中追加预测列、置信区间和回测指标(MAPE、R²)
性能保护: 预测任务设有 30 秒超时、最多 5000 行数据、最多 50 个分组、最多 12 期预测的限制,防止资源耗尽。
数据集模式 #
除了直接查表,自助分析也支持基于数据集查询:
- 数据集由管理员在资产管理中预先配置,或通过数据集构建器可视化创建
- 支持文件数据集、API 数据集、数据库数据集、可视化构建数据集、流式数据等多种类型
- 数据集字段会映射为自助分析可用字段
注意:自助分析只展示你已授权的数据表和指标。如果你需要的表没有出现,请先到「数据地图」申请权限。
4.4 我的申请 #
这里查看你提交过的所有申请和指标需求。
权限申请记录 #
- 查看所有已提交的数据表/指标权限申请
- 每条记录显示:申请对象、申请时间、当前状态、审批人意见
- 状态说明:
- 已授权(绿色):审批通过,可以去自助分析中使用
- 申请中(黄色):等待管理员审批
- 已拒绝(红色):审批未通过,可查看拒绝原因
指标需求 #
如果你需要的指标还不存在,可以在这里提交需求:
需要填写的信息:
| 字段 | 是否必填 | 说明 |
|---|---|---|
| 指标英文名 | ✅ | 如 user_retention_rate |
| 指标中文名 | 可选 | 如「用户留存率」 |
| 业务背景 | ✅ | 为什么需要这个指标?用于什么分析场景? |
| 期望业务域 | 可选 | 属于哪个业务领域? |
| 计算逻辑 | ✅ | 你期望的计算口径是什么? |
| 用途说明 | 可选 | 主要用在哪些报表或分析中? |
| 期望来源表 | 可选 | 你认为应该从哪张表取数? |
| 优先级 | 可选 | 高 / 中 / 低 |
提交后,需求状态会经历:待处理 → 已接受 → 已完成(或「已拒绝」)
我发起的审批(数据管理员) #
如果你同时是数据管理员,这里也会展示需要你审批或你已处理的申请记录,方便统一查看进度。
4.5 数据集构建器 — 做数据 #
访问地址:
/portal/design/
数据集构建器提供可视化的拖拽式数据集设计能力,让分析师和数据管理员无需写 SQL 即可将多张数据表关联、加工、发布为可复用的数据集。
设计流程 #
- 选择数据源:从左侧已授权的数据表目录树中拖拽表到画布
- 配置关联:系统自动识别同名字段和外键模式(如
_id后缀),智能推荐 JOIN 条件 - 选择输出字段:为每张表勾选需要的字段,可设置别名
- 配置聚合:对输出字段可选择聚合函数(SUM / COUNT / COUNT_DISTINCT / AVG / MAX / MIN)或不聚合
- 添加衍生字段:通过自定义 SQL 表达式创建计算字段(如
price * quantity) - 配置筛选条件:支持 12 种操作符(=, !=, >, <, >=, <=, like, in, is_null, is_not_null 等)
- 预览:查看生成的 SQL 和预览数据
- 发布:将设计发布为数据集资产,自动保存 Schema 和 SQL
多步骤关联流 #
对于复杂的数据加工场景,支持多步骤 CTE(Common Table Expression)模式:
- 每个步骤是独立的一层关联配置
- 后续步骤可引用前序步骤的输出作为虚拟数据源
- 实现逐层加工、过滤、聚合的复杂数据流转
JOIN 智能推荐 #
- 自动分析表间共同字段名
- 检测外键模式(如
order.customer_id与customer.id) - 推荐合适的 JOIN 条件和关联类型
发布与复用 #
- 发布后的数据集会出现在资产管理的数据集列表中
- 可在自助分析中作为数据源使用
- 支持草稿、已发布、已归档三种状态管理
- 支持创建、加载、保存、发布、列表、删除等完整生命周期管理
五、管理端使用指南 #
访问地址:
/portal/admin/
管理端门户 /portal/admin/ 是数据管理员、指标管理员和系统管理员的工作台,包含资产管理、血缘、指标中心、数据质量、数据安全、审批管理、使用分析、物化视图和系统设置等模块。

5.1 资产管理 #
访问地址:
/portal/admin/
资产管理是管理员维护平台数据资产的核心工作台。进入页面后,左侧是资产目录树,右侧是数据大盘和资产列表。
数据大盘 #
页面顶部展示全局统计信息:
| 指标 | 说明 |
|---|---|
| 数据表总数 | 平台已注册的数据表总量 |
| 数据层分布 | 各层数据表占比(ODS/DWD/DWS/ADS/DIM) |
| 在线指标数 | 已上线的业务指标数量 |
| 业务域覆盖数 | 已配置业务域的表数量 |
| 标签数 | 活跃标签总数 |
| 质量评分 | 整体数据质量健康度 |
目录树 #
左侧按业务域聚合展示数据表:
- 点击业务域展开/收起该域下的表
- 表按已授权用户数优先排序,热门表更易找到
- 点击表名可查看详情和血缘
数据表管理 #
在「数据资产」页面通过顶部 Tab 切换管理四类资产:
| Tab | 管理内容 | 主要操作 |
|---|---|---|
| 数据表 | 所有数据表 | 编辑业务属性、打标签、同步元数据、预览数据、配置质量规则 |
| 报表 | BI 报表、图表、Excel 报表等 | 新增、编辑、删除、授权 |
| 数据集 | 文件数据集、API 数据集、数据库数据集、可视化构建数据集等 | 新增、编辑、删除 |
| API | 对外提供的 API 接口 | 新增、编辑、删除、配置返回字段 |
编辑数据表属性 #
点击操作列的「编辑」按钮可以修改:
| 属性 | 说明 |
|---|---|
| 业务域 | 该表属于哪个业务领域 |
| 业务主题 | 更细粒度的分类 |
| 业务负责人 | 对应的业务对接人 |
| 技术负责人 | 对应的技术开发 |
| 更新周期 | 实时 / 小时级 / 日级 / 周级 / 月级 / 手工 |
| 安全等级 | L1 公开 / L2 内部 / L3 敏感 / L4 机密 |
| 描述说明 | 表的业务含义和用途 |
| 是否活跃 | 是否仍在使用中 |
| 调度任务 | 关联的调度任务名称和 Cron 表达式 |
标签管理 #
点击操作列的「标签」按钮可以为数据表添加/移除标签:
- 标签用来快速分类和筛选资产
- 支持多标签
- 支持自定义标签颜色和分类
- 多资产类型支持:标签不仅适用于数据表,还支持报表、数据集、API、指标等多种资产类型
- 批量操作:支持批量打标和批量业务域分配,提高管理效率
- 常用分类:业务域、数据层、指标类别、自定义标签
元数据同步 #
- 单表同步:从数据源同步单张表的元数据信息(字段列表、类型、注释等)
- 批量同步:一次同步多张表的元数据
- 同步日志:查看每次同步的时间、状态和变更详情(全量/增量同步类型)
- 变更日志:查看字段新增、删除、类型变更、备注变更等历史
- 同步后可在数据地图和自助分析中查看最新字段信息
- 调度关联:支持从 Airflow 调度任务同步最新刷新时间
表字段维护 #
- 在表详情中维护字段中文备注、是否活跃
- 支持手动添加/删除字段
- 字段变更会记录到变更日志
5.2 数据血缘 #
数据血缘用可视化的方式展示数据表和指标之间的依赖关系,帮助你理解「数据从哪里来、到哪里去」。
入口 #
- 在资产管理中点击表名进入详情,再点击「血缘关系」
- 在数据地图的表详情弹窗中查看血缘
页面操作 #
| 操作 | 方法 | 说明 |
|---|---|---|
| 查看全貌 | 打开页面 | 默认显示最顶层的根节点 |
| 展开下游 | 点击节点 | 点击后展示该节点指向的所有下游 |
| 展开上游 | 点击节点旁的展开按钮 | 查看数据从哪里来 |
| 搜索 | 输入关键词 | 搜索后展示完整的上下游链路 |
| 查看详情 | 点击节点 | 弹出右侧详情面板 |
| 平移 | 鼠标拖拽画布 | 移动查看不同区域 |
| 缩放 | 鼠标滚轮 | 放大或缩小视图 |
| 重置 | 点击重置按钮 | 恢复初始视图 |
看懂血缘图 #
节点颜色:
| 颜色 | 含义 |
|---|---|
| 🔵 蓝色 | 原子指标(最基础的度量) |
| 🟢 绿色 | 派生指标(基于原子指标加工) |
| ⚪ 灰色 | ODS 原始数据层 |
| 🟠 橙色 | DWD 明细数据层 |
| 🔵 蓝色 | DWS 汇总数据层 |
| 🟣 紫色 | ADS 应用数据层 |
| 🔵 青色 | 维度表 |
连线方向:
- 箭头从上游指向下游
- 例如:
ODS 订单表 → DWD 订单明细表 → 订单金额指标 - 表示:DWD 订单明细表的数据来源于 ODS 订单表,订单金额指标又基于 DWD 订单明细表计算
节点详情面板 #
点击任意节点后,右侧会弹出详情面板:
指标节点详情:
- 类型、别名、业务域、创建人
- SQL 语句(可复制)
- 上游依赖和下游影响范围
- 生命周期状态
数据表节点详情:
- 业务属性、质量评分进度条
- 字段列表(可折叠)
- 上游依赖和下游影响范围
- 关联指标清单
血缘维护 #
- 血缘关系可通过 ETL 任务配置自动解析生成
- 管理员也可在资产管理中手动维护表与表之间的关系
- 血缘图支持导出图片,方便在报告中使用
5.3 指标中心 #
访问地址:
/portal/index/
指标中心是管理所有业务指标的统一平台,覆盖指标的定义、生命周期、维度管理和业务限定管理。
四个功能区域 #
| Tab | 功能 | 适合谁 |
|---|---|---|
| 指标库 | 浏览所有指标(卡片/表格双视图) | 所有人 |
| 指标定义 | 创建和编辑指标 | 数据开发 |
| 维度管理 | 管理分析维度(时间/地区/类目等) | 数据开发 |
| 业务限定 | 管理业务筛选条件 | 数据开发 |
三种指标类型 #
| 类型 | 说明 | 举例 |
|---|---|---|
| 原子指标 | 最基础的度量,直接聚合某个字段 | 订单金额 = SUM(amount)、订单数 = COUNT(order_id) |
| 派生指标 | 基于原子指标进一步加工 | 月度 GMV = 日 GMV 按月汇总、新客订单金额 = 订单金额 WHERE 客户类型=‘新客’ |
| 复合指标 | 基于多个指标组合计算 | 客单价 = 订单金额 / 订单数 |
创建指标 #
创建原子指标:
- 选择「指标定义」Tab → 点击「新建」
- 填写基本信息:名称、别名、业务域、业务说明
- 选择聚合方式:求和 / 计数 / 去重计数 / 平均值 / 最大值 / 最小值
- 选择数据来源表和计算字段
- 点击「生成 SQL」自动生成查询语句
- 保存
创建派生指标:
- 选择「指标定义」Tab → 点击「新建」→ 类型选「派生指标」
- 选择关联的原子指标
- 选择时间聚合粒度:按天 / 按周 / 按月 / 按季度 / 按年
- 选择业务限定条件(可选,从已定义的业务限定中选择)
- 系统自动组合生成完整的 SQL
- 保存
指标生命周期 #
指标从创建到上线会经历完整生命周期:
草稿 → 申请上线 → 审批中 → 上线 → 变更/下线
| 状态 | 说明 |
|---|---|
| 草稿 | 初始状态,仅创建者可见 |
| 申请中 | 已提交上线申请,等待审批 |
| 审批中 | 管理员正在审核 |
| 上线 | 已通过审批,所有用户可在数据地图/自助分析中使用 |
| 变更中 | 指标口径发生变更,重新审批中 |
| 下线 | 已停用,不再对外提供服务 |
自动指标生成 #
系统支持基于数据表自动推荐指标:
- 选择一张数据表
- 系统自动识别可聚合的数值字段
- 生成候选原子指标列表
- 管理员勾选确认后一键创建
管理维度 #
维度是分析指标时的「切面」,例如按时间、按地区、按商品类目。
支持的维度类型:时间维度、地区维度、类目维度、用户维度、商品维度、渠道维度、设备维度、自定义维度
管理业务限定 #
业务限定是对数据的筛选条件定义,例如:
| 限定名称 | 条件 | 含义 |
|---|---|---|
is_new_customer |
客户类型 = ‘新客’ | 只看新客户 |
is_paid_order |
支付状态 不为空 | 只看已支付订单 |
top_category |
商品类目 IN (‘电子产品’,‘家居’) | 只看指定品类 |
创建业务限定后,在创建派生指标时可以直接引用,避免重复定义。
5.4 数据质量 #
访问地址:
/portal/quality/
数据质量模块帮助管理员为数据表配置质量检查规则,持续监控数据健康度。
质量大盘 #
进入质量中心首先看到大盘:
| 指标 | 说明 |
|---|---|
| 规则总数 | 已配置的质量规则数量 |
| 活跃规则 | 正在执行检测的规则数量 |
| 通过/失败/错误/未检测 | 最近一次检测结果分布 |
| 7 天检测趋势 | 最近一周的检测通过/失败/错误趋势 |
| 最近失败 Top 10 | 最近检测失败的质量规则 |
| 规则类型分布 | 空值检查、唯一性检查、范围检查等类型占比 |
质量规则类型 #
可以为每张表的每个字段配置规则:
| 规则类型 | 说明 | 示例 |
|---|---|---|
| 空值检查 | 检查字段空值率是否超过阈值 | 订单 ID 空值率 = 0% |
| 唯一性检查 | 检查字段值是否唯一 | 用户 ID 不能重复 |
| 取值范围 | 检查数值是否在合理范围内 | 金额 >= 0 |
| 枚举值检查 | 检查字段值是否在预定义集合内 | 状态 IN (‘已支付’,‘待支付’,‘已取消’) |
| 正则校验 | 检查字段值是否符合正则表达式 | 手机号格式校验 |
| 长度校验 | 检查字符串长度是否在合理范围内 | 用户名长度 2-50 字符 |
| 一致性检查 | 跨表数据一致性校验(自定义 SQL) | 订单表金额与明细表汇总一致 |
| 时效性检查 | 检查数据是否及时更新 | 最近更新时间不超过 24 小时 |
| 数据量波动 | 检查数据量是否异常波动 | 当日行数与上次相比波动不超过 30% |
| 自定义 SQL | 使用自定义 SQL 检查复杂业务规则 | 当日订单数 > 昨日订单数 * 0.5 |
配置规则 #
- 在质量中心点击「新建规则」
- 填写规则名称、目标表、目标字段
- 选择规则类型和期望结果
- 配置规则参数(如阈值、范围、枚举值等)
- 选择数据源连接
- 设置严重级别(高 / 中 / 低)和状态(活跃 / 暂停)
- 保存
执行检测 #
- 手动执行:点击规则列表中的「执行」按钮,立即检测一次
- 定时执行:通过调度任务关联质量规则,按周期自动检测
- 批量执行:勾选多条规则,批量触发检测
质量评分 #
- 每张表有一个 0-100 分的质量评分
- 评分基于已配置规则的最新检测结果和严重级别加权计算:严重规则扣 30 分、一般规则扣 15 分、提示规则扣 5 分
- 失败规则越多、严重级别越高,扣分越多
- 评分会在每次检测执行后自动回写到数据资产,展示在数据地图的表卡片和资产管理列表中
检测结果 #
- 每次检测生成一条结果记录
- 展示检测时间、结果(通过/失败/错误)、失败样本数
- 点击失败记录可查看具体不符合规则的数据样例
- 支持按项目、规则类型、严重级别筛选结果
5.5 数据安全中心 #
访问地址:
/portal/security/
数据安全中心用于配置字段级脱敏规则和行级过滤规则(Row-Level Security),控制不同用户能看到的数据范围和内容。
字段级脱敏 #
对敏感字段配置脱敏方式:
| 脱敏方式 | 效果示例 | 适用场景 |
|---|---|---|
| 不显示(隐藏) | 字段完全不可见 | 高度敏感字段 |
| 手机号脱敏 | 138****1234 | 用户手机号 |
| 邮箱脱敏 | a***@example.com | 用户邮箱 |
| 身份证脱敏 | 310***********1234 | 证件号 |
| 银行卡脱敏 | 6222****1234 | 银行卡号 |
| 地址脱敏 | 上海市浦东新区*** | 用户地址 |
| 姓名脱敏 | 张* | 用户姓名 |
| 薪资脱敏 | *** 元 | 员工薪资 |
| 金额数字脱敏 | *** | 交易金额 |
| 日期模糊化 | 2026-** | 日期字段 |
| 时间戳模糊化 | 2026-- | 时间戳字段 |
| UUID 脱敏 | 550e8400-*** | 唯一标识符 |
| IP 地址脱敏 | 192.168.. | IP 地址 |
| 密码隐藏 | ******** | 密码字段 |
| SHA256 哈希 | a665a45920… | 需要脱敏但保留匹配能力 |
| 星号遮蔽 | ******** | 任意敏感字段 |
| MD5 哈希 | e10adc3949ba… | 需要脱敏但保留匹配能力 |
| 保留前 N 位 | 13812 | 手机号、身份证号等 |
| 保留后 N 位 | 1234 | 手机号、身份证号等 |
| 字符替换 | 自定义替换字符 | 自定义脱敏场景 |
智能推荐: 系统会根据字段名称和数据类型自动识别敏感字段并推荐合适的脱敏方式,用户可确认或修改推荐结果。
配置流程:
- 进入数据安全中心
- 从左侧已授权表列表中选择目标表
- 查看该表所有字段
- 为需要脱敏的字段选择脱敏方式和参数
- 保存配置
生效范围:
- 自助分析查询结果
- 数据下载文件
- 数据服务 API 返回数据
行级过滤规则 #
行级过滤用于控制用户只能看到满足特定条件的数据行。
使用场景:
- 地区负责人只能看到本地区数据
- 部门员工只能看到本部门数据
- 不同角色看到不同业务范围数据
支持的过滤操作符:
| 操作符 | 说明 | 示例 |
|---|---|---|
= |
等于 | region = '华东' |
!= |
不等于 | status != '已删除' |
> / < / >= / <= |
数值比较 | amount > 1000 |
in |
属于列表 | region in ('华东','华南') |
not_in |
不属于列表 | status not_in ('已删除') |
like |
模糊匹配 | code like 'A%' |
between |
范围区间 | score between [0, 100] |
is_null |
为空 | remark is_null |
is_not_null |
不为空 | phone is_not_null |
规则逻辑:
- 同一规则内的多个条件用 AND 连接
- 同一张表的多条规则用 OR 连接
- 规则可指定适用用户(多用户逗号分隔),也可设为默认规则(对所有有权限用户生效)
- 用户特定规则优先级高于默认规则
配置流程:
- 选择目标表
- 配置过滤条件(如
region = '华东') - 指定生效用户或用户组(支持多用户逗号分隔)
- 保存后,对应用户在自助分析中会自动应用该过滤条件
5.6 审批管理 #
审批管理集成在管理端门户中,处理两类审批:数据权限申请和指标生命周期申请。
待处理提醒 #
左侧导航栏「审批管理」上会显示待处理数量角标(红点),登录后自动刷新。
审批流程 #
- 进入「审批管理」查看待处理列表
- 点击「查看详情」了解申请背景
- 勾选需要处理的记录
- 点击「批量通过」或「批量驳回」
- 填写审批说明(建议填写,方便申请人理解)
- 确认提交
审批详情包含 #
权限申请:
- 申请的表名或指标名
- 申请人、申请时间
- 申请备注(为什么需要)
- 申请有效期
指标需求/上线申请:
- 指标名称和业务背景
- 期望的计算逻辑和来源表
- 优先级(高/中/低)
- 用途说明
- 当前生命周期状态
审批后处理 #
- 通过:申请人会收到通知,权限即时生效或指标状态变更
- 驳回:申请人可在「我的申请」中查看驳回原因,修改后重新提交
- 批量操作:支持同时处理多条记录,提高效率
5.7 使用分析 #
访问地址:
/portal/usage/
使用分析模块帮助管理员了解平台的使用情况,包括自助分析查询统计和资产使用监控。
查询分析大盘 #
| 指标 | 说明 |
|---|---|
| 总查询次数 | 统计周期内的自助分析查询总数 |
| 独立用户数 | 使用过自助分析的用户数 |
| 总查询行数 | 查询返回的记录总数 |
| 平均耗时 | 单次查询平均耗时(毫秒) |
趋势与分布 #
- 按天趋势:每日查询次数、查询行数、平均耗时
- Top 用户:查询次数最多的用户
- Top 数据表:被查询次数最多的表
- 耗时分布:按 <100ms / 100-500ms / 500ms-2s / >2s 分桶统计
最近查询明细 #
- 查看最近的查询记录
- 每条记录展示:查询用户、目标表、返回行数、耗时、SQL 预览
- 可用于排查慢查询和异常查询
资产使用监控 #
- 查看每张表的浏览次数、收藏数、查询次数
- 识别热门数据和冷门数据
- 为资产治理提供数据依据
任务调度监控 #
平台本身不提供独立的任务中心页面,任务调度状态通过以下方式查看:
- 资产管理中的「调度任务」属性
- ETL 平台的 SmartPip / Airflow 界面(
/etl/airflow/) - 使用分析中的查询活跃度和资产刷新时间
5.8 数据服务与 API 管理 #
数据服务模块管理对外提供的 API 接口,由资产管理 → API Tab 维护。
API 资产管理 #
| 操作 | 说明 |
|---|---|
| 新增 API | 配置 API 名称、关联表、查询 SQL、返回字段 |
| 编辑 API | 修改 SQL、字段、访问权限 |
| 删除 API | 下线不再使用的接口 |
| 授权 | 配置哪些用户或用户组可以调用 |
脱敏生效 #
- API 返回字段的脱敏规则在数据安全中心统一配置
- 也可在 API 配置中指定特殊脱敏策略
5.9 物化视图 #
物化视图管理集成在管理端门户中,用于加速常用查询,特别适用于 StarRocks 等支持物化视图的数仓场景。
适用场景 #
- 报表页面加载慢,需要预计算汇总结果
- 自助分析中频繁使用的聚合查询
- 数据量庞大,实时计算成本高的场景
状态说明 #
| 状态 | 含义 |
|---|---|
| 活跃 | 正常使用中,查询时会自动命中 |
| 停用 | 已暂停使用,不再参与查询加速 |
| 构建中 | 正在创建或刷新 |
| 失败 | 创建或刷新失败,需排查 |
操作流程 #
- 进入「物化视图」页面
- 点击「新建」,填写物化视图名称
- 选择基础表和聚合 SQL
- 设置刷新策略(手工刷新 / 自动刷新 / 提交时刷新 / 按需刷新)
- 保存并创建
日常管理 #
- 手动刷新:立即触发一次数据刷新
- 自动刷新:按设定的时间间隔自动刷新
- 提交时刷新:基表数据变更时自动触发
- 按需刷新:查询时判断是否需要刷新
- 启停切换:临时停用或恢复物化视图
- 查看详情:查看存储占用、数据量、最近刷新时间
- 删除:不再使用时删除物化视图
使用建议 #
- 优先为高频访问的汇总查询创建物化视图
- 注意物化视图会占用额外存储空间
- 基表数据更新后需要及时刷新物化视图,否则可能查询到旧数据
5.10 系统设置 #
系统设置由系统管理员维护,包含:
| 设置项 | 说明 |
|---|---|
| 默认数仓连接 | 配置自助分析和查询使用的默认数据库连接 |
| 同步数仓连接 | 配置元数据同步时使用的数据库连接(direct_db 模式) |
| 元数据同步来源 | 从 DM 模块同步或从数据库直接同步 |
| 同步 Schema 列表 | 配置元数据同步时包含的 Schema(留空则排除系统 Schema) |
| 操作日志 | 查看管理员操作记录 |
| 演示数据 | 清空或生成演示数据(测试环境使用) |
操作日志 #
- 记录管理员对资产、指标、权限、质量规则的增删改操作
- 支持按时间、用户、操作类型筛选
- 用于审计和问题追溯
六、常见问题 #
Q1:我在数据地图搜不到想要的表怎么办? #
可能原因:
- 该表尚未注册到平台 — 联系数据管理员在管理端添加
- 你没有该表的权限 — 联系管理员授权,或在数据地图中点击「申请权限」
- 搜索关键词不够精确 — 尝试使用表名的部分关键字
Q2:自助分析里看不到某张表? #
自助分析只显示你已授权的数据表。请先到「数据地图」搜索该表,确认权限状态:
- 未授权 → 点击「申请权限」
- 审批中 → 等待管理员处理
- 已授权但仍看不到 → 刷新页面重试
Q3:指标需求提交后多久能得到回复? #
取决于优先级和管理员的工作量:
- 高优先级:通常 1-3 个工作日
- 中优先级:通常 3-5 个工作日
- 低优先级:纳入排期,按批次处理
你可以在「我的申请」中随时查看需求状态。
Q4:血缘图中某个节点点不开? #
尝试以下方法:
- 先点击节点展开其下游子节点
- 确保鼠标点击在节点文字区域(而非连线区域)
- 刷新页面重试
Q5:我想导出自助分析的查询结果怎么办? #
查询执行后,点击结果区域上方的「导出 CSV」或「导出 Excel」按钮即可下载。
- CSV:通用文本格式,兼容性好
- Excel:生成
.xlsx文件,适合进一步美化或分享给业务方 - 导出数据量取决于当前结果模式:服务端分页模式下为当前页;本地分析模式下最多包含已加载的 5000 条
- 如果结果区启用了透视表,也可导出透视后的结果
Q6:用户端和管理端的访问地址分别是什么? #
| 页面 | 地址 |
|---|---|
| 用户端门户 | /portal/ |
| 自助分析 | /portal/self/ |
| 数据集构建器 | /portal/design/ |
| 管理端门户 | /portal/admin/ |
| 指标中心 | /portal/index/ |
| 数据质量 | /portal/quality/ |
| 数据安全 | /portal/security/ |
| 使用分析 | /portal/usage/ |
Q7:为什么有些字段在自助分析里看不到? #
可能原因:
- 该字段被管理员配置为「隐藏」脱敏规则
- 当前用户对该字段所在表只有部分权限
- 字段在元数据同步后被标记为不活跃
- 数据集模式下,字段未在数据集 schema 中配置
- 行级过滤规则过滤掉了部分数据行
Q8:如何配置数据脱敏? #
数据管理员进入「数据安全中心」(/portal/security/):
- 从左侧选择已授权的表
- 查看字段列表
- 系统会根据字段名自动推荐脱敏方式(如手机号、邮箱、身份证等)
- 为敏感字段确认或修改脱敏方式(支持 20 种脱敏策略)
- 保存后即时生效
Q9:如何使用数据集构建器? #
- 访问
/portal/design/进入数据集构建器 - 从左侧目录树拖拽已授权的数据表到画布
- 系统自动推荐 JOIN 条件,确认或修改关联关系
- 勾选需要的输出字段,配置聚合函数
- 可添加衍生字段(自定义表达式)和筛选条件
- 预览 SQL 和数据后,点击发布
- 发布后的数据集可在自助分析中使用
Q10:质量规则有哪些类型? #
系统支持 10 种质量规则类型:空值检查、唯一性检查、取值范围、枚举值检查、正则校验、长度校验、一致性检查、时效性检查、数据量波动和自定义 SQL。每种类型都可配置严重级别(严重/一般/提示),检测失败时自动更新表的质量评分。
七、名词解释 #
| 名词 | 解释 | 举例 |
|---|---|---|
| 数据表 | 存储数据的二维表格 | dwd_order_detail(订单明细表) |
| 指标 | 用来衡量业务状况的度量值 | GMV(商品交易总额)、DAU(日活跃用户数) |
| 原子指标 | 最基础的度量,不可再拆分 | 订单金额 = SUM(amount) |
| 派生指标 | 在原子指标基础上增加限定条件或时间维度 | 月度新客 GMV |
| 复合指标 | 基于多个指标组合计算 | 客单价 = 订单金额 / 订单数 |
| 维度 | 分析数据的角度 | 时间维度(按天/月/年)、地区维度(按省/市) |
| 业务限定 | 对数据范围的筛选条件 | 只看「已支付」的订单 |
| 数据层 | 数据在数仓中的层级 | ODS(原始)→ DWD(明细)→ DWS(汇总)→ ADS(应用) |
| 业务域 | 按业务线划分的数据分类 | 电商、金融、用户增长、供应链 |
| 数据血缘 | 数据之间的来源和去向关系 | A 表的数据来自 B 表和 C 表 |
| 数据脱敏 | 对敏感信息进行遮蔽或加密处理 | 手机号显示为 138****1234 |
| 行级过滤 | 控制用户只能看到满足条件的数据行,支持 12 种操作符 | 地区负责人只看本地区数据 |
| 智能推荐脱敏 | 根据字段名和类型自动识别敏感字段并推荐脱敏方式 | 系统识别 phone 字段并推荐手机号脱敏 |
| 物化视图 | 预先计算并存储的查询结果,用于加速查询 | 将复杂的汇总查询结果存为物化视图,查询时直接读取 |
| 元数据 | 描述数据的数据(字段名、类型、说明等) | 订单表有哪些字段、每个字段是什么含义 |
| 安全等级 | 数据的保密级别 | L1 公开 / L2 内部 / L3 敏感 / L4 机密 |
| 更新周期 | 数据刷新的频率 | 实时、每小时、每天、每周、每月 |
| 标签 | 给数据资产打的分类标记 | 「核心表」、「临时表」、「对外服务」 |
| 自助分析 | 可视化拖拽式查询工具,无需写 SQL | 拖拽字段生成查询并导出结果 |
| 本地分析模式 | 将前 5000 条数据加载到前端,在浏览器内完成分页和加工 | 下载、加工时自动触发,减少服务端请求 |
| 数据加工 | 对查询结果追加前端转换规则,生成新列 | 累计求和、百分比显示、趋势箭头 |
| 透视表 | 将维度值旋转到列上,形成交叉表 | 按月份作为列、地区作为行展示销售额 |
| 计算字段 | 通过自定义表达式生成的虚拟字段 | amount * 0.8 作为折扣价 |
| 数据集 | 由文件、API、SQL 或可视化构建的数据集合 | 文件上传生成的数据集、可视化构建器发布的数据集 |
| 数据集构建器 | 可视化拖拽式数据集设计工具,支持多表 JOIN、衍生字段、多步骤 CTE | /portal/design/ 页面 |
| 多步骤关联流 | 数据集中多个 CTE 步骤逐层加工,后序步骤可引用前序输出 | 步骤 1 关联订单表,步骤 2 关联明细表 |
| OA 权限码 | 对接 OA 系统的权限标识 | data_manage、data_analysis |
如有疑问,请联系数据管理团队。