Skip to content
我的数据空间

一个工作空间,贯通大数据与 AI

从数据接入、开发调度到数据查询与治理,再到 AI 查数、智能诊断与智能问答——大数据与 AI 能力在同一个平台里联动,而不是各自为政的工具堆叠。

我的数据空间概览
🧩
数据开发 · 作业与调度

十余类作业用 DAG 编排,定时调度 + 依赖驱动,错过自动补跑、失败可诊断。

看数据开发 →
🔎
数据查询

表感知 SQL 编辑器,按数据源自动选择引擎,支持跨源联邦查询与逐表鉴权。

看数据查询 →
🗂️
元数据管理与血缘

三级坐标统一管理库表,检索快速定位,表级 / 列级血缘随作业保存自动生成。

看元数据管理 →
🤖
AI 查数 · NL2SQL 语义层

不是让大模型裸写 SQL,而是由语义层确定性编译,指标口径固化、不越权。

为什么敢用 →
🩺
AI 智能诊断

作业失败后自动采集日志、引擎死因与血缘,产出根因分类与修复建议。

看智能诊断 →
📚
智能问答

基于平台知识库的检索增强问答,答案带出处引用,可追溯、可纠错。

看智能问答 →
📓
Notebook 交互式开发

SQL 结果自动变成 DataFrame 变量,Python 接着算;同一份 Notebook 可直接发布为周期任务。

看 Notebook →
🛡️
生产级安全与多租户

空间为最小授权单元,数据与算力双重隔离;异常与降级路径宁拒不放行。

看安全设计 →
Architecture

一图看懂整体架构

统一的控制面之下,查询、批流计算、元数据与平台服务各走独立通道;任一条链路的负载或故障,不会波及其他链路。

应用场景
企业级数仓建设实时数据集成数据资产治理自助分析与 AI 问数指标口径统一
我的数据空间
数据生产
数据集成(离线 / 实时 CDC)
数据开发(十余类作业)
工作流编排与调度
Notebook 交互式开发
数据查询与探索
开发调试发布调度运维
数据治理与 AI
资产与质量
元数据管理表 / 列级血缘数据质量门禁生命周期
AI 能力
AI 查数 · 语义层智能诊断智能问答
基础支撑服务
统一元数据统一权限与安全统一调度资源配额与计量
管理体系
工作空间用户与角色数据源管理审批流开放 API 与令牌多空间隔离
计算存储
计算与查询引擎
SparkFlinkTrinoDoris
存储与数据源
Iceberg 表格式对象存储关系型 / NoSQL 数据源检索引擎

多租户下的安全边界——空间隔离、逐表鉴权、密钥加密存储——做在平台机制里,不依赖使用者自觉。

The Problem

解决数据团队四大痛点

🧱链路割裂

集成一套、开发一套、调度一套、治理又一套,数据在系统间搬来搬去,血缘和权限对不上。

需求排队

业务想看个数,要提需求、排期、等数仓同学写 SQL,一个问题绕好几天。

🎲SQL 不敢信

大模型直接生成 SQL 靠的是概率性猜测,指标口径经常算错、还可能越权取数,不敢给业务用。

🔓安全难保

一个空间吃满集群、密钥散落在命令行、降级路径绕过鉴权——上生产就是事故。

Core Features

每天都在用的核心能力

从作业开发、数据查询、元数据管理,到 AI 查数、智能诊断与 Notebook 探索。

数据开发 · 作业

十余类作业,DAG 编排 + 自研调度

把 SQL / Shell / Python / Spark Jar / Flink SQL / Flink CDC / 离线同步 / Sensor 等作业用 DAG 串联,按上游触发规则拓扑推进。

  • 定时调度 + 依赖驱动,支持子工作流、版本管理与时间参数
  • 错过的调度自动补跑,节点级超时控制,编排时自动检测环路
  • 失败实例可一键 AI 诊断根因,就地重跑或置成功
工作流 DAG 与调度
数据查询

一套编辑器,多引擎自动选路

表感知的 SQL 编辑器,按 catalog 组成与语句类型自动选择合适的引擎,也能跨数据源做联邦查询。

  • 提交即做逐表权限校验,异步执行不占前端,结果可直接下载
  • 大查询超时自动熔断并引导改用批作业,不拖垮集群
  • 交互式分析与批处理在同一套编辑器里完成
跨源联邦查询:湖表与 OLAP 表一条 SQL 关联聚合
元数据管理

统一元数据、检索与血缘

catalog.db.table 三级坐标,横跨数据湖、OLAP 与外部数据源;每张表都能查详情、看血缘、直接发起查询与授权。

  • 表级 / 列级血缘随作业保存由 SQL 自动解析生成
  • 回收站、TTL 与软删除;被作业引用的表不允许误删
  • 表级授权变更自动同步到存储层权限,上下始终一致
元数据管理与血缘
AI 查数 · 语义层

不是让大模型猜 SQL,是语义层确定性编译

大模型只负责把问题解析成结构化查询意图,再由语义层依据预定义的表关系与指标口径编译成 SQL——替代「让模型直接写 SQL」的概率性猜测。

  • 指标一次定义、多处复用,同一问题在不同场景答案一致
  • 有歧义会多轮追问;首版不通过会带鉴权校验后自我修正
  • 生成与执行分离,AI 这条路径同样过逐表鉴权,不越权取数
语义层按指标口径编译出的 SQL
智能诊断

作业失败,一键定位根因

对失败实例做 agentic 工具循环:模型自主调度日志、引擎死因、血缘等采集器,产出分类 + 根因 + 修复建议。

  • 采集器直接对接引擎,不是只把报错原样贴给模型
  • 诊断结论旁边就是重跑 / 置成功等运维动作
  • 模型不可用时自动降级为规则诊断,功能不中断
Spark OOM 失败实例的智能诊断:根因分类、修复建议与 6 步采集过程
智能问答

答案带出处,口径讲得清

基于平台知识库回答业务、操作与报错问题;指标口径、表结构直接读语义模型与元数据作答,和实际查数用同一套口径。

  • 回答附来源文档引用,可点开对照原文,检索不到就明确说
  • 问得含糊会给出可点候选,点一下带着选择继续答
  • 对话里带上失败实例号,自动转深度诊断
AI 助手工小数结构化解答「Spark 任务 OOM 怎么排查」
Notebook

SQL 拿数、Python 接着算,探索直通生产

SQL / Python / Markdown 混编:SQL cell 的结果自动变成 DataFrame 变量,Python cell 直接拿来清洗、画图,变量跨 cell 保持。

  • 引擎常驻有状态,依赖装一次全空间共享,各 Notebook 互不干扰
  • 图表直接渲染在 cell 输出区,中文标题标签开箱即用
  • 同一份 Notebook 发布版本后即可挂上周期调度,不用改写成脚本
Notebook 里 SQL 结果流入 Python 并画出图表
Use Cases

这些场景,一套平台覆盖

从数仓建设到自助问数,不必再拼装多套系统。

🏗️
企业级数仓建设

从异构数据源接入,到分层建模、调度生产与质量校验,再以查询和 API 对外提供数据。

实时数据集成

Flink CDC 捕获业务库变更近实时入湖,与离线同步共用一套开发与运维体系。

🛡️
数据资产治理

元数据 + 血缘 + 质量门禁 + 分级授权,让数据被放心使用,删改有据可查。

💬
自助分析与 AI 问数

业务用自然语言问数,指标口径由语义层保证,不必再排队等人写 SQL。

一个平台,贯通大数据与 AI

从数据开发、数据查询到元数据治理与 AI 查数,云中立、可完全内网私有化。

想了解更多 / 申请演示

扫码加 QQ,产品演示、私有化部署与技术细节都能直接聊。

QQ 二维码 · 扫码加好友
QQ:1559851993