主题
统一的控制面之下,查询、批流计算、元数据与平台服务各走独立通道;任一条链路的负载或故障,不会波及其他链路。
多租户下的安全边界——空间隔离、逐表鉴权、密钥加密存储——做在平台机制里,不依赖使用者自觉。
集成一套、开发一套、调度一套、治理又一套,数据在系统间搬来搬去,血缘和权限对不上。
业务想看个数,要提需求、排期、等数仓同学写 SQL,一个问题绕好几天。
大模型直接生成 SQL 靠的是概率性猜测,指标口径经常算错、还可能越权取数,不敢给业务用。
一个空间吃满集群、密钥散落在命令行、降级路径绕过鉴权——上生产就是事故。
从作业开发、数据查询、元数据管理,到 AI 查数、智能诊断与 Notebook 探索。
把 SQL / Shell / Python / Spark Jar / Flink SQL / Flink CDC / 离线同步 / Sensor 等作业用 DAG 串联,按上游触发规则拓扑推进。

表感知的 SQL 编辑器,按 catalog 组成与语句类型自动选择合适的引擎,也能跨数据源做联邦查询。

catalog.db.table 三级坐标,横跨数据湖、OLAP 与外部数据源;每张表都能查详情、看血缘、直接发起查询与授权。

大模型只负责把问题解析成结构化查询意图,再由语义层依据预定义的表关系与指标口径编译成 SQL——替代「让模型直接写 SQL」的概率性猜测。

对失败实例做 agentic 工具循环:模型自主调度日志、引擎死因、血缘等采集器,产出分类 + 根因 + 修复建议。

基于平台知识库回答业务、操作与报错问题;指标口径、表结构直接读语义模型与元数据作答,和实际查数用同一套口径。

SQL / Python / Markdown 混编:SQL cell 的结果自动变成 DataFrame 变量,Python cell 直接拿来清洗、画图,变量跨 cell 保持。

从数仓建设到自助问数,不必再拼装多套系统。
从异构数据源接入,到分层建模、调度生产与质量校验,再以查询和 API 对外提供数据。
Flink CDC 捕获业务库变更近实时入湖,与离线同步共用一套开发与运维体系。
元数据 + 血缘 + 质量门禁 + 分级授权,让数据被放心使用,删改有据可查。
业务用自然语言问数,指标口径由语义层保证,不必再排队等人写 SQL。