主题
常见问题
产品与定位
它和 DataWorks / DolphinScheduler 这类产品有什么不同?
DataWorks 是云厂商的一体化平台、DolphinScheduler 是专注调度的开源项目。我的数据空间的定位在两者之间:一体化广度对齐 DataWorks 那条主线(查询 + 开发 + 调度 + 治理 + 质量 + 权限 + AI 七域打通),但调度是自研引擎(多副本不重复触发、不漏触发,错过自动补跑),并且有 NL2SQL 语义层这样的差异化能力。它是一套按生产级标准写、可完整私有化运行的实现。
怎么合作?只能整套买吗?
两种方式都支持:整套私有化交付,或按模块集成——智能诊断、NL2SQL 语义层、智能问答、调度等能力可以单独拿出来,OEM 进你自己的产品线。具体聊需求,联系方式在页脚。
技术栈是什么?
- 控制面:Spring Boot 多模块工程,按部署角色伸缩,不强拆微服务。
- 前端:Vue 3 + Element Plus。
- 数据底座:Iceberg + MinIO(S3) + Spark on K8s + Trino + Doris + Flink CDC,元数据与平台状态落 MySQL,检索用 Elasticsearch。
部署与接入
能私有化部署吗?依赖公有云吗?
云中立,可完全内网私有化。 整套平台与计算存储组件(Spark / Flink / Iceberg / Trino / Doris 等)跑在 Kubernetes 上,不绑定任何公有云服务,数据不出域。
平台自身高可用吗?
按多副本设计:控制面无状态、会话与作业状态全部入库,多副本下调度不重复触发、不漏触发;空间级的计算资源由 Kubernetes 原生配额硬性兜底,单个空间打满不会拖垮平台本身。
已有业务库里的数据怎么进来?
注册数据源(MySQL / PostgreSQL / MongoDB 及多款国产数据库)后一键导入元数据,再按需选两条路:离线同步批量入湖,或 Flink CDC 捕获变更近实时入湖。外部数据源默认不开放直查,数据经入湖治理后使用——这是刻意的管控设计。
AI 能力
NL2SQL 和「直接让大模型写 SQL」有什么区别?
区别是敢不敢给业务用。直接让大模型写 SQL 会有口径漂移和越权风险;我的数据空间让模型只产结构化意图,SQL 由语义层确定性编译,同一指标永远编出同一口径,配多轮澄清、生成后自检,且生成永不绕过执行侧鉴权。完整介绍见 AI 敢用 · NL2SQL 语义层。
AI 依赖哪家大模型?内网环境怎么办?
平台经标准接口对接大模型,模型可替换,内网可对接自部署的开源模型;知识库检索引擎同样私有化部署,不依赖外部服务。模型不可用时平台不瘫痪:诊断自动降级为规则分析并如实标注,问答明确提示,核心的数据开发与查询链路完全不受影响。
大模型会看到我的业务数据吗?
发给模型的内容有明确边界:问答与 AI 查数用的是元数据和口径定义(表结构、指标怎么算),不是明细数据;智能诊断会附上日志与必要的采样片段用于定位问题。对数据敏感的场景,配合内网自部署模型即可做到全链路数据不出域。
安全
多租户下数据安全怎么保证?
三层设计:fail-closed 安全边界(弱口令拒启、降级路径宁拒不放行)、纵深防御(数据越权与算力隔离两条正交防线)、凭证不落命令行(密钥加密落库、运行时注入内存)。详见 生产级安全与多租户隔离。