主题
数据开发 · 作业与调度
场景 数据开发是整条数据生产的主干:每天要写各类作业、用 DAG 串成工作流、按时调度、失败要能补跑和排查。我的数据空间支持十余类作业,覆盖批、流、集成,统一用 DAG 编排和自研调度引擎驱动。
按类型选型
Spark——跑完即止的批处理:
- Spark SQL 作业 — 在数据湖上跑标准 SQL,做离线批处理
- Spark Jar 作业 — 跑用户自带的 Spark 程序
Flink——7×24 常驻直到手动停止:
- Flink SQL 作业 — 写流式 SQL,常驻处理
- Flink Jar 作业 — 跑用户自带的 Flink 程序(需是无界流逻辑)
集成——跟外部数据库对接,批/流各一种:
- 离线集成(DATA_SYNC)作业 — 外部数据库批量同步入湖
- 实时集成(Flink CDC)作业 — 数据库变更实时入湖
Notebook——复用交互式开发成果:
- Notebook 调度作业 — 把 Notebook 按序发布为周期任务
其他:
- Shell 作业 — 跑一段 shell 脚本
- Python 作业 — 跑一段 Python 脚本
- 依赖等待(Sensor)作业 — 轮询等上游表 / 分区就绪
- 虚拟节点(Dummy)作业 — 占位 / 汇聚节点,不做实际计算