主题
智能问答
场景 平台用得越深,问题越杂:新人问「离线作业怎么建」,老手问「Spark OOM 从哪查起」,业务同学问「营收到底是怎么算的」——总不能每个问题都翻手册、追着数据团队问。AI 助手「工小数」常驻在平台右下角,基于平台知识库、语义模型与真实运行数据作答,而不是拿通用大模型的印象糊弄。
能干什么
| 你想做的事 | 在工小数里长这样 |
|---|---|
| 操作/排障疑问,不想翻手册 | 直接问,回答基于平台文档,底部列来源,点开可看原文 |
| 想确认回答不是模型现编的 | 展开「思考过程」,每一步检索了什么、拿到什么一目了然 |
| 问指标口径、表结构、表关联 | 直接读语义模型与元数据作答,口径与实际查数用的同一套 |
| 想查个数,但只会说大白话 | 转为生成 SQL,指标过滤自动折进去,拿到「数据查询」页就能跑 |
| 问得含糊、或一个词对应多个口径 | 不瞎猜,先反问并给出可点候选,点一下继续 |
| 作业跑挂了想知道为什么 | 对话里带上实例号,自动转深度诊断,给出根因与修复建议 |
| 回答有误想纠正 | 点「纠错」提交,沉淀为经验,同类问题以后答得更准 |
| 想把自己团队的文档喂给它 | 管理员可上传业务文档进知识库,传完即可被检索到 |
亮点
- 答案带出处,检索不到就明说——基于知识库作答并列出来源;知识库没有的内容会明确拒答并建议怎么补充提问,不拿通用知识冒充平台事实
- 一个入口收编多种能力——文档问答、口径解读、SQL 生成、失败诊断由模型按问题自主选用,你不用先想「该去哪问」
- 口径问答与查数同源——「营收怎么算」的解释和「帮我查营收」生成的 SQL 用同一套语义模型,不会各说一套
- 不确定就反问,反问可点选——歧义时给出候选按钮,点一下带着你的选择继续,不打字也能把问题问准
示例一:问一个排障问题
问「Spark 任务 OOM 怎么排查?」,回答不是泛泛的调参清单,而是按平台的实际动线组织:先用哪个入口拿证据、怎么判断 OOM 发生在哪一层、去哪里调资源配置:

回答底部是完整的可信度配套:五篇来源文档(含引擎调优资料)、三个「继续」追问建议、以及一句诚实的边界声明——知识库里没有的调参细节,它直说「不做臆测」:

展开「思考过程」能看到它一共检索了多轮:同一个问题被改写成「内存参数调优」「作业资源申请」「executor GC 诊断」等多个角度分别查,某一轮没查到也如实记录——检索了什么、拿到什么全程可审计:

示例二:问指标口径
业务上最常见的扯皮是「你说的营收和我说的营收不是一个数」。工小数直接读空间里的语义模型回答口径问题——下面这个空间里恰好有两个「营收」:财务口径只计已完成订单,经营口径下单即计。它把两个口径连同差异一次讲清,而不是随便挑一个:

这些口径不是从文档里猜的,而是读的语义建模里的结构化定义;没建语义模型的表,问表结构时也会直连元数据返回字段、类型与注释。只会看到你所在空间、且有读权限的模型与表——权限校验在工具内部完成,不依赖模型「自觉」。
示例三:问数遇到歧义,反问可点选
接着问「帮我查 7 月各支付渠道的营收」——两个模型都有「营收」,它不替你拍板,而是弹出两个可点候选:

点「销售大盘」,它带着你的选择重新作答:生成的 SQL 里指标的口径过滤被自动折了进去,时间范围按「7 月」换算成具体日期,并说明这条 SQL 为只读、执行时仍按表权限鉴权:

「解释口径」与「按口径查数」走的是同一套选模型逻辑,所以示例二里讲的口径和这里生成的 SQL 必然一致。问得足够具体(点名模型/指标/时间)就不会反问;这条生成链路的完整介绍见 AI 敢用 · NL2SQL 语义层。
示例四:失败实例在对话里直接诊断
对话里带上失败实例号,工小数自动转入深度诊断——和运维监控里的「智能诊断」按钮是同一套能力,只是入口换成了对话。下面这个 Spark SQL 作业死在运行期:SQL 能过语法与权限预检,真正执行到 executor 上才因数据校验不通过炸掉。诊断不但给出根因,还采到了不满足条件的具体反例值,连「这个任务在自读自写同一张表,源数据本身就是脏的」这种上下文都指了出来:

展开「思考过程」能看到诊断的完整取证链就在对话里:错误日志关键段(含异常链)、运行信息(申请了多少资源、跑了多久、谁触发的)、作业配置与 SQL 源码——结论里的每一句都能对回证据:

诊断能力本身的设计(证据采集器、agentic 取证循环、规则兜底)与更多引擎案例见智能诊断。
为多人同时使用做的兜底
- 按空间隔离:对话历史、纠错记忆、可检索的文档与模型都以工作空间为边界,别的空间看不到
- 有身份、有额度:每个问题都在提问者的权限下执行,工具内重新鉴权;单用户与全平台各有并发/成本闸,防止一个重度用户拖垮大家
- 降级不摆烂:模型暂时不可用时自动降级为纯知识库检索/规则诊断,仍给出最相关的资料与来源,而不是白屏等待
前端呈现
登录后任意页面右下角的悬浮按钮唤起,面板贴右侧纵向拉满、可拖宽。回答流式逐字输出,跑偏可随时中断;支持多轮追问(「那它的分区键呢」这类指代会自动补全),超长会话早期内容自动压缩保留。顶部「历史」可回看、重命名、删除过往会话。
回到核心能力总览 →