需求Requirement
业务目标、成功指标、适用范围与风险初判。
产出:立项提案、团队任命先把共用运行底座做深,再让各 BU 用自己的 Skills 和 MCP 长出业务 Agent。能力统一建设,场景分布式生长。
公司管理层 · 各业务部门负责人 · 业务落地 × 平台治理
这一页只交代一件事:画这张图不难,难的是让它可信地跑在生产里。上面三个难点的解法,就是接下来 40 分钟的内容。
变的是前端界面,不是另一套 Agent。左边是已上线的第一版小诺,右边是接下来要给业务用的进化版。
AI 在数据领域用得已经很多,但现象级产品仍然偏少——先看结构性原因,再看实践里为什么走不通。
不同公司的业务过程、指标体系、分析框架都不一样——这不是靠一套通用模板能抹平的。
优秀数据从业者要先沉淀业务框架与业务过程,才能设计好指标体系、分析框架和数据宽表;大厂落地具体公司也绕不开这一步。
要提效的不是编制,而是「业务问题发现 → 数据落地应用」这条链路。AI 放大的是人已经沉淀的业务理解,不是把人从链路里拿掉。
① 缺 AI 应用框架员工拿着企业发的 token 自由发挥,形不成规模。
② Leader 看不到效果没有机制追踪 agent 效果和 token ROI,花没花在刀刃上无从知晓。
③ 追炫酷、忽略底层注意力放在快速上线小工具上,前端再花哨,数不对结论就错。
这三件事,刚好可以由我们做了十年的系统来托住——下一页就是 DataATM。
Plugin 把业务方法与受控数据工具装进 Agent:先选对 Skill,再由 Skill 组合 MCP 工具完成取数、分析与交付。
十年自研的自助取数系统——AI 时代之前就在做数据平权:把业务从 Tableau / Quick BI 的高门槛里解放出来,让每个前端都能自己查到数。
摆脱「只有 BI 专业人员才会用」的困境;看板低效工作交给系统,业务直接取数、直接下钻。
自助逻辑沉淀回宽表优化;不是先规划排期再等数月,而是边建设、边使用、边发现问题,以天为单位迭代。
客户基础信息不是窄表。业务想点的字段,宽表里已经在。
点 AUM,系统知道这是加和;再拉客户等级,自动按维聚合。
凡是沉淀进来的口径,一定是业务在用、被验证过的。
取数、告警、数据准备。Agent 可以加速建设,但生成之后必须落在平台上——可观测、可编辑、可评估。17 个 MCP 工具,就是这三件事的接口。
monitor_spec。先用真实查询校验,再创建 Data Prep 草稿;用户确认后才发布。01 Session — 多轮请求串在同一会话
02 Trace — 下钻模型、Skill、工具与 Token
03 根因 — 上下文、工具返回、重试分开看
04 Dashboard — 七日 Token 与质量趋势对上 Trace
上线惊艳,复杂业务一上就幻觉。业务退回 DataATM 取数,再把 Excel / 截图喂给个人 Agent,很快又撞墙。半年 token 烧了很多,洞察没有质变——不追踪、不评估,知识沉淀不下来,Agent 也就不会越用越聪明。
自动化边界:质量 Agent 只做取证、七维评分、入队和写回;它不改代码、不升级 Skill、不自动发版。
1,367TRACE3,144SCORE11人审候选151REGRESSION每条 Trace 都按同一规则产出 Pass / Fail / Unknown,并保留判定依据;Unknown 与业务真值问题进入人审,不让模型替自己打分。
案例问题:「总结我名下客户的 AUM 和持仓产品风格。」路由是对的,但取数被拒绝后,回答仍给出了确定性数字。
所有查询被权限策略拒绝,最终回答却仍给出 AUM、客户分层和投资建议。
路由通过,不必误改路由。结果完整性失败、回答忠实度失败。权限交给数据权限负责人。
Regression 防复发;Silver 是人审经验;Gold 才是发布标准,质量 Agent 永不自动晋级。
产品层管建设、接入和运营。统一入口之下,是两类运行时与会话池。
Skill Hub 不是技能下载站。每个 Skill 有编号、版本、Owner、质检报告、调用计量和分发渠道。人走了,方法论还在货架上。
何时该用,完美输出长什么样
价值真伪、判重归口、防重复建设
SKILL.md + 基准输出 + Owner
静态查形,动态隔离真跑
分发 Engine / 诺Chat / CRM
热门上浮,零调用预警下架
命名、后缀、SKILL.md、frontmatter。格式不过,进不了动态检测。
Mock 环境真跑:敏感数据进出、Token、降级、与基准输出对比。合规一票否决。
五维可比;动态质量分加权 ≥70 才通过。Hub 管上下架,OPS 管调用量。
Skill 不是上传一个 SKILL.md 就结束。它是一项有 Owner、有门禁、可运营、可回滚、可退役的平台资产。
业务目标、成功指标、适用范围与风险初判。
产出:立项提案、团队任命确定 Owner、分档路径、版本、预算和上线时间。
产出:需求规格、方案设计编写 SKILL.md 与执行文件,完成扫描和单元测试。
门禁:品控自检、重叠查询UAT、前期试用、L1-L4 品控及合规安全检查。
门禁:不通过不得上架Hub 受控发版,递进灰度,Registry 自动注册。
结果:多平台受控加载Langfuse 留证,监控质量、调用、成本与用户反馈。
保障:告警、Kill Switch、进化飞轮版本回滚、配置冻结、权限清理、归档与审计留痕。
重大变更:回流 KCP 2不是又一个看板。它不做模型、不做应用、不替代网关——而是横跨整栈,让所有 AI 能力可计量、可治理、可优化、可汇报。
多云、网关、席位、实收四条管道统一折算 USD。2026-07:$69,861,526 亿 Token。
368 个 MCP 工具里 8 个被运行时阻断。审核不是文档,是系统能证明拦过。
31 个 Agent 已登记;28 个 Skill 连续 30 天零调用。既有热门榜,也有淘汰预警。
费用落到 BU × 模型 × 产品 × 用户。没有统一口径,就没有投入决策。
三个最常见的失控点:Token 黑箱、经验不回流、小工具直接上线。
不是多出一堆「会写提示词」的岗位。平台铺开之后,人收敛成两种定位:把事情做成可判定的人,和必须对方向负责的人。
设定标准、验证结果、把方法沉淀下来。模型可以给草稿,Builder 负责把它推到能判定对错。
领导者要把 AI 放到该放的地方。该做什么、往哪里做,必须由人来决定,并对后果负责。
不鼓励每个部门重新建设一套 Agent 平台。平台统一建设底座;AI Builder 把场景推到可判定,决策者决定该做什么、往哪里做。
它应当高频、有价值、可验收,并且有明确业务 Owner。我们从真实场景开始,共同把它孵化成正式 Agent。
统一建设底座,让业务能力分布式生长。Agent 可以不同,运行、工具、模型和治理不再重复建设。