Vault

生产就绪不只是能跑:AIP 智能体可观测性与 AIP Evolve 优化

cover

摘要

前两个演讲展示了持久化层(Orchestrator)与 Agent Engine 之后,Jake 与 Colton 在 DevCon 6 上追问一个更尖锐的问题:「生产就绪」到底意味着什么?智能体是否一直表现正确?不只是抵达正确结果——还要快、要省、要高效。而且智能体不是孤立运行的:它是多玩家环境的一部分,人类在回路之中。工作流可调试吗?能看清本体生命周期、理解如何抵达终态吗?

演示中,AIP 把原始遥测变成叙事:同一个执行可以透过 AIP Logic、Orchestrator 账本、AIP Inspect 三重透镜查看;拉远到「智能体时间线」则发现,交付履行智能体的 83% 时间都花在等一个报价回复上,大部分 Token 消耗在聊天机器人里——优化方案可能只是「把聊天框换成表单」。

在此基础上发布 AIP Evolve:给定「北极星」目标(本例把 32 秒延迟压到最快)、验证策略与变更约束,它派出一队队智能体并行实验——换模型、删工具、把 AI 逻辑改成确定性函数——最终把延迟砍掉 60% 到 90%(三报价案例从 45 秒降到 8.8 秒)。它的力量来自本体与可观测性层的复利。

正文

一、生产就绪意味着什么:正确性、可调试性与演化

有了 Agent Engine 与持久化层,是不是就生产就绪、可以一路狂奔了?Jake 提醒:还要问「生产就绪」到底意味着什么——即使有了全部原语,现场仍然会有失败,而我们要理解失败的意义。

第一个问题:智能体正确吗?正确不只是抵达正确结果——它有没有随时间表现出我想要的行为?性能如何?快不快?效率高不高?是不是用了太多算力?而且如前面所说,我们谈的不是孤立运行的智能体:本体上的智能体身处多玩家环境、有人类在回路中。于是还要问:工作流可调试吗?你能看清本体的生命周期、理解如何走到终态吗?结果本身高效吗?流程在成功吗?

拿供应链例子说:一张工单进来,我们发现它交付迟了——要回答为什么迟,得去看采购;回到今天的患者出院例子,得去看患者入院——是不是更早的决策影响了后来回路中人类与智能体的决策?而在多玩家工作流里,我们不希望工作流静止不动——希望它演化,在失败中改进。大多数平台只给你原始遥测,「让你对着消防水龙头喝水」;AIP 开箱即用地提供了从遥测中提取价值的途径:这份丰富的结构化信息副产品无需你额外加工——平台不加日志、不要求你思考未来怎么监控,使用平台本身就会更快抵达这些结果。

平台用三个关键维度衡量智能体,而且「没有作业要你做」:每个智能体都会产生遥测,本体精确捕获业务流程里发生的事——不只是单次执行产生了哪些日志行,而是你的组织如何随时间改变。

二、从遥测洪流到叙事:AIP 的三重透镜与智能体时间线

演示从一个制造工作流开始:一份紧急的后排座椅请求进来,交付履行智能体完成了交付创建。屏幕上是一大堆遥测,Jake 让观众看左侧——任何开发者平台的基础预期:追踪(traces)与日志(logs),可以转成 OpenTelemetry、接入任何你喜欢的可观测性工具。但这是简单例子;真正的大事故里,复杂流程会有成百上千条追踪铺满屏幕——「你在冒汗,不知道该看哪里」。你真正想要的不是原始排放物,而是它产生的叙事——这正是右侧的东西。

因为 AIP 产出结构化输出,我们能快速说出这里发生了什么:一个编排器管理的函数处理了交付创建,一个动作改变了本体里交付对象的两个字段,有两次 LLM 调用——甚至能看每次调用的请求、响应与 Token 用量。但这还不是故事。有趣的是同一个输出可以透过多个透镜看:第一,在 AIP Logic 里看这个编排函数的原始版本(我写的转换);第二,Orchestrator 的直接账本——持久计算里发生的每个事件、任务何时开始与完成、调用与进程何时结束;第三,新发布的 AIP Inspect——把数据呈现给运营用户:他们不需要关心这是逻辑函数,但需要理解智能体推理与决策的合理性——一份生成的工单摘要,用户可以深入某个智能体步骤,哪怕它深嵌在「跑着逻辑函数、逻辑函数内部又跑着智能体」的自动化里。

再拉远一步引入「智能体时间线」:看这张工单的完整生命周期,优化与性能的概念包含许多因素——这条交付履行的追踪里,83% 的时间是在等一个报价请求创建后我来回复(「抱歉,那天我起得早」);Token 用量很大,但大部分堆在我的聊天机器人里——所以这里的优化可能不是从单次智能体执行里抠 Token,而简单到「把这个聊天机器人换成表单」。而当智能体在场上运行很久、跨越多个周期,你就会积累起一层丰富的信息基底,可以用来演化这个工作流。

三、32 秒太慢了:AIP Evolve 如何自动优化

Colton 接棒:可观测性基础设施证明「这个人机系统能工作」。但让 AI 系统「能工作」远远不够——它今天能跑不算数,明天、后天、大后天都得能跑。「一直能跑,这才是生产的意义」,而且理想情况下还要越来越好——更快、更便宜、质量持续提升。

看这条追踪:这个智能体跑了 32 秒——「这不够快」。要解决它,可探索的选项太多了:有了丰富基础设施可以看清追踪、理解延迟花在哪里,但如果要人工去修,我得想出一堆优化点子,判断每个改动会不会破坏上游下游,考虑端到端系统与智能体另一端的人类,对每个改动都极其确定——这极其耗时。而想象一下这不是一个智能体,而是几十、几百、几千个,且每个都越来越深地嵌入运营。这正是 AIP Evolve 诞生的原因——智能体优化的新产品:它可以取任何 AI 系统,派出一队队智能体去优化你设定的任何目标——降 Token 成本、提速(本例)、或用评估(evals)衡量的质量提升——并且是在你组织的上下文内完成。

产品流程:从这次执行点进 AIP Evolve,它已捕获可观测性层的全部上下文。第一步定义目标——开箱即用的选项包括优化成本、优化评估分数;本例选延迟,把 32 秒压到这版智能体最快的样子——这是 Evolve 对准的「北极星」。第二步验证策略:用既有评估,还是让 Evolve 基于真实本体数据、真实生产运行(全部扎根于可观测性基础设施)按用例复杂度生成新评估?选多少测试?用已知指标还是 LLM 裁判并排对比?可接受的输出发散程度(精确匹配、允许语义差异、交给 Evolve 判断)?第三步约束:Evolve 允许做哪些改动、动作空间多大——模型换血(换更快更便宜的)、随之而来的提示词调优(每个模型有自己的怪癖)、更彻底的架构级改动(确定性工作与智能体工作的重新划分、改造马具、工具与全部定义)。第四步迭代预算:本例 5 次迭代后必须停下汇报。按下紫色 Evolve 按钮,全部工作与配置移交给 AI FDE——它替我们操作平台,把工作分给子智能体、尽量并行化,带着约束毫不留情地追逐目标。

四、结果与机制:延迟降 60-90%,靠本体与可观测性复利

Colton 提前跑过这次优化,直接展示终态:AIP Evolve 应用里的最终提案,以及优化过程的账本——智能体血统图(agent lineage graph),每个节点代表一次迭代;展开能看到沿途产出的每个子智能体——从早期发现(函数是什么、用什么模型、智能体表现如何、调用哪些下游动作),到开始跑实验:换很小的模型看表现、移除一些工具、看能否抽成确定性逻辑;它追踪所有洞察与工件(比如带优化想法的分支),全部并行发生——试不同选项、跑它构建的评估、持续剪枝、留下有效的。

最终成果:延迟降低 60% 到 90%,视工单复杂度与报价数量而定——三报价案例延迟降 81%,从 45 秒降到 8.8 秒。怎么做到的?提案里写明每一项改动、为什么改、如何验证:先是模型换血——GPT 5.5 换 5.4 mini;随之重写提示词,让 5.4 mini 达到之前那个更大更贵的前沿模型维持的标准;还有架构级改动——把模型调用的一个工具替换成逻辑函数内联的完全确定性函数逻辑,不再动态查询本体,而是预取进智能体上下文;并把一部分 AI 逻辑从循环里抽出来,减少重复工作。验证部分:按本体中的复杂度分层挑选测试用例,点进任何工件都能看到评估长什么样、配置了哪些指标、是否只做了并排评审,甚至能翻到底层表格逐项比较。

一句话总结:Evolve 是 AIP 的新一层,让你在生产的 AI 用例上持续追求优化目标——延迟、成本、整体性能。「它之所以如此强大,是因为一切扎根于本体——你组织的领域模型——以及 AIP 这层丰富的可观测性:看清正在发生什么、什么有效、什么无效。这就是 AIP Evolve 让你复利的方式。」

觉得有用?分享给一个需要的朋友 🙏