Vault

不是 Token 最大化,而是 Token 最小化:AIP Evolve 的智能体降本之道

cover

摘要

Palantir 发布新产品 AIP Evolve——为 AIP 打造的智能体优化层。它解决一个规模化痛点:一个智能体做概念验证很酷,几十上百个也还行,但当你有成百上千个智能体在生产环境里运行,如何让它们持续变好、同时把成本压下来,就成了全新难题。Evolve 派出一队队「优化智能体」,自主完成模型换血、提示词调优、乃至从本体中挖掘确定性逻辑。

演示结果极具冲击力:仅把 GPT 5.1 换成 5.4 nano,某个库存分配函数的计算成本下降 97%,延迟改善,质量反而提升 7 个百分点;另一个告警分诊函数通过「Sonnet 换 Haiku + 显式分类规则」整体降本 35%。更惊艳的是第三例:Evolve 发现本体里一份未被充分利用的结构化替代品数据,直接短路了两次 LLM 调用——成本再降 31%,同时彻底移除部分 LLM 使用,动作保真度分毫未损。

核心理念一句话:不是 Token 最大化(token maxing),而是 Token 最小化(token mining)——用本体、数据、确定性逻辑去换 Token,用同样的产出、几分之一的成本,把价值创造推到最高。这是「价值证明」而非「工作量证明」。

正文

一、AIP Evolve:为规模化而生的优化层

Chad Wallquist 开门见山:今天要发布的新产品 AIP Evolve,围绕的是「智能体如何随时间变得更好」这个演化主题——不仅要让智能体更好、更高效,还要帮企业降低成本、在生产环境中管理它们。Colton 进一步定义:Evolve 是 AIP 的优化层,它接管已有的用例或全新构建的东西,解决三个问题——如何更快进入生产?如何让它越来越好?如何先在「前沿」用最新最强的模型做原型,等要规模化、开始认真算成本时,再逐步「回退」到更便宜的模型甚至开源模型?

这种回退不是简单换模型,而是带领域特定优化的整体降级:如何改写提示词、给智能体什么工具、如何用本体(ontology)建模企业——这一切都在后台由「智能体舰队」自主完成。核心动机很朴素:「有一个智能体做 PoC 很酷,哪怕有几个也行;但当你拥有成百上千个时,事情就变得困难得多。」这就是 Evolve 存在的意义。

二、从 GPT-5.1 到 nano:一次模型换血省下 97%

演示从痛点开始:某个 AIP 逻辑智能体里,GPT 5.1 是最重型的 Token 消耗者。走进 AIP Evolve,启动一次「进化」(evolution)——配置一队队智能体去达成一个目标:迁移、基于评估(evals)的优化、基于终端用户反馈的优化、或成本优化。可以手动指定某个逻辑函数,也可以让 Evolve 基于平台内的全部用量数据自动「狩猎」降本机会。本例选中库存分配(inventory allocation)函数,目标设为优化成本。

接下来是关键一环:如何验证改动不造成回归?如果函数已有评估集可以直接接入;没有的话,Evolve 会从企业真实数据中挑选测试用例——它不会编造随机无意义的用例,而是扎根在本体里,采样真实世界的生产执行(比如真实客户订单),默认 30 个测试用例。然后定义比较方式:与基线输出的并排 LLM 裁判(LLM-as-a-judge)对比;并设定可接受的发散程度——要求精确匹配、允许语义等价、还是让 Evolve 自行判断。再往后是允许 Evolve 采取哪些变更:模型换血、提示词调优、甚至更深的架构级改动——把确定性逻辑从 LLM 调用中抽出来、更依赖本体与企业领域模型、重新设计智能体的工具与函数调用结构。最后加上预算约束(本例为 5 次迭代),审查所有选择,按下紫色 Evolve 按钮。

结果:计算成本下降 97%——仅仅因为把 GPT 5.1 换成 5.4 nano。延迟改善(更小的模型理所当然),质量反而提升了 7 个百分点。展开详情可以看到 Evolve 如何把各种生产场景分层分类——紧急关键词、关键路径、自动创建的订单、缺货路径——确保覆盖逻辑的不同分支,并说明为什么覆盖可信、存在哪些局限。评估套件里 30 个测试用例全部经过 LLM 裁判逐条与基线核对。有趣的是,基线模型在自我对比时反而因非确定性而错误频出,nano 在这个用例上却保持了惊人一致性。并排查看关键输出差异,如果某个改动让你不安,可以否决它、修订它,最后合并。

三、提示词优化:让 Haiku 打出 Sonnet 的水平

第二个例子针对「维护工单解决」逻辑函数:接收告警、适当分诊、送达最终解决方案,其中几个 LLM 块用 Claude Sonnet 4.6 做分诊。Evolve 瞄准它后,整个函数的计算成本下降 35%:把第二处 LLM 从 Sonnet 换成 Haiku 4.5,并往提示词里加入更显式的分类规则——把「这条告警属于哪类维护」的可能选项铺成显式枚举,说清什么触发什么分类——让 Haiku 打出 Sonnet 的水平。单看那个 LLM 块,成本下降 53%,整体函数降 35%,还顺带改善了延迟,与基线相比输出毫无变化。

用 LLM 裁判加关键词匹配核对输出,得到的是与原始输出的完全对等——只有一些无关痛痒的小差异(Haiku 更简洁、更爱显式引用规则)。Token 用量表同样亮眼:更便宜的模型、更少的 Token——「这不一定每次都发生,但这就是我们追求的:跨提示词持续优化」。用 Chad 的话说,这是「先让它跑起来,再让它更好」的工程哲学的又一次体现——「微调这些随机函数是一门新艺术,而工具能帮我们把这门艺术规模化」。

四、用本体换 Token:确定性逻辑的复利

最后一个维度:本体本身也是优化杠杆。Colton 指出常见的反模式——把一切都丢给 LLM、要求它做不切实际的事。本体的价值在于把 LLM 扎根于业务的现实:组织里语义明确的数据、逻辑与动作。于是优化时应该批判性地问:哪些地方可以用 Token 换本体?哪些结果可以更多地依靠数据、逻辑与动作,而不是把一切委托给一个根本不该做这件事的模型?

第三个演示回到同一个库存分配函数:这次不允许模型变更,只允许「更多依赖本体」——利用企业数字孪生的复利效应。结果:计算成本再降 31%,而且函数里彻底移除了部分 LLM 调用——代价为零,动作保真度与决策等价性分毫未损。Evolve 发现本体里有一份未被原逻辑函数充分利用的数据:已知替换品(known replacements)的结构化数据。原先的做法是用 LLM 做语义搜索、让能调用工具的智能体到处查「什么货物可以替换什么」;而实际上直接查那份结构化数据就能短路一切 LLM 调用,把复杂的智能体逻辑与语义搜索留作没有结构化数据时的兜底。附带收益:更依赖结构化输出,把部分智能体动作分派移入结构化逻辑,函数里两处 LLM 调用被砍掉,最终只保留 GPT 5 mini。

Chad 感慨这是他们天天拿来演示的函数,Evolve 一跑就发现了可优化点——非常真实:本体随时间变化,属性增增减减、分支版本化,一周前设计的用例,这周来做可能完全是另一个设计。Evolve 的价值就是抓住这些「积少成多的小偏差」。它是一台「活的呼吸的有机体」——核心不是 Token 最大化而是 Token 最小化:「能否用几分之一的成本拿到同样的输出?价值就上去了。我们关注的是以最低成本驱动结果,这是最高的价值创造——价值证明,而不是工作量证明。」

觉得有用?分享给一个需要的朋友 🙏