Vault

成本降 68%、专家更爱新版:AIP Evolve 在坦帕总医院的临床落地

cover

摘要

坦帕总医院(Tampa General Hospital)是全美领先的学术医疗中心、做实体器官移植最多的机构——其他医院处理不了的复杂病人都送到这里,其病历的庞大与复杂程度可想而知。医务咨询服务的医学主任 David Zier 在 DevCon 6 上讲述了他们与 Palantir 一起解决的核心问题:利用率审核(utilization review)——一份介于临床摘要与法律文书之间的文件,决定病人是否承担大额自付费用、出院后能否获得康复或居家服务,也决定医院能否拿到付款。

AI 支持的临床摘要把医生顾问的产能提高了近五倍、利用率护士近十倍——但大规模部署后「账单来了」。AIP Evolve 上场:把两处 Claude Sonnet 换成 GPT-5-mini 并重写提示词,计算成本降 68%,专家并排盲评中 90% 更偏爱优化版;更妙的是第二类优化——发现一处 GPT 4.1 的调用根本不需要 AI,改用纯确定性 TypeScript 函数,84% 的调用被替换,砍掉数十万乃至上百万次模型调用。

Zier 的结论:这是每家医院都绕不开的路,TGH 想做的只是把蓝图画出来——用 AI 化的流程替换陈旧的流程,把人力还给直接的患者照护。

正文

一、利用率审核:决定医院生死的「临床摘要加法律文书」

David Zier 先交代背景:坦帕总医院收治的病人复杂到其他医院无法处理,这种复杂性直接产生「超级海量、超级复杂」的病历。而他们要解决的问题叫利用率审核——除非你深扎医院管理层,否则大概率没听过。它本质上是病人临床摘要与法律文书的结合体:论证这位病人为什么需要他所需要的服务。每家医院、每位病人、每天可能要做多次。

这份审核对病人意味着:是否承担高额自付费用、出院后能否获得康复或居家服务等资格;对医院则关乎财务生死——决定你能否拿到钱、为哪些项目拿到钱、会不会被拒付。医院的利润率不到 2%,已经有过医院因为利用率实践糟糕而倒闭。「这是一个极其关键的环节。」而制作利用率审核需要非常专业的护士:要翻遍病历——「批准与拒绝之间的差别,往往只是藏在病历深处某段笔记里的一小点信息,那甚至可能不是医生写的笔记」。指望人类持续深挖这些病历、确保病人获得最优照护资格,本质上是个限制因素,而且充满变数。

这正是与 Palantir 合作的完美用例。除了利用率审核,还有一批性质相同、只是受众与目的不同的审核(能否继续留院、案件被拒等)——翻病历的工作量几乎一样。而且这不是简单的数据挖掘:要建起关系层,创造一个「活的病人」——把这个疾病过程连接到这个治疗方案、这个计费代码、这个结局。Zier 强调,专注发展本体正是项目成功的很大一部分原因。

二、从原型魔法到规模账单:AIP Evolve 登场

成果相当惊人:他们开发的 AI 辅助临床摘要完成了利用率审核,医生顾问的产能因这项技术提高了近五倍,利用率护士提高了近十倍。「我们对它上瘾了,不会离开它。」但 Zier 随即给出警告:原型阶段的 AI 是魔法、美妙无比;一旦开始大规模部署——「我们收到了账单」。这正是 AIP Evolve 登场救场的地方:通过不同手段帮他们把成本降了大约 70%。

Colton 的演示展示了护士与 AI 每天协作的审核现场:利用率管理审核中心(utilization management review hub)里,左侧是 AI 提出的利用率审核——护士会修订、编辑、接受、发送;右侧是对应的病人病历。大规模生产这些审核非常昂贵,但优化成本不能以更差的临床叙事、更差的证据选择为代价——这是个极其微妙的平衡。

战术问题是:到底优化什么、有哪些杠杆?先得理解一份审核是如何产生的。Colton 展示了利用率审核在本体中的旅程——被不同的人类与 AI 动作操纵:一串自动化被调用,是确定性逻辑与智能体逻辑的混合;从左到右,工作在人机之间交接,复杂度不断上升。而利用率审核不是孤立存在的,它连着患者授权、文档处理等上下游流程。正因为整个端到端图景如此复杂,你无法随便挑一个节点说「把贵模型换成便宜模型」——谁知道这会如何影响基于最终审核结果做出的下游决策?而因为这一切复杂度都被建模在 TGH 本体里,你可以在整个复杂度上推理,做出明智的优化。

三、模型换血加提示词调优:成本降 68%、专家更爱新版

把 AIP Evolve 指向这套极其复杂的利用率管理审核系统后,它返回了数据在系统中流动的解构、LLM 的使用位置、不同逻辑分支下的条件差异,以及它眼中最高的优化机会清单。第一个机会是某个「标准匹配智能体」(criteria matching agent)——拿指南判断是否适用于某位病人、综合出利用率审核叙事。Evolve 识别出两处正在用 Claude Sonnet 的地方,可以整体换成 GPT-5-mini:成本降低 68%,以一些可接受的延迟为代价,Evolve 判定为「性能等价或更优」。

但「Sonnet 比 GPT-5-mini 贵」谁都知道,凭什么信任这个落点?滚动详情:除了模型换血,还附带了一次提示词优化——让 GPT-5-mini 比 Sonnet 表现更好。验证分两部分:第一部分是测试用例选择——Evolve 智能地生成基于真实本体数据、真实生产运行的用例,覆盖不同科室、不同笔记复杂度、不同笔记量,刻意去敲打这段逻辑、看它在哪里会失败、在哪里没问题,再做优化版与未优化版的并排比较。第二部分更关键——真正的问题在于:系统另一头读这些利用率审核的护士,会信任输出吗?Evolve 为此构建了一个完全自定义的 OSDK 应用,基于 TGH 本体采样一批需要专家评审的测试用例:旧版输出对新版输出、它的分析、以及最相关的本体上下文(病人病历、笔记、化验),专家可以逐用例给出通过/失败反馈。TGH 的一位专家真的做了全部评审。

迭代过程完整留痕:Evolve 筛选了跨提供商的整套模型——GPT 4.1、Mini、新一代 Nano、Claude Haiku、Gemini Flash——基于评估与专家反馈排除一些、留下一些继续优化,再为每个候选模型定制提示词。最终提示词对比很直观:左侧是未优化的 Sonnet 版提示词(一些提示、规则、本体上下文),右侧是 Evolve 优化后的版本——极其详细地写清了语气、该包含与排除的细节、如何组织利用率审核让终端用户最容易解析——「真正触及了专家和护士读这些审核时在意的东西」。最终成果:计算成本低 68%,而专家并排盲评中 90% 的时间更偏爱优化版——同时拿到更低成本与更高品质。

四、连 AI 都可以不要:确定性 TypeScript 的 84% 替换

第二类优化完全不同:Evolve 审视系统里 AI 的使用位置,发现一处正在用 GPT 4.1 的地方——分析本体中的语义关系与逻辑文档后,它判断这里可能根本不需要 AI。在演化过程中,Evolve 构建了一个完全确定性的 TypeScript 函数,用评估验证后注册进本体,并在 AIP 逻辑中条件性地替换掉 AI 调用:84% 的情况下可以从「用 GPT」完全切换到「用这段确定性 TypeScript」——砍掉数十万乃至上百万次对 GPT 的调用,成本进一步下降。

Colton 总结主旨:Evolve 是一个会为你孵化智能体的引擎,但它是围绕你真正的目标做优化——最大化你用 AI 创造的价值。「有时这意味着换模型,有时意味着优化提示词,但也可能意味着彻底拿掉 AI——因为这些都只是实现细节,位于 AI 能为组织交付的真实价值之下。」Zier 收尾:这条路对每一家医院都是必然,TGH 想做的只是帮大家画出蓝图——用 AI 加持的、运转得更好的流程替换这些陈旧的流程,然后把资源重新部署到最重要的地方:直接的患者照护,让临床医生把更多时间花在病人身上,而不是行政工作。

觉得有用?分享给一个需要的朋友 🙏