主权与能力不再二选一:NVIDIA 与 Palantir 的自主 AI 蓝图

摘要
Palantir 前向部署工程师 Vasil 与 NVIDIA 公共部门现场工程负责人 Tim 在 DevCon 6 上发布了双方的合作成果,开场即抛出一个论断:「你的 AI 主权决定你机构的未来,主权是选择的前提。」在战场上、医院里、工厂车间中做最高风险工作的机构,最不愿意把数据交给别人;它们被迫在「租借前沿能力」与「拥有整套技术栈」之间二选一——前者永远不拥有权重,后者则要继承维护、打补丁、硬件调优的第二职业。
这个取舍是假的:主权与能力并不矛盾,只需要正确的架构。NVIDIA 负责第一部分——Nemotron 3 Ultra(5,500 亿参数的开源旗舰模型)与 NIM(把推理栈装进盒子的 GPU 优化容器),把数周部署压到数分钟;Palantir 负责第二部分——Apollo 以轮辐(hub-and-spoke)架构在数百个集群、气隙网络与边缘环境间分发与维护模型,每周自动完成数十万次升级。
演示中,一个仅允许出站的锁定环境里,Nemotron 3 Ultra 经 Apollo 上线、经 AIP 代理注册,几秒内就成为 AIP 里的一等公民,进入本体支撑的工作流。「主权且前沿」从此不再是非此即彼。
正文
一、AI 主权:押注你的权重,还是押注你的未来
Vasil 用一个论断开场:「你的 AI 主权决定你机构的未来。主权是选择的前提。」放弃它,就等于把未来的选择权交给了别人。这一点在「权重」(weights)上体现得最明显——权重是你机构经年累月蒸馏出的艰难赢得的知识:控制它们,你就控制了自己的命运;失去它们,你的 alpha 就流进了别人的生意。
这不是理论问题。在战场、医院、工厂车间做最高风险工作的机构,恰恰是最不愿意把数据交给别人的机构。于是它们感觉自己被迫站队:要么「租借前沿」——能力来得快,但你永远不拥有自己的权重;要么「拥有整套技术栈」——保有控制权,却继承了第二份工作:维护、打补丁、漏洞修复、硬件调优、分发——而且有时候,模型根本没走到真正的业务问题上。
Vasil 断言这个取舍是假的:「主权与能力之间没有矛盾,你只是需要正确的架构。」问题归结为两个:第一,你必须拥有自己的 AI——模型、权重、它们运行的 infrastructure;第二,你必须让它交付——AI 必须保持最新、安全,覆盖你运行的每一个环境——从 100 座工厂到气隙网络(air-gapped network)到边缘——然后直接投入你的问题。NVIDIA 解决第一个问题:交付世界级的开源模型,针对硬件调优、随处可部署;Palantir 通过 Apollo 解决第二个问题:在全部版图内分发并维护这些模型。AIP 再把它们转化为安全、精确、运营性的价值——你的数据始终不离开你的控制。「主权且前沿,不再是取舍。」
二、Nemotron 3 Ultra 与 NIM:把推理栈装进盒子
Tim 介绍 NVIDIA 的立场:AI 智能的未来需要开放、协作的生态。NVIDIA 通过提供开源模型引领这场运动,让合作伙伴可以集成、定制与创新——从物理 AI 到智能体 AI;他们正在快速扩张开源仓库,为各大行业点燃全球创新。「我们不只是造世界上最好的硬件,我们还在驱动让硬件活起来的开源软件栈。」
开源模型的核心是 Nemotron 模型家族,专门为跨各种计算足迹的高效智能推理而设计——从灵巧的 nano 配置到企业级规模架构,把顶级认知能力民主化。旗舰是 Nemotron 3 Ultra:5,500 亿参数,专为前沿级推理、复杂编排与多轮智能体工作流打造,适合从基础问答迈向自主智能体 AI 系统的企业。三个突破让它脱颖而出:从多位专家教师学习;单个检查点同时运行在 Hopper 与 Blackwell 架构上;为真实的智能体工作流训练——开发者得到更高的智能、更简单的部署、更可靠的自动化。Ultra 在指令遵循、编程与长程规划上「越级打怪」,通过优化 Token 效率降低单任务成本同时保持高精度——最激动人心的是,它生成 Token 的速度比领先的替代开源模型快五倍。
但伙伴们的第一问往往是:推理栈怎么搭、怎么确保优化?自建 DIY 适合早期原型,很快会变成运营蔓延。于是 NVIDIA 构建了 NIM——「装在盒子里的 LLM 推理栈」,从底层为特定 GPU 集群配置优化。NIM 把部署与运营模型的复杂性接过去:托管式 API 的简单性加自托管式控制;微服务打包了最新模型、优化推理运行时、标准推理与可观测性 API,以企业级容器形式随处运行——工作站、本地数据中心甚至云端。用 NIM,几分钟就能启动生产就绪的模型端点,内置可观测性、自动扩缩与更新。通常部署企业级开源模型需要三到六周的人工工程、性能优化、安全加固与基础设施搭建——NIM 开箱即用地自动化整个生命周期。
三、Apollo:软件交付操作系统与轮辐架构
NIM 优化的是「给定集群上的推理栈」,下一个挑战是跨集群管理升级与部署:企业跨多个节点、直到边缘扩展多个 LLM,如何应对几十乃至上百个部署?把 NVIDIA NIM 发布到 Palantir Apollo Hub,伙伴就能通过 Palantir 的轮辐架构在全部环境中自动部署与升级 LLM——NIM 的 GPU 优化加上 Apollo 的无缝部署管理。
Apollo 被定义为「软件交付的操作系统」:声明你要运行什么、在哪里、哪个版本,它就在每个环境里持续维护——自行升级、打补丁、监控,同时把停机降到最低。「结果是主权基础设施,却没有运营税。」Palantir 自己的软件也通过 Apollo 发布;一周内自动完成的升级以数十万计。发现漏洞时,受影响的版本自动从生产环境撤回——无需人工清查、无需作战室;新版本通过推广管道(promotion pipeline)凭实力进入生产:从金丝雀(canary)开始,按风险与合规要求向下游推进。
值得单独一提的是轮辐架构:辐条(spoke)就是你的软件运行的环境,而这些环境不需要任何入站连接——它们只主动联系中心(hub)。这让 Palantir 与伙伴能把软件送到其他方案根本够不到的环境:气隙网络、仅允许出站的锁定环境。
四、从模型到价值:AIP 代理、本体与演示实战
即便前沿模型也只是原始能力——「没有上下文的智能」;只有当它连接上你的运营、数据、逻辑与行动能力时才产生价值。这条连接组织就是本体:人类团队与 AI 团队共享的世界;模型在这里停止在聊天界面里回答问题,开始做工作——驱动智能体、采取行动、写回支撑你业务的系统,处于单一治理模型之下,数据不离开你的控制。「把 Nemotron 接入 Apollo 只是又一次部署:它经 Apollo 到达、注册,立刻对所有已经建在本体上的工作流可用。」你编码进本体的专长会复利——「你的 alpha 就在你的本体里」。
演示从 NGC 目录走到 NVIDIA NIM 页面,选 Nemotron 3 Ultra,用为此构建的「发布导入器」(release importer):把整个容器镜像推给 Apollo 扫描,或直接引用 NGC 上的容器镜像;可以按模块或单个产品发布;列出默认配置与 Helm 值,开始推送。权重由 Apollo 在发布管线通过后,在目标辐条上直接从 NGC 拉取。打开 Apollo Hub:Nemotron 3 Ultra 已经在这个环境里运行——而这个环境是锁定的、仅允许出站,从外部根本无法抓取模型。
让它工作只需部署 AIP 代理——一个标准 Apollo 模块,UI 上点几下或 Apollo CLI 一条命令——然后 Nemotron 3 Ultra 出现在 Foundry 里、注册进 AIP,享有与 AIP 一等公民相同的访问控制与 Token 预算。在 AIP Logic(Foundry 的点击式智能体构建器)里,它立刻就能跑第一次试运行——一个主权、由 NVIDIA 驱动的模型,随时准备创造并捕获 alpha。一个模型、一个环境、一个工作流;而 Apollo 把这一切扩展到「每个环境中保持最新的每个模型」,驱动数千个智能体对真实运营发力。
觉得有用?分享给一个需要的朋友 🙏