Vault

OpenAI CPO 谈 AI 如何改变核心技能、护城河、编程与产品管理

摘要

Kevin Weil 是 OpenAI 首席产品官,此前曾担任 Instagram 产品负责人、Twitter 产品副总裁,并在 Facebook 联合创建了 Libra 加密货币项目。在本期对话中,他系统性地分享了在 OpenAI 工作的核心体验:技术底座每两个月就会发生质变,产品经理必须学会在"模型正确率 60%"与"模型正确率 99.5%"之间构建截然不同的产品形态。他提出编写评估 (Evals) 正在成为产品构建者的核心技能,并深入阐述了 OpenAI 如何通过迭代部署 (Iterative Deployment) 和模型最大化 (Model Maximalism) 两种哲学实现高速交付。他将大语言模型 (LLM) 类比为"经过不同微调的人类集合",揭示了模型集成 (Ensemble) 与微调 (Fine-tuning) 的实战逻辑。在创业方向上,他援引 Ev Williams 的名言——"公司墙外的聪明人永远比墙内多"——指出行业专有数据与垂直场景是不可替代的护城河。关于未来,他认为个性化 AI 辅导 (Personalized AI Tutoring) 可能是 AI 最重要的一项应用,而产品团队将不可避免地嵌入研究型工程师。他坦言 Libra 是其职业生涯最大的遗憾,并分享了一条来自扎克伯格的人生信条:伟大不是来自某个银弹,而是"长期持续地做好工作"。

正文

吉卜力风暴:ImageGen 如何引爆社交网络

2025 年 4 月,OpenAI 发布了新的图像生成模型 (ImageGen),一夜之间,社交媒体被"吉卜力化" (Ghiblification) 的照片淹没——人们纷纷将生活照、家庭合影转化为宫崎骏动画风格。Kevin Weil 回忆,这种爆火并非毫无征兆。模型上线内部测试后,公司里开设了一个共享画廊,员工可以生成图像并看到同事的作品,"那里从不间断地热闹"。这与他在 Instagram 构建 Stories 功能时的体验如出一辙:团队内部先行使用,周末回来后彼此自然而然地聊起对方的动态——"这东西真的管用"。

Weil 认为,对于社交属性的产品,内部反响是极其可靠的前瞻信号:公司内部本身就是一个紧密的社交网络,员工同时又是产品专家;如果社交功能在内部都未能引发自发热度,就该反思产品方向。ImageGen 的能力远不止风格迁移——它可以接受两张图片,一张是客厅布局,另一堆是想要摆放的物件,然后按指令精确排列;它擅长复杂的多步指令跟随,这才是其深层价值所在。

加入 OpenAI:九天的煎熬与一顿晚餐的缘分

Weil 离开 Planet 后本打算陪孩子过暑假。他给 Sam Altman 打了通电话——此前多年间,Sam 总会向他推荐各种前沿技术项目,从核聚变公司到各类硬科技创业。但这一次,Sam 的回答不同:"我们正在考虑一些事情,你应该来聊聊。"

面试节奏极快。Weil 在几天内见到了大部分管理团队。Sam 亲自上门共进晚餐,两人聊 OpenAI 的愿景与未来,气氛融洽。Sam 当晚告诉他:"明天更大的面试轮次,别紧张,如果顺利的话基本就定了。"第二天 Weil 见了一连串人,自我感觉良好。然后——沉默。周末过去了,周一、周二、周三……他反复联系 OpenAI 方面,始终没有回应。九天的焦虑中,他不断在脑海中回放每一段对话,对妻子 Elizabeth 反复追问"我到底哪里搞砸了"。最终,九天后对方回复:"哦,进展不错,来吧。"原来是内部事务繁忙导致的延误。Weil 感慨,这和谈恋爱发消息得不到回复时的焦虑一模一样——教训是:别急于下结论,保持一点冷静。

OpenAI 的节奏:技术底座每两个月剧变

被问及 OpenAI 与此前工作最大的不同,Weil 给出两个关键词:速度技术不确定性。在 Instagram、Twitter 等公司,技术底座相对稳定——今年用的数据库可能只比两年前好 5%。但在 AI 领域,每两个月计算机就能做到此前从未做到的事情,你必须彻底重新思考自己在做什么。

传统的软件逻辑是确定性输入、确定性输出:按钮做特定的事情,做三次得到三次相同结果。而大语言模型 (LLM) 完全不同:它擅长模糊的、微妙的输入(自然语言的全部细微之处),但不会每次给出完全相同的文字输出——精神上类似,形式上不同。这意味着产品形态极度依赖模型在特定任务上的正确率:如果模型 60% 的时间做对,你要构建的产品与 95% 正确率或 99.5% 正确率时截然不同。数据库出错一次等于永远出错,但 LLM 的世界不是这样运转的。

评估 (Evals):AI 产品开发的核心技能

Weil 在 Lenny & Friends 峰会上的一句评论广为传播:"编写评估 (Evals) 将成为产品经理的核心技能。"Evals 本质上是给模型出的"测验题"——就像微积分课后的考试,用于衡量模型在特定领域(创意写作、研究生科学、竞赛编程等)的能力水平,也可以类比为模型的单元测试 (Unit Tests)。

为什么如此重要?因为产品的形态取决于模型在你关心的用例上到底能做对多少次。而评估不是静态的——它是持续学习过程的一部分。Weil 以深度研究 (Deep Research) 产品为例:用户可以向 ChatGPT 提出一个本需自己花一周完成的复杂问题,模型会自主检索、阅读论文、发现知识空缺、补充研究,30 分钟内产出相当于一周工作量的答案。在构建该产品时,团队同步设计 Evals:定义英雄用例 (Hero Use Cases),将"好问题+好答案"转化为评测基准,然后在模型微调过程中持续观测 Evals 表现是否在爬升——当曲线开始上行,团队才有信心说"我们有产品了"。

Weil 进一步指出,模型的智能是多维的:竞赛编程强不等于前端编码强,也不等于将 COBOL 代码转写为 Python 强。更重要的是,世界上大量数据、知识和流程并不公开——它们藏在公司或政府的围墙之内。就像新员工入职需要两周学习公司特有的流程和数据一样,模型足够聪明,可以学习任何东西,但需要原始数据。因此,未来的格局将是:极其智能的通用基础模型 + 针对公司或行业专有数据微调 (Fine-tuning) 的定制模型,而衡量后者的工具就是定制 Evals。从这个意义上说,AI 的能力上限某种程度上受限于我们编写 Evals 的水平。

创业者的机会:OpenAI 不会做的事

Ev Williams 在 Twitter 时期常说的一句话深植于 Weil 心中:"无论你的公司变得多大,墙外聪明人的数量永远远超墙内。"这正是 OpenAI 如此专注于构建优秀 API 的原因——他们拥有 300 万开发者。无论 OpenAI 多么雄心勃勃、规模多大(而且他们并不想过于庞大),AI 能改善生活的场景无处不在,他们既没有人力也没有行业诀窍去覆盖大多数领域。

数据是行业特有的、用例特有的、藏在公司围墙之内的——每一个行业和垂直领域都存在利用 AI 改善现状的巨大机会,OpenAI 不可能、也不想去包揽一切。他们真正想做的,是为数百万开发者乃至更多未来的构建者提供底层能力。

迭代部署与模型最大化:OpenAI 的交付哲学

OpenAI 如何在技术剧变中持续快速交付?Weil 坦言他们会做季度路线图和年度战略,但他绝不相信写在文档里的计划会准确反映三个月后实际交付的内容——引用艾森豪威尔的话:"计划毫无用处,但规划过程本身很有价值。"季度路线图的价值在于:停下来回顾"做了什么、什么有效、什么无效、学到了什么",然后调整方向、对齐依赖关系,再开始执行。但计划必须轻量,因为技术底座在持续变化,中途一定会推翻重来。

团队运作高度自下而上 (Bottoms-up),只受大方向对齐的约束。Weil 欣赏 Sam Altman 推动团队高速前进的同时,也理解快速行动必然伴随失误——发布的东西不完美就回滚。以模型命名为例,"o3 mini high"这样的命名堪称灾难,但命名不是最重要的事,不值得花大量时间优化。

Weil 介绍了两种核心产品哲学:

  1. 迭代部署 (Iterative Deployment):没有人完全了解这些模型的全貌,因此与其等到完美再发布,不如先交付再与用户共同迭代。OpenAI 与整个社会在公开环境中协同进化,共同学习模型的长处与局限。

  2. 模型最大化 (Model Maximalism):模型不完美,会犯错。你可以花大量时间搭建各类脚手架 (Scaffolding) 来弥补缺陷——有时确实需要,因为某些错误不可接受。但大部分情况下,不值得为暂时性局限大费周章,因为两个月后更好的模型就会推出,现有局限将被一扫而空。Weil 对开发者的建议是:如果你的产品恰好处在模型能力的边缘,继续做下去——你做对了。再等几个月,模型就会变得极好,那个勉强工作的产品将突然焕发光彩。

Bolt(StackBlitz 旗下)的案例印证了这一点:团队在幕后打磨了七年,产品一直不起色,直到 Claude Sonnet 3.5 发布,一切突然运转起来。Y Combinator 的诸多项目也在经历同样的"等待模型追上"的曲线。

用"人类类比"设计 AI 产品

Weil 分享了一个他自认本应更早意识到的发现:在推理 AI 产品应该如何工作时,把模型当作人类来类比往往行之有效。几个实例:

推理模型 (Reasoning Model) 的 UI 设计——当 OpenAI 首次推出能进行多步推理的模型时,这是第一个需要"坐下来想一想"的消费者产品。如果模型思考 25 分钟(如 Deep Research),反而容易设计——用户会去做别的事。但 10 到 25 秒的等待最棘手:足够长以至于令人焦躁,又不够长去做别的事。Weil 问自己:"如果有人问我一个问题,我需要想 20 秒才能回答,我会怎么做?"不会一言不发地沉默 20 秒,也不会把脑海中每一条念头都念出来。更自然的反应是说"好问题",然后给出简短的思考进展。这正是他们最终交付的设计——不是原始的思维链 (Chain of Thought),也不是静默的进度条,而是介于两者之间的有意义摘要。

模型群策 (Ensemble Reasoning)——让一组模型各自尝试解决同一问题,再由一个模型整合所有输出给出最终答案。这听起来就像人类的头脑风暴:和思维不同的人一起讨论,往往比独自思考产出更好的创意。

DeepSeek 发布后的调整——OpenAI 最初只展示模型思考的小标题。DeepSeek 采用了更激进的透明方式,完整暴露思维链。团队内部也觉得看到模型的原始思考很有趣,但面向 4 亿用户,"模型喋喋不休三段话"可能不是最佳体验。最终他们选择了一个折中方案:用一两个句子概述模型的思考方向,既提供信息又不至于信息过载。

聊天界面:被低估的通用交互范式

许多人嘲笑聊天 (Chat) 界面,认为它不是人机交互的未来。Weil 持相反观点——他认为聊天是一种极其出色的界面,因为它极其通用。人类正是通过非结构化的语言交流来沟通的:面对面交谈、视频通话、WhatsApp 发消息,本质上都是同一套无固定格式的沟通方式。如果限制沟通接口的灵活性,能够表达的事物就会大幅减少,反而阻碍了最大带宽的交流。

过去的聊天界面之所以无效,是因为没有足够好的模型来理解人类语言的全部复杂性和微妙之处——这正是 LLM 的魔力所在。聊天界面恰好匹配了 LLM 的能力边界。Weil 强调,这并不意味着聊天是唯一界面:对于高频率、流程相对固定的垂直场景,更结构化的专用界面确实更高效。但聊天应该作为兜底——当任何垂直场景无法覆盖的边缘需求出现时,你需要一种零限制的沟通方式,而聊天正是这种"万能兜底"。

研究与产品团队的融合进化

ChatGPT 最初只是一个低调的研究预览版 (Research Preview),团队并未预料到它会成为现象级产品。彼时的 OpenAI 本质上是一家纯研究公司。随着 ChatGPT 爆发式增长、B2B 产品和 API 体系逐步建立,OpenAI 正在从纯研究机构转型为兼具世界级研究能力和世界级产品能力的组织。

Weil 强调,OpenAI 永远不应成为纯产品公司——必须同时保持两种卓越。最差的做法是:研究者独立构建模型,产品团队像 API 消费者一样拿来使用。最好的产品需要工程、产品、设计和研究作为一个团队紧密迭代:理解要解决的问题、编写 Evals、用 Evals 收集数据、微调模型、验证提升——这是大量的来回反馈。每当团队以这种方式运作,就总能构建出出色的产品。这是一种新的肌肉,但团队已经越来越适应。

产品经理哲学:精干、高能动性、决断力

OpenAI 只有约 25 名产品经理。Weil 坚信组织应当"PM 轻量化"——太多的 PM 会制造出满世界的幻灯片和点子,而非实际产出。理想状态是一位 PM 配略多于常规数量的工程师,这意味着 PM 没有余力微观管理,必须将大量决策权和影响力留给工程师。前提是拥有一支极度产品导向、高能动性 (High Agency) 的工程师团队——OpenAI 恰好拥有这样的团队。如此一来,团队感到充分赋能,PM 专注于理解问题并轻柔地引导方向,整体运转极快。

在招聘 PM 时,Weil 最看重三个特质:

  1. 高能动性 (High Agency):不等待许可,看到问题就去解决。
  2. 拥抱模糊性 (Comfort with Ambiguity):OpenAI 的问题高度不确定,没有人会给你划定清晰的领域和任务——这对初级 PM 尤其困难。
  3. 通过影响力领导 (Leading Through Influence):PM 本就不拥有团队的汇报线,在 OpenAI 还要面对自我驱动力极强的研究团队,情商 (EQ) 和建立信任的能力至关重要。

Weil 特别强调了 PM 的决断力 (Decisiveness)。Sam Altman 的做法是典范:如果他在每个会议上都做每个决策,那是错误;如果他在任何会议上都不做决策,同样错误。关键在于判断何时该放手让团队创新,何时必须由某人拍板——尤其是当决策涉及众多分散的利弊权衡,且无人感到有权或敢于做主时。PM 在微观层面也要扮演同样的角色:在模糊性中确保决策被做出、团队向前推进。

Vibe Coding:从概念到实践

Weil 引用了 Andrej Karpathy 创造的术语"氛围编程" (Vibe Coding)。工具如 Cursor、Windsurf、GitHub Copilot 越来越擅长建议代码,用户的使用方式正在演变:早期是给出提示、审查输出、编辑、再给提示的循环;随着模型进步,用户开始更放手——模型建议时只需不停点击"是、是、是",当编译出错就把错误信息粘贴进去说"继续",当运行结果不理想就输入一条修正指令再说"继续"。

Weil 坦言,OpenAI 内部虽然大量使用 ChatGPT 来总结文档、撰写产品规格,甚至用模型帮助编写 Evals,但他对自己仍然感到失望——如果将五年前在别的公司做产品的自己传送到今天的工作场景,他依然能认出大部分工作流。他认为产品团队本应更激进地使用 AI:与其在 Figma 中展示设计稿,不如用 30 分钟氛围编程出可交互的原型来验证概念。OpenAI 的首席人事官 Julia 就是一个例证:她用 Windsurf 氛围编程了一个在上一家公司很想拥有的内部工具。如果首席人事官都能做到,产品团队更没有借口。

产品团队的未来:嵌入研究型工程师与模型集成

Weil 预测,未来的产品团队将内置研究型/机器学习工程师角色。他对整个行业对微调模型 (Fine-tuned Models) 的采用程度之低感到惊讶:通用模型虽然已经很好,但在特定用例上,微调几乎总能带来显著提升。未来 AI 将像晶体管一样无处不在,成为一切的基础设施,而其中大量将是针对特定场景微调过的模型——没有理由不为你的用例做专门的优化。

关于模型集成 (Ensemble),Weil 揭示了 OpenAI 内部的真实运作方式:面对 10 个问题,他们不会简单地用同一个通用模型处理所有请求,而是可能调用 20 次模型——使用不同大小的模型满足不同的延迟和成本需求,使用专门微调过的模型处理特定子任务,配以定制提示词 (Custom Prompts)。核心思路是将复杂问题拆解为更具体的子任务,用专门化模型分别攻克,再由集成系统拼合出整体答案。

他以客户支持为例:OpenAI 有 4 亿多周活跃用户,客服团队却只有 30-40 人——远少于同等规模的公司。秘诀在于高度自动化:将内部知识库、回答准则、品牌语调等教给模型,让它自动处理大部分问题;对于信心不足的问题,模型给出建议答案并请求人工审核,而人工审核的答案本身又成为新的微调数据。在需要深度推理的场景使用 O 系列模型,在需要快速检查的场景使用 GPT-4o mini——特定模型服务特定目的,再组合为流水线。

Weil 用一个精妙的类比收尾:一家公司本质上就是一个"由经过不同微调的人类组成的模型集成体"——每个人根据大学专业和职业经历被微调出不同技能,以不同组合协同工作,整体的输出远优于任何个体。不同人的推理速度不同、成本不同、偶尔也会"幻觉",这与模型的特性如出一辙。

AI 与教育:孩子应学什么,个性化辅导为何尚未爆发

Weil 有三个孩子——10 岁和一对 8 岁双胞胎。他观察到,这一代人完全是 AI 原生的:自动驾驶汽车和与 ChatGPT 对话对他们而言如同呼吸一样自然。关于孩子该学什么,Weil 的态度务实而开放:编程技能可能长期仍有价值,但更重要的是培养好奇心、独立性和自信——教会孩子如何思考,无论未来以何种形态呈现,这些能力都不会过时。

Weil 将个性化 AI 辅导称为"AI 也许能做的最重要的事情之一"(他同时承认加速基础科学研究可能是最重要的事)。每项研究都表明,在标准教育之外叠加个性化辅导,学习速度可获得多个标准差的提升。ChatGPT 是免费的,Android 设备遍布全球,模型能力已经足够——然而令人震惊的是,至今仍没有一个服务 20 亿儿童的 AI 个性化辅导产品。Khan Academy 做了出色的工作,Vinod Khosla 的非营利机构也在探索,但规模远远不够。这可能是改变世界最大的机会之一。

AI 辅助创造力的下一个飞跃

Weil 以自身为例——他自称全世界最差的艺术创作者,可能仅次于唱歌——但有了 ImageGen,他可以将创意思维输入模型,得到自己绝不可能独立产出的视觉作品。Sora 在专业领域的影响更为深远:一位知名导演告诉 Weil,以前要制作一个《星球大战》式的从太空拉近到城市地面的转场镜头,需要付给 3D 特效公司 10 万美元、等待一个月,只得到两个版本供选择——因为再付 5 万、再等一个月并不现实。现在他可以用 Sora 在短时间内生成 50 个版本,自由探索不同创意方向,然后带着更成熟的方案去找特效公司做最终版本。AI 不是替代创造力——你不可以在 Sora 里输入"给我拍一部好电影"——但它极大拓展了创意探索的广度和深度。

模型进化的超级指数曲线

Weil 描绘了一组令人震撼的趋势:从 GPT-3 到 GPT-4o mini,几年间成本下降了两个数量级,而智能水平大幅跃升。推理模型 (O 系列) 正以每三到四个月一代的节奏推进,每一代都是能力的跃升。模型同时变得更智能、更快速、更便宜、更安全——幻觉率逐代降低。摩尔定律是每 18 个月晶体管数量翻倍,而 AI 领域正在经历的是每年 10 倍的改进——一条陡峭得多的指数曲线。

Weil 反复强调一句贯穿整场对话的核心命题:你今天使用的 AI 模型,是你余生所用最差的 AI 模型。当你真正将这一点内化,眼前的世界会变得极为不同。因此,他为产品构建者给出的终极建议是:为"即将到来的能力"而构建,模型终将追上你的愿景——这就是模型最大化的精髓。

Libra:职业生涯最大的遗憾

Kevin Weil 在 Facebook 联合 David Marcus 创建了 Libra 加密货币项目。他称之为"职业生涯最大的失望"。问题的核心真实且紧迫:全球汇款市场极其不公,最没有钱的人要支付高达 20% 的手续费把钱寄回家,流程耗时数天,还需亲自去取现金。WhatsApp 全球 30 亿用户每天都在与亲友聊天——那些恰恰是最需要互相汇款的人。为什么不能像发短信一样即时、免费、简单地发送资金?

Weil 坦诚反思了失误:团队试图一次性推出所有变革——新区块链、一篮子货币、WhatsApp 和 Messenger 集成——整个世界被"一下子这么多变化"吓到了。更糟的是,这恰逢 Facebook 声誉的最低谷。如果重来,他会选择更渐进的方式,一次引入一项新事物,可能最终达到相同结果。技术本身并未消亡:代码从一开始就开源,Aptos 和 Sui(Mistin)两条区块链就建立在 Libra 的技术之上,两家公司都运转良好。但"在 WhatsApp 中免费发送 50 美分、即时结算"的产品,至今仍不存在。Weil 直言:当前的美国政府对加密货币非常友好,Meta 的声誉也已大幅改善——也许他们现在应该重新开始做这件事。

闪电问答

推荐书目:
- 《Co-Intelligence》(Ethan Mollick 著)——关于如何在日常生活、学习和教学中使用 AI 的深思熟虑之作,Mollick 也是非常值得关注的 Twitter 账号。
- 《The Accidental Superpower》(Peter Zeihan 著)——关于地缘政治与塑造世界格局的力量。
- 《Cable Cowboy》——John Malone 传记,关于这位现代有线电视产业塑造者的商业智慧与交易艺术。

最近喜爱的电影/剧集: 少年时读过《时光之轮》系列,现在 Amazon 正在播出第三季,他想找时间看。《壮志凌云 2》是他最近看过的电影——他欣赏其中的美国精神、力量自豪感与爱国情怀。

最喜爱的产品: Windsurf 的氛围编程体验极为有趣;Waymo——只要有机会他就乘坐,仍然是"生活在未来"的感觉。

人生信条: 扎克伯格在某次 Facebook 财报电话会议上的回答——分析师问他"到底是什么单一因素驱动了如此巨大的增长",扎克伯格的回答大意是:"有时候不是某一件事情,而是长期持续地做好工作。" (Sometimes it's not any one thing, it's just good work consistently over a long period of time.) Weil 将这句话做成海报挂在房间里。他本人跑超级马拉松 (Ultra Marathon),深信人生和卓越不靠银弹,而靠日复一日地出现、做好工作、每天进步一点点——一周甚至一个月内你可能看不出变化,但一年、两年、五年后,复利的力量会带来惊人的结果。

提示词技巧 (Prompting Tips): Weil 首先表示,他希望消灭"必须成为好的提示词工程师"这个概念——如果 OpenAI 做好了工作,普通人不应需要关心提示词的细微技巧,就像大多数 MySQL 用户不需要关心 InnoDB 的版本号一样。但目前还没完全到那一步。他推荐一个实用技巧:在提示词中提供示例,即"穷人的微调" (Poor Man's Fine-tuning)——"这是一个问题,这是一个好答案;这是另一个问题,这是另一个好答案;现在帮我解决这个问题。"模型确实会从这些示例中学习,效果远优于零示例。此外,设定角色框架也有效:"你是世界上最伟大的品牌营销人,现在回答这个命名问题"——这会将模型切换到某种思维模式,产出质量可能显著提升。Weil 再次指出,这和人类沟通也有类似之处:给一个人设定某种角色框架,他的回答方式会完全不同。

觉得有用?分享给一个需要的朋友 🙏