Sherwin Wu:AI 正在重塑软件工程的每一个角落
摘要
Sherwin Wu 是 OpenAI API 与开发者平台(Developer Platform)的工程负责人,他管理着几乎所有 AI 创业公司赖以运行的底层基础设施。在这期节目中,Sherwin 分享了 OpenAI 内部的全景数据:95% 的工程师每天使用 Codex,100% 的代码 PR 由 AI 审查,重度使用 AI 的工程师比不使用的人多提交 70% 的 PR。他预测软件工程师的角色将在未来一两年彻底转变——从亲手编写代码,变成管理成群的 AI 代理(Agent Fleet)。Sherwin 还深入探讨了"一人十亿美元创业公司"的二阶与三阶效应、为什么大多数企业的 AI 部署实际上是负 ROI、如何避免被模型能力的快速进化"吃掉你的脚手架",以及他对业务流程自动化(Business Process Automation)这一被低估的巨大机会的看好。最后,他分享了作为管理者的核心心得:把超过一半的时间花在团队中顶尖的 10% 成员身上。
正文
一、AI 编码的现状:从"尝试"到"默认"
"95% 的工程师使用 Codex。100% 的 PR 由 Codex 审查。"Sherwin Wu 开门见山地说。作为 OpenAI API 与开发者平台的工程负责人,他看到的不是未来的预测,而是正在发生的现实。
在这家全球最顶尖的 AI 公司内部,AI 辅助编码已经不再是一个需要讨论"要不要用"的话题。Sherwin 提到,几乎每个工程师的代码都是由 AI 首先生成的,工程师的角色变成了审查和引导。而在这背后,一个更惊人的趋势正在浮现:使用 Codex 更多的工程师比那些不太用的人多提交了 70% 的 PR,而且这个差距还在持续拉大。Sherwin 解释道:"那些提交更多 PR 的人会越来越擅长使用这个工具,效率不断提升,70% 这个数字可能已经比我上次看的时候更大了。"
但 Sherwin 也强调了一个微妙之处:他不能说"100% 的生产环境代码都是 AI 写的",因为代码归属难以精确归因。然而,几乎所有工程师在所有任务中都重度依赖 Codex,"如果让我估算的话,绝大多数代码很可能是 AI 首先生成的。"
更值得关注的是,AI 不仅承担了代码编写的任务,还接管了让程序员最"痛恨"的环节——代码审查(Code Review)。Sherwin 回忆起自己在 Quora 的第一份工作,当时他负责信息流(Newsfeed)模块的核心代码,每天早上登录就是 20 到 30 个审查请求,拖延一下就变成 50 个。"Codex 审查代码的能力非常强,尤其是 5.2 版本在代码审查上变得极其出色。原来一个 10 到 15 分钟的代码审查任务,现在两三分钟就能完成。"对于小型的 PR,团队甚至已经不再需要人类审查——作者自己看一遍 Codex 的反馈就足够了。Codex 作为"第二双眼睛"已经足够聪明。
不仅是代码审查,整个 CI(持续集成)流程和部署后的环节也在被逐步自动化。Sherwin 说:"如果你和很多工程师聊,最让他们烦心的是,写完漂亮的代码之后怎么把它弄到生产环境里去——跑测试、处理 Lint 错误、等代码审查……这些都可以交给 Codex。"OpenAI 内部已经搭建了自动化工具:如果出现 Lint 错误,Codex 自动修复后重新触发 CI 流程。"所有这些努力的目标,就是把这些环节对工程师的负担压缩到最小。"结果是他们能够以极高的速度合并和发布 PR。
二、工程师的新角色:从写代码到"施法"
当被问及软件工程师这个职业在未来一两年会变成什么样子时,Sherwin 没有给出一个标准答案,而是描绘了一幅既令人兴奋又略带荒诞的画面。
"每个 IC(Individual Contributor,独立贡献者)工程师都在变成技术负责人(Tech Lead)。他们本质上已经是管理者了——管理着成群的代理(Agent Fleet)。"Sherwin 描述道,他团队里的许多工程师同时在拉 10 到 20 条"线程",不断检查 AI 代理的进度、引导方向、给反馈。"他们的工作已经从亲手写代码变成了几乎像是管理者。"
Sherwin 用一个他大学时期读到的经典编程教材来比喻这种转变——MIT 的 SICP(Structure and Interpretation of Computer Programs,《计算机程序的构造与解释》)。这本书在编程圈子里有"巫师之书"(The Wizard Book)的绰号,因为它把编程描述为一种类似巫术的学科:软件工程师就像巫师,编程语言就像咒语(Incantations),你念出咒语,程序就为你做事。"那本书写于 1980 年,但这个隐喻一直延续到了今天。我觉得它正在真正地实现——因为现在你确实可以对 Codex、对 Cursor 说出你想要什么,然后它就去做了。这简直就是在念咒语。"
Sherwin 进一步用迪士尼《幻想曲》(Fantasia)中"魔法师的学徒"(The Sorcerer's Apprentice)的桥段来深化这个比喻。"在这个阶段,咒语的力量非常大,能做的事情杠杆极高,但你必须知道自己在做什么。在《魔法师的学徒》里,米奇让扫帚去干活,然后就睡着了——扫帚完全失控,整个屋子都被水淹了。这就是'氛围编码'(Vibe Coding)的极致。最后老巫师回来,把一切收拾干净。"
这个比喻的深意在于:当工程师同时管理 20 个 Codex 线程时,需要的是判断力、经验和对模型行为的深刻理解。"你绝对不能完全不管让它自己跑。但它也确实是极高杠杆的工具。一个非常资深的、精通这些工具的工程师,现在能做到的事情远超以往。这也就是这个时代最有趣的地方——你真的感觉自己像个巫师。"
主持人 Lenny 提到一个日益普遍的现象:当代理不工作时,人们会感到焦虑。"你发出了所有这些 Codex 代理,然后你得随时盯着它们——'糟糕,这个不跑了,我在浪费时间。'"Sherwin 坦言这每天都在发生,但这恰恰是整个领域最有趣的部分,因为模型和工具都还不完美,人们仍在摸索最佳的交互方式。
三、100% Codex 代码库:一场没有"逃生舱"的实验
Sherwin 透露了 OpenAI 内部一个引人注目的实验:有一个团队正在维护一个完全由 Codex 编写的代码库。这不仅仅是"AI 写初稿、人类修改"的模式——这个团队真正地"全身心押注 Codex"(fully Codex-pilled),没有"逃生舱"(escape hatch)。他们不能用 Cursor 的 Tab 补全来手动修改代码,不能"撸起袖子自己上"。当代理做不出他们想要的功能时,唯一的出路是——想办法让代理做到。
"我们发现,很多时候编码代理不按你的想法来,问题通常出在上下文(Context)和信息输入上。"Sherwin 解释道,"要么是你对需求描述不够精确,要么是代码库中没有足够的信息让 Codex 理解如何完成这个任务。所以,解决方法就是添加文档、将你脑海中的隐性知识(Tribal Knowledge)编码到代码库里——通过代码注释、代码结构,或者 .md 文件、Skills 文件等各类仓库内的附加资源。"
这个团队正在产出一系列引人入胜的最佳实践,Sherwin 表示 OpenAI 后续会发布一篇博客来分享学习成果。"移除那个'不再使用 AI'的逃生舱,迫使他们去系统性地解决那些如果我们真的想全面拥抱代理就必须面对的问题。"
这个实验也为后面的一个重要话题埋下了伏笔:在为 AI 构建产品和工具时,你是在为模型当下的能力构建,还是在为模型将要拥有的能力构建?
四、管理者的新法则:把大部分时间给顶尖人才
当话题转向管理层面时,Sherwin 坦率地说,管理者的工作变化不像工程师那么大——"目前还没有 Codex for managers(管理者专用的 Codex)。"但他已经开始用 ChatGPT 来处理管理类任务,尤其是在绩效评估(Performance Review)期间。"把 ChatGPT 连上内部知识库——GitHub、Notion、Google Docs——你可以非常快速地生成一份关于某个人过去 12 个月工作的深度研究报告。"
Sherwin 预测,就像软件工程师现在可以同时管理 20 到 30 个 Codex 代理一样,管理者借助这些工具将能够管理远比现在更大的团队。目前软件工程管理的最佳实践是 6 到 8 人,但在 AI 工具的赋能下,这个数字可能会大幅提升。
但他最核心的管理心得,是一个看似简单却极其有力的原则:把你超过 50% 的时间花在团队中顶尖的 10% 成员身上。
"Codex 真正赋能的是那些顶级表现者——这是 AI 在社会层面的普遍规律:那些高度主动(High Agency)、真正投入去掌握这些工具的人,会把自己超级充电。"Sherwin 观察到,使用 AI 后团队的生产力分布变得更宽了——顶尖人才效率飙升,差距进一步拉大。"作为管理者,我的时间一直主要花在顶级表现者身上:确保他们不受阻碍、保持愉悦、感到被倾听。在 AI 时代,这一点比以往更加重要。"
他举了一个具体例子:那个维护 100% Codex 代码库的团队。"作为管理者,我就是对他们说:去吧,去探索,去搞清楚最佳实践,我们会把成果分享给整个组织。让他们放手去做,这带来了巨大的回报。"
Sherwin 还分享了另一个塑造他管理哲学的经典隐喻,同样来自一本老书——Fred Brooks 的 《人月神话》(The Mythical Man-Month)。"那本书里描述了一个有趣的预测:软件工程未来可能像外科手术一样,房间里只有一个主刀医生在做手术,其他所有人——护士、助手、住院医生——都在支持这一个人。《人月神话》说软件工程也会走向这个方向。"
"这个类比一直在我脑海里。我的管理方式就是:让团队里的每个人都感觉自己像那个外科医生。我作为管理者的职责就是支持他们——给他们递手术刀、提前扫清障碍。尤其是在 AI 时代,当工程师在疯狂产出 PR 的时候,主要的瓶颈往往在组织层面或流程层面。如果我是那个在外科医生还没开口之前就已经把手术刀准备好的人,这就是最理想的状态。"
五、"一人十亿美元创业公司"的二阶与三阶效应
"一人十亿美元创业公司(One Person Billion Dollar Startup)"这个概念已经在 AI 圈子里被反复讨论。Sherwin 认同这个方向的力量,但他认为真正被人忽略的,是它的二阶和三阶效应——这些效应可能彻底改变整个创业和投资生态。
"如果一个人可以创造一个十亿美元的公司,那意味着任何人都可以更容易地创造公司——不仅仅是十亿美元级别的,更是成千上万个小公司。"Sherwin 预测,这将触发一场巨大的创业浪潮和中小企业(SMB)爆发。"软件正在变得越来越垂直化。你真正理解某个特定领域的需求,然后用 AI 打造一个极其定制的工具——这已经在发生,而且没有理由不增长 100 倍。"
他的核心判断是:为了支撑那一个"一人十亿美元创业公司"的存在,可能会催生出 100 个其他小创业公司,为它提供极其定制化的软件服务。结果就是——B2B SaaS 可能进入一个黄金时代。"可能只有一个十亿美元的一人公司,但可能有 100 个一亿美元的公司,有上万个一千万美元的公司。而对个人来说,拥有一千万美元的生意已经够你一辈子了。这个图景,大家还没有真正定价进去。"
Sherwin 进一步推演了三阶效应:VC 生态可能会发生根本性改变。"当大量 1,000 万到 5,000 万美元的小公司涌现,这些对于 VC 追求的百倍、千倍回报来说并不理想——但它们对个人创业者来说极好。最终可能会出现少数几个大平台公司来支撑所有这些小公司,但适合 VC 级别回报的创业公司数量可能会缩减。"
Lenny 提出了一个务实的质疑:即便 AI 能做很多事,支撑一个十亿美元业务所需的客户支持(Support)、运营等环节真的可以靠一个人完成吗?Sherwin 的回应呼应了他的二阶效应逻辑——你不需要什么都自己做。"可能有一堆创业公司专门为播客和 Newsletter 打造客户支持软件,那就是一个一人公司。因为软件构建成本在急剧下降,你会把更多东西外包出去,从而缩小你自己公司的规模。"最终,仍然是一个人驱动着一个极高杠杆的公司。
六、大多数 AI 部署是负 ROI:自上而下的陷阱
Sherwin 分享了一个令人警醒的观察:很多企业的 AI 部署实际上是负 ROI(投资回报率为负)。 他坦率地说,自己并没有精确的量化数据,但从观察那些尝试引入 AI 的公司来看,"如果发现大量 AI 部署是负 ROI,我不会感到意外。"
问题出在哪?Sherwin 直指核心:"我们硅谷的人总忘记自己生活在一个泡沫里。Twitter 是泡沫,X 是泡沫,硅谷是泡沫,软件工程本身也是泡沫。世界上绝大多数人不是软件工程师,不追每一次模型发布,根本不了解怎么用好这项技术。"
当他在与各类企业交流时,发现一线员工对 AI 的使用方式往往停留在最基础的层面——"问一些非常简单的问题,完全没有真正探索工具的潜力。"这与 X 上那些精通 Skills、AGENTS.md、MCP 的重度用户形成了鲜明对比。
Sherwin 总结出成功 AI 部署的核心公式:自上而下的认同 + 自下而上的采纳(Bottoms-up Adoption),二者缺一不可。"C 级别高管说'我们要成为 AI 优先的公司'——这很好,有预算,有高管支持。但如果只有自上而下的指令、没有基层员工真正的热情和主动性,最终结果是一大群不知道怎么用、也不知道向谁学习的员工——他们可能被要求在绩效评估中体现 AI 使用,但完全不知所措。"
在 OpenAI 内部,虽然公司天然希望"以 AI 为中心",但真正的起飞是在 Codex 等工具让每个员工能直接应用到自己的工作中之后才发生的。"每个人的工作都不一样——软件工程和财务不同,财务和运营不同,运营和销售不同。这些'最后一英里'的细节工作,必须由自下而上的方式来完成。"
Sherwin 的建议是:找到甚至专门组建一个全职的内部"老虎团队"(Tiger Team),由那些对 AI 充满热情、技术上虽不一定写代码但足够精通工具的人组成——比如支持团队的运营负责人、Excel 高手——让他们去探索工具的极限、针对具体工作流做应用、做知识分享、在公司内部点燃火花。"在没有这样一个团队的情况下,AI 真的很难在企业里生根。"
七、模型会吃掉你的脚手架:为什么"听客户的话"可能是个陷阱
Sherwin 分享了一个在他看来对 AI 领域建设者至关重要的洞见:"模型会吃掉你的脚手架(The models will eat your scaffolding for breakfast)。"这句话来自一位名叫 Nicolas 的创业者,Sherwin 深以为然。
"回到 2022 年 ChatGPT 刚发布时,模型还很原始。于是出现了大量围绕模型搭建的产品'脚手架'——代理框架(Agent Frameworks)、向量存储(Vector Stores)、各种工具和中间件。但你看过去三年的发展,模型本身在不断变强,结果就是直接'吃掉'了其中很大一部分脚手架。"
他举例说,2023 年人们普遍认为向量存储是将组织知识注入模型的主要方式——你需要把所有语料向量化、嵌入、优化检索策略。但现在回过头看,更好的方法往往是去掉这些复杂逻辑,直接给模型一套搜索工具——它可以是文件系统上的文件(如 Skills 和 AGENTS.md),而不一定是向量存储。向量存储当然还有用武之地,但围绕它搭建的整个生态和假设已经发生了根本改变。
这段历史引出一个反直觉的结论:在 AI 领域,盲目听从客户反馈可能是危险的。"当然,你应该和客户交流。但因为领域变化太快,在任何时点,很多人都处于某个'局部最优'(Local Maximum)上。你问客户要什么,他们会说'我要更好的向量存储''我要更好的代理框架'。如果你只沿着这条路走下去,你可能只是在那个局部最优上不断优化。"
而模型的持续进化会不断重新定义什么是正确的抽象层和工具。"当前流行的这套工具和框架——Skills、文件式上下文管理——在未来的某个时刻可能也会变得不再必要,因为模型自己能完成所有上下文管理。这是 AI 领域构建的有趣/兴奋/也令人抓狂的地方——目标一直在移动。"
Sherwin 给出的核心建议是:为模型的发展方向构建,而不是为模型当下的能力构建。"我见过做得最好的创业公司,他们构建的产品是为一种'理想能力'设计的——今天可能只做到了 80%,但产品已经差不多能用了。然后随着模型升级——可能是从 o3 到 5.1、5.2——某个时刻突然就'通了',产品变得极好。他们是在把模型能力提升作为设计前提。"
八、未来 12-18 个月:更长任务的代理与多模态音频的崛起
当被问及未来 6 到 12 个月最值得关注的趋势时,Sherwin 指出了两个方向。
第一,模型能够连贯执行任务的时长正在快速增加。 他引用了 METR 基准测试的数据:目前前沿模型已经能在软件工程任务上达到约 50% 成功率执行数小时的任务,而 80% 成功率对应的是约一小时以内的任务。"但这个图表真正令人震撼的是——你把所有历史模型都标上去,趋势线非常清晰。我认为在未来 12 到 18 个月,我们将看到模型能够非常连贯地执行数小时长的任务——甚至可能达到六小时、一整天。你可以派一个代理出去,让它自己工作一阵子。"
这将彻底改变人们构建的产品形态。"今天的工具——包括 Codex——主要优化的是几分钟到十分钟以内的任务。当你面对一个可以连续工作一整天的模型时,你怎么给它反馈?你不希望它完全失控,但你也不一定需要每分钟都盯着它。可做的事情的空间会大幅扩展。"Sherwin 对此极为兴奋。
第二,多模态音频(Multimodal Audio)的进步被严重低估。 "大家都在讨论编码,编码是纯文本的。但我们此刻正在用音频交谈——世界上大量的商业活动是通过音频完成的,大量的服务和运营是通过对话和语音进行的。"Sherwin 认为,在未来 12 到 18 个月里,原生多模态语音模型(Speech-to-Speech)的能力将大幅提升,尤其是在企业场景中。"音频在企业服务和商业环境中的应用,仍然是一个被严重低估的领域。"
九、业务流程自动化:硅谷泡沫之外的金矿
Sherwin 对业务流程自动化(Business Process Automation,BPA)抱有极大的乐观。这个判断的起点,正是他对硅谷认知边界的清醒认识。
"软件工程是开放式的知识工作(Open-ended Knowledge Work)。这正是 Codex 擅长的领域——探索性的、不可重复的工作。你构建一个新功能,不会是在重复构建同样的功能。"但当你走出技术行业的核心地带,世界上绝大多数工作遵循的是完全不同的逻辑——它们是可重复的业务流程。"某个经理在一家公司里迭代出来的一套标准操作流程(Standard Operating Procedure,SOP),大家照着走就行了,你不想偏离它。软件工程中的创新恰恰在于偏离,但世界上的大量工作就是在执行这些流程和操作——你打电话给客服,他们在照着流程走;你打给电力公司,他们有一套流程来规定能做什么和不能做什么。"
Sherwin 认为,将 AI 应用于这类具有高确定性、与业务数据和业务决策深度集成、横跨企业内不同系统的可重复业务流程上,蕴藏着巨大的机会。"因为这与硅谷日常讨论的话题太不一样了,人们往往不会去想它。但如果你问大企业'AI 在 20 年内将如何改变你的公司?'软件工程只是故事的一部分,业务流程那边的改变可能还要更大——而那里的工作量也相当可观的。"
十、OpenAI 的平台哲学:为什么创业公司不必担心被碾压
几乎所有构建在 OpenAI API 之上的创业公司,心中都有一个挥之不去的恐惧:"OpenAI 会不会哪天推出同样的产品,把我碾碎?"
Sherwin 的回应直截了当:市场太大了,创业公司根本不需要过度担心这个问题。"我见过很多没有成功的创业公司,也见过很多做得非常好的。没有一个是'被 OpenAI 或 Google 碾压掉'的——失败的原因几乎总是他们做出来的东西根本没有和客户产生共鸣。而那些做起来的公司,即使在编码这样极其竞争激烈的赛道——比如 Cursor,现在规模巨大——是因为他们做出了人们真正热爱的产品。"
他强调,当前 AI 领域的机会空间之大,"甚至连 VC 的行为准则都变了——VC 同时投资互相竞争的公司,这在以前是不可思议的,但因为这个赛道前所未有的巨大,这变成了常态。"
在平台层面,Sherwin 阐述了 OpenAI 的根本定位:"我们认为自己从根本上是一家生态系统平台公司。"他回顾道,API 实际上是 OpenAI 的第一个产品,比 ChatGPT 更早。公司的使命从来不是一个产品,"我们的使命一直是两点:一、构建 AGI;二、让全人类受益。'全人类'是关键——我们不认为自己能触达世界的每一个角落。要让全世界受益,我们需要一个平台,让其他人来为播客创作者打造客户支持机器人、为 Newsletter 作者打造工具,因为这些事情我们做不过来。"
他列举了一些具体的事实佐证:每一个 OpenAI 产品中发布的模型都会同时在 API 中发布,包括针对 Codex 优化的模型;平台保持中立,不屏蔽竞争对手;最近还在测试"用 ChatGPT 登录"的产品。他用一句话概括了这种理念——水涨船高(A rising tide lifts all boats):"我们可能是一艘航空母舰,但抬高水面,所有人都会受益。"
十一、闪电问答
节目最后是快问快答环节,Sherwin 分享了一些个人的推荐和生活智慧。
推荐书籍:
- 小说:There Is No Antimemetics Division(《没有反模因部门》),作者 qntm。"一本极其聪明、创意十足、文笔极好的科幻小说。讲的是一个政府机构在对抗那些'会让你忘记它们存在'的东西。我两天就读完了,爱不释手。而且这本书有一种意外的幽默感——它本意是想写成带点恐怖色彩的科幻,但好几次让我笑出声。"
- 非虚构:两本关于中美关系的书。一本是 Dan Wang 的 Breakneck,"他把美国比作律师型社会,中国是工程师型社会,各有优劣——读完你会觉得,嗯,美国确实是律师在治理。"另一本是 Patrick McGee 关于苹果在中国的新书,"我本来就是个苹果死忠粉,这本书不仅有苹果内部的很多细节,而且非常应景,读起来像翻页小说。"
喜爱的产品: Ubiquiti 的家用网络和安防系统。"如果你要做家庭网络布线,Ubiquiti 就像是家用网络设备中的苹果——产品非常漂亮,但真正厉害的是它们的软件。移动端 App 体验极好,尤其是安防摄像头配合 Apple TV 和 iPad 查看实时画面的体验,非常出色。"
座右铭: "永远不要为自己感到可怜(Never feel sorry for yourself)。工作中、生活里会有很多不如意的事情,提醒自己不要自怜、你永远有能动性(Agency)把自己拉起来——这是我反复告诉自己的话,也是我经常对其他同事说的。"
有趣的小故事: Sherwin 曾在房地产科技公司 Opendoor 领导房屋定价模型。当被问及房价中什么因素是他没想到会如此重要时,他给了三个出人意料的答案:高压电线("你站在房子旁边,能听到嗡嗡声,有小孩的家庭绝对不想靠近");户型平面图(Floor Plan,量化非常困难——"你走进去就是能感觉到不对");以及入户门的位置和整体外观(Curb Appeal,买家走近房屋最初几秒的感受,被严重低估了)。
结语
Sherwin Wu 用一句话概括了他对这个时代的感受:"未来两三年,将是科技和创业领域很长一段时间内最有意思的时期。别把这一刻当成理所当然。"
他 2014 年步入职场,经历了一段在他看来相当平淡的五六年,然后过去三年是他职业生涯中最疯狂、最激动人心的时光。"这一波浪潮终有一天会趋于平缓、变得渐进,但在那之前,我们还能探索很多真正酷的东西,创造很多新东西,改变世界和我们的工作方式。"
对于那些不确定如何参与其中的人,他的建议很简单:Just engage with it. "不需要是软件工程师。使用这些工具,理解它的局限,观察它的能力边界在不断扩展。先从小处开始,深入一两个工具——你已经比别人走在了前面。"
他说得对。这可能是有史以来最糟糕的模型——也是对你来说最有价值的机会窗口。
觉得有用?分享给一个需要的朋友 🙏