Vault

为什么专家编写 AI 评估正在催生全球增长最快的 B2B 创业公司

摘要

Brendan Foody 是 Mercor 的 CEO 兼联合创始人,这家公司从 1 美元做到 4 亿美元收入运行率仅用了 16 个月,创造了历史最快增速纪录。Mercor 的核心业务是为顶级 AI 实验室招募各领域专家,帮助他们编写评估(Eval)和构建强化学习环境,从而测量和提升模型能力。Brendan 提出,如果模型是产品,那么评估就是产品需求文档——模型能力的进步受限于人类能否定义"什么是好的结果",这构成了当今 AI 实验室的首要瓶颈。

本次对话深入探讨了"评估时代"的到来:评估既是模型训练的基准,也是展示能力的销售素材;从低技能众包到高专家评估的市场转型;新型就业岗位的诞生及其对未来的意义。Brendan 还分享了 Mercor 的三大文化支柱——进取态度、高标准和强度——以及他关于创业精神、劳动力市场未来、以及为何超级智能不会在短期内到来的见解。他认为,未来十年将是一个由评估铺就的漫长道路,知识工作的大部分将被自动化,但这恰恰是人类新角色不断涌现的机遇期。

正文

评估时代的到来

Brendan 在推特上置顶了一条信息:"我们正在与六大科技巨头中的六家、排名前五的 AI 实验室以及大多数 AI 应用层公司合作。一个趋势在所有客户中共同出现——我们正在进入评估(Eval)时代。"这条推文精准地概括了当前 AI 行业的核心转向。

Brendan 用一个精妙的类比解释评估的本质:如果模型是产品,那么评估就是产品需求文档(PRD, Product Requirement Document)。研究人员的日常工作是运行数十个实验,在评估集上做小幅改进。而强化学习(RL, Reinforcement Learning)正变得如此高效,一旦有了评估,模型就能沿着它不断攀升。回顾奥赛数学(Olympiad Math),一旦业界集中精力攻克,饱和速度惊人;SWE-bench 也同样如此。因此,在许多方面,将智能体(Agent)应用于整个经济、自动化所有工作流的障碍,就在于如何测量成功——如何评估它,为希望智能体完成的一切编写 PRD。

对企业管理者而言,核心思路是:如何构建一套测试或系统性方法,来衡量 AI 在多大程度上自动化了企业的核心价值链?例如,一家建筑设计公司向终端客户提供建筑图纸,如何有效地衡量 AI 生成的图纸质量?每家公司都有自己的价值链,思考如何衡量它是有效应用 AI 的前提。

评估即销售素材

Sarah Guo 曾发推文"评估等于你的新营销"。Brendan 进一步阐释:如果模型是产品,评估不仅是 PRD,也是销售素材(Sales Collateral)。评估既告诉研究人员该构建什么,也是展示模型能力的方式。

历史上,人们一直引用学术评估来衡量模型——GPQA 的博士级推理、人类最后的考试(Humanity's Last Exam)、奥赛数学。但现在的趋势正转向人们实际关心的能力:如何让模型自动化软件开发平台,或自动化投资银行分析。Brendan 认为,实验室和应用层公司将越来越依赖评估来展示其模型和产品的能力。

市场格局:从众包到专家评估

当前增长最快的 AI 相关公司可分为三大类:基础模型公司、氛围编程(Vibe Coding)应用(如 Cursor、Lovable、Bolt、Replit),以及数据标注和数据公司(如 Scale、Surge、Mercor)。

Brendan 讲述了 Mercor 的起源故事:他在 14 岁时遇见了联合创始人,19 岁(2023 年 1 月)共同创办公司,最初的业务是国际人才招聘——用大语言模型(LLM)自动化简历审阅、面试和招聘决策流程,在辍学前就将公司做到了 100 万美元收入运行率。

转折点出现在与 OpenAI 的接触。Brendan 发现人力数据市场正在经历一场巨大转型:从众包问题(如何找到低中技能的人写出勉强通顺的句子用于早期 LLM 训练),转向了寻源和评估问题(如何寻源和评估最优秀的专业人士——软件工程师、投资银行家、医生、律师——来评估和解读人们希望模型具备的各种能力)。从此,Mercor 开始与所有顶级 AI 实验室合作,16 个月内从 1 美元增长到 4 亿美元收入运行率。

这一转型背后是市场逻辑的根本变化。早期众包公司以 30 美元/小时的均价雇佣大量低技能人员,而现在实验室需要的是高盛银行家、麦肯锡分析师和 FAANG 软件工程师级别的专家。Mercor 市场的中位时薪为 95 美元,深度专家可达 500 美元/小时。所需要的人才类型决定了市场定位的天壤之别。

专家如何为模型编写评估

具体来说,这些专家在做什么?Brendan 给出了一个律师的例子:假设你希望模型能像律师一样为合同标注红批注(Red Line),但模型犯了一些错误、遗漏了关键要点。你可以让律师创建一个评分标准(Rubric)——类似于教授为作业创建评分标准——定义希望模型具备的能力,并据此打分。这就是测量模型进步的基础:模型是否实现了这些专业能力?以及如何将这些数据用作训练数据来奖励和强化这些能力。

Brendan 指出一个重要观点:人们经常讨论强化学习环境和评估,但 Andrej Karpathy 也曾指出,两者在数据类型上并没有本质区别,只是语义上描述了不同的用途。归根结底,它们都是某种衡量"好结果"的标准点。你可以用它作为基准——展示为什么你的模型是世界上最强的;也可以在后训练(Post-training)端用它来奖励特定的模型轨迹,实现这些能力。

数据领域历来包含两种类型:监督微调数据(SFT, Supervised Fine-Tuning),即输入/输出对;以及基于人类反馈的强化学习(RLHF, Reinforcement Learning from Human Feedback),模型生成若干示例后选择最受欢迎的。但行业整体正在转向基于 AI 反馈的强化学习(RLAIF, Reinforcement Learning from AI Feedback),即由人类定义成功标准和衡量方式(代码中可以是单元测试,其他领域可以是评分标准),然后用它来激励模型能力。这种方式更具可扩展性和数据效率。

人力数据需求将持续多久

Brendan 指出,核心问题是:经济中人类能做而 AI 不能做的事情还能存在多久?确实有人认为三年内就会实现超级智能(Superintelligence),人类将不再参与经济。但 Mercor 的观点截然不同。

这些模型非常出色,正在快速自动化许多任务,但仍有大量事情做得很差——甚至不能安排日程、不能代写邮件、不能使用基本工具。需要为一切编写评估:工具使用的评估、长时域推理(Long-horizon Reasoning)的评估。想象十年后,当希望模型能独立外出创建一家创业公司并持续运营 30 天,就需要评估来有效地奖励这种行为。

Brendan 认为,提升模型的道路将持续到经济中存在任何人类能做而模型不能做的事情为止,这将构成未来工作的很大一部分。一条被广泛转发的推文说:"如果你认真想想,我们被放到地球上就是为了给实验室创建强化学习训练数据。"Brendan 对此表示认同:与顶级实验室的研究人员和高层交流后,他很确信整个经济很可能变成一个强化学习环境机器,构建所有这些世界和语境,然后拥有评分标准或其他验证器。评估是常青的——只要想改进模型,就需要专家来创建评估。

新型就业岗位的诞生

Brendan 将此比作工业革命:当时人人担心失去工作,但出现了全新的岗位类别——如何建造机器、如何从事知识工作。过去三年 AI 领域的叙事几乎完全是关于岗位替代的,但很少有人讨论正在被创造的新岗位类别。

目前,在任何时刻都有数万名专家在工作,总体规模达数十万人,且仍在快速增长。Mercor 曾雇佣哈佛大学讽刺刊物 Harvard Lampoon 的全体成员来帮助模型变得更幽默;还聘请了艾美奖获奖编剧来提升创意能力。在一个 100 人的团队中,往往前 10% 的人驱动了大部分模型改进——就像一家公司一样。当 Mercor 能够在识别这前 10% 的人才方面建立专有优势时,就为客户创造了难以匹敌的价值。

哪些技能和岗位最具未来价值

Brendan 对年轻人和求职者的建议是:关注需求弹性极大的岗位类别。当人们生产力提高 10 倍时,弹性行业会建造 10 倍甚至 100 倍的产品。产品经理就是很好的例子——他们能做比以往多得多的事。软件也是如此:Marc Andreessen 曾指出软件是所有行业中最具弹性的,提高生产力时会建造多得多的东西。相比之下,会计行业的弹性有限——世界不需要 100 倍的会计。

第二个关键点是:善用 AI 工具来增强现有工作。Brendan 分享了他与教师交流的经验——不要对抗学生使用模型,就像计算器出现时不应该阻止学生使用它。Mercor 在面试中会给候选人这样的提示:"使用 ChatGPT、Claude Code、Cursor 等所有可用工具来构建一个网站,让我们看看你一小时能做出什么产品。"这与当下那句近乎老生常谈的名言一致:"AI 不会取代你,善用 AI 的人才会取代你。"

Brendan 还观察到企业层面的类似分化:有些企业害怕评估自己的业务,因为那将提供价值链正在被自动化的证据;而另一些则积极拥抱——如果我们能做 10 倍甚至 100 倍的事,这意味着什么?后者才是将在未来十年胜出的企业。

全球劳动力市场的未来

Brendan 在创办公司时有一种直觉:劳动力市场极度分散,效率极低。当企业在湾区招聘时,只会考虑市场中不到百分之一的候选人,因为匹配问题全靠人工解决——手动审阅简历、手动面试、手动决定录用。当这个匹配问题能以软件成本被自动化时,就为全球统一劳动力市场开辟了道路:每位候选人申请同一个市场,每家公司从同一个市场招聘,实现经济中信息的完美流动。

但 Mercor 逐渐认识到,工作的性质本身也在剧烈变化。当人们问 Mercor 是劳动力市场还是数据公司时,Brendan 的回答是:实验室真正需要的是劳动力市场——他们需要这些极高水准的人,当然会附带项目管理和软件平台,但核心是找到跨领域的卓越专业人士来衡量模型能力。

这与传统的专家网络公司(如 AlphaSights、GLG)有一个核心区别:后者通常是一次性电话咨询,而 Mercor 的工作更多是让专家参与长期项目。在保留人才和设计激励机制方面,它更像 Uber 或 DoorDash 这样的劳动力市场,只不过人才技能水平高得多,且受到极好的待遇。

发现机会:从直觉到验证

Brendan 分享了几段关键经历。2023 年 8 月,当他还在大学时,一位客户将他们介绍给 xAI 的联合创始人,因为 Mercor 拥有擅长数学和编程的印度软件工程师。Brendan 解释说这些工程师因为不用分心于人文学科而更擅长数学和编程,xAI 团队非常喜欢这一说法,两天后邀请他们到特斯拉办公室与除 Elon 外的整个 xAI 联合创始团队会面。虽然当时 xAI 还在做预训练、尚未需要人力数据,但这次会面让 Brendan 确信市场即将发生巨变。

另一段经历是一家众包公司通过 Mercor 平台雇佣了超过 1000 人,但随后 Mercor 收到大量工单投诉这些人没有得到报酬。这让他们意识到许多现有公司在人才体验方面严重不足,存在直接与实验室合作、保障专家尊严和薪酬、去除中间商的机会。2024 年 5 月,Mercor 开始直接与实验室合作,此后便是一路狂奔。

Brendan 将此总结为创业者的建议:他曾花大量时间试图强求产品市场契合(Product-Market Fit)。有时候你需要坚持对世界如何变化的信念,但也需要对市场正在如何发展、公司将如何融入其中保持极度开放。如果边际客户都极难推销,就无法建立大生意。你需要找到那些出人意料地容易推销的客户——那种你知道是大痛点的客户。

Mercor 的三大文化支柱

Brendan 认为以下三大原则对 Mercor 的成功至关重要:

进取态度(Can-do Attitude)。Mercor 总是设定极其雄心勃勃的目标,公司的轨迹似乎总会围绕这些目标成形。Benchmark 领投 A 轮时,Mercor 的收入运行率为 150 万美元,Brendan 承诺年底达到 5000 万美元,Benchmark 觉得他们疯了——但正负两周内就做到了。如今已远超原定今年 5 亿美元运行率的目标。

高标准(High Standards)。Mercor 的招聘门槛极高,大量雇佣前创始人。最近引入 Sundeep Jain 担任总裁——他此前是 Uber 的首席产品官和首席技术官,加入了这家相对较小的公司来帮助扩展流程。前十名员工的素质塑造了公司后续发展的大量特征。Brendan 同时指出,"缓慢招聘"的建议是双刃剑:前十人需要极其谨慎,但从 10 到 100 人时应该加速——一旦确认市场需求远超供给,就应该踩油门优化速度。

强度(Intensity)。回顾 Meta 和 Google 等传奇公司的早期文化,都有极高强度——员工竭尽全力推动前沿。Mercor 同样是产出导向而非投入导向:不规定具体工时,但需要找到高度主人意识的人。很多员工会留在办公室到很晚,但如果需要早退与家人共进晚餐或周末旅行,当然也可以。Brendan 强调他们从未强制工时——高强度更多是有强烈主人意识的自然副产品。

创业精神:你只需要行动

Brendan 从八年级开始的甜甜圈生意就体现了这种精神。他发现 Safeway 的甜甜圈一打只卖 5 美元,觉得这是不可思议的好生意——于是在中学里以每个 2 美元转售,很快售罄。为了扩张,他付给母亲 20 美元让她开面包车带他去 Safeway 买 10 打甜甜圈。学校试图制止他在校园内售卖,他把摊位移出 50 英尺到了校外。竞争对手出现了,卖的是更高端的 Chuck's Donuts(成本 1 美元/个),Brendan 就把价格降到 1 美元持续两周把对手挤出市场——虽然那时他还不知道什么叫反竞争行为。他雇朋友帮忙,用甜甜圈支付——朋友们认为甜甜圈值 2 美元一个,而对他来说成本极低。

Brendan 从中学到的核心教训是:你只需要行动。太多人有想法,但建立公司的障碍只是主动性和采取行动的意愿——去构建客户想要的产品和体验,投入时间和雄心去扩展。

模型进步与超级智能的前景

Brendan 不认同超级智能三年内到来的预测。他认为这是一条更长的路——这并非贬低模型的非凡能力,未来十年内知识工作的大部分任务确实会被自动化,但这条长路是由铺就那些能力的评估构成的。让模型实现这些能力的不是 10 倍更多的预训练数据,而是更加数据高效和深思熟虑的后训练数据集。

David Sacks 曾指出,当前的局势几乎是最好的情况:AI 并非快速跃迁到超级智能,有多个竞争者互相制衡,模型已经非常有价值且持续提升,不存在某个赢家超级智能接管世界的局面。Brendan 认同这一判断,并补充说虽然很多超级智能的恐惧可能被夸大,但即便只有 5% 到 10% 的灾难概率(P-Doom),也值得谨慎对待。总体而言,未来十年将是非凡的——AI 将创造丰裕,为每个人提供更好的医疗、最好的法律建议,以及前所未有的产品构建能力。

教育领域也将发生巨变。Brendan 回忆起大学时父母责怪他不去上课,他会说 YouTube 上有更好的课程。当模型变得比最好的教授更擅长传递信息时,想象一下这意味着什么——所有人都能获得更好的信息,提升技能,推动人类进步。

闪电问答

推荐的三本书:《高产出管理》(High Output Management)——关于运营公司的杰出著作;《从零到一》(Zero to One)——当然的经典;《鞋狗》(Shoe Dog)——一个激励人心的故事。

最近喜欢的电影或剧集:电影是《奥本海默》。最爱的电视剧是《金装律师》(Suits)。

最近发现的最爱产品:Codex 的新版本,巨大的进步。

人生座右铭:"你只需要行动"(You can just do stuff),以及"进取态度"(Can do)。

关于阅读障碍:Brendan 坦言自己有阅读障碍。一方面这让他很难每天处理上千封邮件或阅读每份文件,但另一方面帮助他换一种方式思考、更具创造力,也许能看到别人看不到的市场变化。从管理角度,这让他更加注重发挥每个人的优势而非弥补弱点——有些事他永远不会做到世界最佳,但在其他方面他可以不断精进。

结语

Brendan 鼓励每个人——尤其是如今 AI 让构建变得如此容易的背景下——主动出击,构建产品、与客户对话,迈出那一步。主动性和行动意愿是更多创新出现的最大障碍。Lenny 呼应道:有太多人只是听播客、读文章,却从不行动,而现在是有史以来最容易尝试和构建的时候。正如 Brendan 的甜甜圈故事所展示的——你只需要行动,有时候只需把摊位移出 50 英尺就能摆脱管辖。

觉得有用?分享给一个需要的朋友 🙏