揭秘Mercor:一家能卡OpenAI和Anthropic脖子的“外包”公司
2026 年上半年,成立仅三年的 Mercor 实现了 6.14 亿美元总收入,其中 91% 来自基础模型公司。公司将约三分之二的收入支付给承包商,第二季度毛利率为 33%。
据《The Information》获得的融资材料,Mercor 向潜在投资者预测,到 2030 年,公司总收入将接近 690 亿美元,毛利率达到 56%,《财富》2000 强企业贡献 57% 的收入,基础模型公司的占比则降至三分之一以下。
Mercor 还在洽谈新一轮融资,讨论中的估值约为 200 亿美元。英伟达既是其重要客户,也考虑过参与投资。截至 9 月 10 日,这轮融资尚未获得完成确认。公司最近一次正式公布的估值,是 2025 年 10 月融资时的 100 亿美元。
支撑 Mercor 收入的,是一套规模庞大的专家数据生产体系。Mercor 为 OpenAI、Anthropic、Google DeepMind 等模型公司寻找律师、医生、程序员和金融从业者,组织他们制作训练数据、专业任务和评分标准。
而随着今天模型能力彼此越来越趋近,更多的竞争都取决于后训练的数据质量,OpenAI和Anthropic的大量工作都围绕获取更高质量数据展开。数据成了模型竞赛的关键,能不能从Mercor这样的公司获得独家的对训练有直接成效的数据,就几乎直接决定了每一轮模型比拼的结果。Mercor们某种程度上开始卡OpenAI和Anthropic们的脖子,它们水涨船高的估值和收入就是最直接证明。
支撑未来增长预测的,则是评测、强化学习环境和企业 AI 服务。Mercor 已经进入这些领域,这家从招聘起家的公司,正在试图改变自己的收入结构。
(在即将于旧金山举办的Assembling 2026大会上,我们也将请到Mercor的核心团队,和我们进行对话,聊一聊这家公司最新的情况和他们的思考)
Mercor 的三位创始人 Brendan Foody、Adarsh Hiremath 和 Surya Midha 相识于旧金山湾区的 Bellarmine 中学,都是辩论队成员。Hiremath 和 Midha 曾作为搭档赢得三项全国政策辩论赛事冠军。
后来,Foody 和 Midha 进入乔治城大学,Hiremath 就读哈佛。2023 年,三人在巴西圣保罗参加黑客马拉松时,发现了一门相当简单的生意:将印度工程师介绍给需要开发人员的美国初创企业,负责招聘、合同和支付,再收取服务费。
Mercor CTO Adarsh Hiremath 与 CEO Brendan Foody
第一位客户每周支付 500 美元,Mercor 将其中约 70% 付给工程师,留下其余部分。创业很快占据了三人的全部时间。Foody 没有参加大学期末考试,他们随后相继离校,并在 2024 年成为 Thiel Fellows。
Mercor 最初的产品是一套 AI 招聘系统。它能读取候选人的简历、GitHub 和作品集,进行视频面试、评估技能、匹配岗位,并处理后续合同与报酬。
2024 年 1 月,公司宣布获得 General Catalyst 领投的 360 万美元种子轮融资。同年 9 月,Benchmark 领投 A 轮,估值达到 2.5 亿美元。2025 年 2 月,Mercor 又以 20 亿美元估值融资 1 亿美元。
根据 Mercor 投资方 Felicis 对创始人的采访,Mercor 曾通过 Scale 为前沿模型公司招募一千多名工程师。随后,部分承包商抱怨付款和平台管理问题,Mercor 开始绕过中间商,直接服务模型公司,并获得 Cognition 等客户的订单。
原先,美国创业企业雇用工程师,是为了开发自己的产品。模型公司则需要工程师设计编程任务、提供参考答案、评价模型生成的代码,或者制作可以让 Agent 排查的故障。
Mercor 原有的招聘系统,恰好能够处理这种快速变化的人才需求。它随后将专家网络扩展到法律、医学、金融、科研等领域。
人才平台也在进入 AI 数据市场。Handshake 利用校园和职业网络寻找专家,Turing 则将全球软件工程师资源用于模型训练。原有的招聘、技能筛选和人才管理体系,让这些公司能够相对迅速地进入专家数据业务。
岗位要求申请人拥有法学高等学位、普通话母语水平,以及在中国执业至少两年的经验。工作完全远程,时薪 70 至 80 美元,每周至少投入 20 小时,项目预计持续两个月。
候选人需要提交简历,完成两轮 AI 面试,再接受付费试工。正式进入项目后,工作包括翻译、改写和整理中国法律内容,检查术语与法律制度的准确性。
招聘只是数据生产的第一步。模型学习编写代码,可以借助单元测试检查程序是否正确。一份法律分析的整体质量,却很难仅靠程序充分衡量。有没有引用正确条款、是否遗漏关键风险、结论能否得到证据支持,都需要专业人士制定评价标准。
行业将这类评分标准称为 rubric。专家把“什么是好答案”拆成可以逐项检查的要求,再据此评价模型的回答。
模型公司还可以根据模型的薄弱环节提出需求。例如,发现模型在某类合同分析中反复犯错,就让专家针对这些问题制作新的任务和评价标准,用于评测或后续训练。
Mercor 部分项目使用 RL Studio 组织任务生产,参与者分为 Writer 和 Reviewer。前者创建任务、编辑内容并提交审核,后者负责批准、退回修改或提供反馈。一个任务通常包含提示词、可选输入文件和评分标准,状态可以在 Pending、In Review、Approved、Needs Edits、Discarded 之间流转。
任务的评分可以由专家完成,也可以由 AI 根据专家制定的 rubric 自动执行。Mercor 曾向 TIME 表示,在 APEX 评测中,AI 评分与人工评审的一致率达到 89%。
部分按小时计酬的项目还会使用 Insightful 记录工时。软件可以定期截取屏幕截图,辅助核验工作记录;按照 Mercor 的公开政策,扣除工时前需要由人工结合截图和具体情境审核。平台也存在按交付物结算的项目,具体规则取决于合同。
这些系统将专家工作拆成可以分配、审核和结算的任务。Mercor 在 2026 年 5 月披露,平台每周向承包商支付的金额已超过 1400 万美元,周活跃承包商超过三万人。它宣称拥有近五百万人的专家网络,但这一规模不能直接理解为实际在岗或被平台独占的专家人数。
专家生产的数据也已经远远超出问答形式。2026 年 3 月,Mercor 与 AI 编程公司 Cognition 合作推出 APEX-SWE。为了制作一道故障排查任务,工程师需要编写 500 至 1000 行正常运行日志,再混入 10 至 20 行故障症状,配置聊天记录、监控系统、容器环境和参考修复方案。
任务改编自真实 GitHub 项目中的问题与代码修复记录。Agent 要进入环境,寻找线索、定位故障并修复系统,最后由测试或评分规则判断是否完成。
一份数据由此可能包含题目、文件、软件、参考答案和验证程序。它既可以用来评测模型,也可以在适当处理后成为强化学习材料。
这门生意的工作跨度很大。2025 年 11 月,一个代号为 Musen、涉及 Meta 短视频内容的项目突然结束。《福布斯》采访的承包商称,该项目的 Slack 工作群一度超过 5000 人,部分人员原本获得每小时 21 美元,随后收到另一个项目 Nova 的邀请,时薪降至 16 美元。
Mercor 发言人认为相关报道不准确。Foody 后来表示,公司已经在招聘和入职材料中说明原项目具有临时性质。
部分项目还使用代号,不向承包商正式公布最终客户。这既可以帮助模型公司隔离项目和保护研发信息,也使工作者的合同、考核和收入主要取决于 Mercor 的管理。
模型公司可以要求供应商短期增加数千名人员,也可以在需求变化时终止项目。对客户有价值的弹性,同时构成 Mercor 的运营压力和承包商的收入风险。
预训练主要利用网页、书籍和代码等大规模内容。此后的监督微调、人类反馈和强化学习,需要更多示范答案、质量判断与训练反馈。
随着 AI 开始编程、分析合同、制作财务模型和操作企业软件,模型公司还需要获取真实工作的背景、过程和验收标准。
一份公开的并购协议,很难完整呈现投行分析师如何查阅材料、处理财务异常、修改模型并制作最终报告。律师、医生等专业人士长期积累的判断,也未必存在现成、合法可用的公开数据。
模型公司既在建设自己的数据团队,也会向外部供应商采购。核心训练目标、关键评测、数据标准和模型迭代,通常需要模型公司的研究团队深度参与。外部供应商则可以承担专家招聘、资质验证、任务生产、质量管理和项目运营,双方分工随项目而变化。
Mercor 自己也承认,数据已经成为模型公司的核心知识产权。出于模型能力和数据安全考虑,内部建设数据生产流程有充分理由。
它在 Black Box vs. Open Box 文档中提出,允许客户保留数据控制权,使用自己的平台,甚至直接与专家合作,同时将招聘、筛选和人员管理交给 Mercor。客户可以掌握核心研究流程,又不必独自承担所有用工事务。
外包的价值主要体现在需求波动和组织效率。一个模型项目可能突然需要数百名化学专家,几个月后又转向金融或软件工程。如果全部长期雇用,模型公司需要承担固定成本;如果逐个聘请短期人员,又要处理资历、合同、培训、质检和付款。
Mercor 将这些工作集中处理,再把人才渠道和项目管理系统用于不同客户。即便模型公司自建数据团队,需求也不一定稳定。2025 年 9 月,xAI 据报道裁减至少 500 名通用数据工作人员,同时宣布大幅扩充专业领域 AI tutor。内部团队同样需要随着训练重点调整。
2025 年 6 月,Meta 投资 Scale AI 又改变了模型公司的采购选择。
Meta 以约 143 亿美元取得 Scale 49% 的股份,Scale 创始人 Alexandr Wang 随后加入 Meta。Google 等模型公司重新评估与 Scale 的合作。数据供应商可能接触模型缺陷、训练任务和研发方向,其独立性因此成为采购时需要考虑的因素。
Mercor、Surge、Handshake 等公司获得了新的争取订单的机会。不过 Mercor 在这笔交易前就已经进入高速增长阶段,Scale 事件只是加速因素之一。
这些公司的业务已经明显重叠,差异仍然存在。Scale 拥有长期积累的数据生产体系、全球交付能力和 Outlier 专家网络;Surge 更早深入语言数据、RLHF 和研究协作;Handshake 依靠校园与职业网络获取专家;Turing 则拥有软件工程师供给和模型训练经验。
Mercor 从自动招聘切入,逐渐建立专家表现记录、任务生产流程和研究团队。相比单纯介绍人才,它希望更深地参与客户对数据质量和模型效果的判断。但专家可以同时为不同平台工作,庞大的人才名单并不代表独占供给。
英伟达就是一个例子。据 2026 年 8 月披露的信息,它此前一个季度向 Mercor 支付了数千万美元,相关数据用于 Nemotron 模型,部分 Mercor 员工几乎全职服务英伟达。
与此同时,英伟达仍向 Turing、Scale 采购,也拥有内部数据团队,并大量使用合成数据。它还讨论过参投 Mercor,目前尚未确认完成。
供应商之间的竞争,最终要落实到交付能力。谁能更快找到合适的人,谁的任务质量更可靠,谁能更快响应研究反馈,以及谁的数据真正改善了模型表现。
模型公司可以持续增加外部采购,也可以分散预算、收回部分工作。Mercor 要获得更长期的收入,必须让客户有理由持续购买。
Mercor 官网如今列出了人才招聘、定制数据、现成数据集、专业评测、强化学习环境、企业 AI 和数据授权等业务。
财务材料能够确认,基础模型公司贡献了 Mercor 绝大部分收入。公司并未公布各产品的收入拆分,现成数据集、评测、环境和企业业务正在扩张,其独立收入与毛利数据仍然缺失。
第一步是让数据可以重复销售。定制项目需要根据客户要求重新组织生产。现成数据集则可以提前制作,在授权条件允许的情况下卖给不同客户。Mercor 宣称其数据目录拥有超过五万条任务,覆盖三十多个领域。
如果同一批任务能够多次授权,新增收入就不必承担完全相同的生产成本。但数据复用还受合同、任务有效期和客户需求限制。Mercor 没有公布现成数据集的实际收入,也没有披露复用率。
第二步是评测。2025 年,Mercor 推出 APEX,使用法律、医学、金融和咨询等专业任务衡量模型的工作能力。2026 年 1 月,APEX-Agents 进一步引入长程、跨应用任务,让 Agent 在虚构企业的文档、表格、邮件和聊天记录中寻找信息,完成专业工作。
评测可以帮助模型公司发现缺陷,也能指导下一轮任务生产和后训练。专家制定的 rubric,因此开始同时服务数据生产、能力测量和训练反馈。
评测系统也需要持续维护。9 月 8 日,Mercor 更新 APEX-Agents 1.1。此前,研究团队发现一些模型会同时给出多个备选答案,以提高命中评分条目的概率。新版本加强任务审核,修改评分方式,避免奖励这种行为。
评测业务的价值不仅在于生产更多题目,还在于题目和评分机制能够跟上模型能力的变化。
第三步是强化学习环境。让 Agent 学会操作企业软件,光有任务和参考答案还不够。模型需要进入可以实际运行的工作场景,在其中不断尝试,并根据结果接受反馈。
完整环境通常包含三个部分。World 提供虚构企业的人员、文件、邮件和业务背景;Apps 提供可以操作的软件;Tasks 则规定具体目标和 verifier,也就是检查 Agent 是否完成工作的验证器。
环境还需要能够重置、并行运行和记录操作过程。模型才能反复练习,使用这些反馈继续训练。
2026 年 2 月,Mercor 收购 Sepal AI。后者已经从事高质量训练数据、评测和强化学习环境业务。3 月发布的 APEX-SWE,也展示了 Mercor 组织专家制作复杂软件工程环境的能力。
7 月,Mercor 又宣布收购 Deeptune。Deeptune 已经重建数百种企业应用,能够让 Agent 在模拟软件中执行任务。公司此前获得 Andreessen Horowitz 领投的 4300 万美元 A 轮融资,Foody 曾以个人身份参投。Mercor 在收购前也是 Deeptune 的客户。
这笔收购的意义,在于将更系统的应用仿真平台并入 Mercor。此前,公司已经拥有专家、任务、评分和部分环境工程能力,Deeptune 则补强了软件层,使其有机会将专家工作和可运行的训练环境一起交付。
模型公司可以分别采购专家、数据、软件环境和训练系统,也可以尝试向一家供应商购买更完整的服务。Mercor 正在争取后者的订单。这笔交易的价格没有披露。
第四步是参与后训练。2026 年初,Mercor 为 Applied Compute 提供专业任务和评测,由后者使用专有强化学习系统,对 GLM-4.6 和 GLM-4.7 进行后训练。
9 月,Mercor 又与 SkyRL 合作,使用 1928 个专家制作的任务,对 Qwen3.5-397B-A17B 进行强化学习。公司公布的结果显示,模型在当时版本的 APEX-Agents 上,单次任务成功率从 16.11% 提高到 27.29%。双方还公开了训练脚本、模型权重和评测记录。这说明 Mercor 已经能够参与大型开放模型的后训练研发。
Mercor 在 2026 年 3 月推出 Enterprise AI,希望把为模型公司建立的专家、评测和训练能力用于企业自身的工作流程。
一类是 AI 初创公司,包括开发 AI 应用、自建模型或微调现有模型的企业。它们需要采购的仍可能是专家、定制数据、评测和训练服务,与基础模型公司的需求存在重叠。
Mercor 预计,到 2028 年,这类 AI 初创公司与《财富》2000 强企业贡献的收入合计将超过基础模型公司。这个预测并不是说传统企业届时将单独反超模型公司。
另一类是使用 AI 改造自身业务的传统企业。Mercor 的 Enterprise AI 已经提供了几种具体服务。
首先是工作流诊断。它通过员工访谈、企业数据和业务流程分析,找出适合引入 AI 的环节,并交付按优先级排列的机会清单、实施路线和收益估算。
其次是评测。企业可以根据自身要求检查模型和 Agent,确定哪种方案符合业务标准、哪里容易失败,以及是否达到部署条件。
再往后是部署与优化。Mercor 提供前线部署工程师,将 Agent 接入企业现有系统,检查代码、提示词、工具和模型选择,并根据实际运行结果持续改进。
官网披露的项目包括,为一家私募股权机构评估 AI 改造机会,以及为一家技术公司的工程团队部署事故响应 Agent。企业软件、HR 等领域也有评测和优化应用场景,部分项目没有公布客户名称或合同金额。
Mercor 还与金融科技公司 Ramp 合作发布过一个专业评测,名为 APEX-Accounting。
该基准于 7 月 31 日公布,包含 10 家虚构企业的 160 道月末结账任务,涉及分录、对账和差异分析。40 多名会计专业人士参与出题和解题,从业经验中位数为 11 年,超过半数曾在四大会计师事务所工作。发布时,得分最高的模型通过了 56.4% 的评分标准。
Ramp 的合作说明,Mercor 已经能够与企业共同设计专业评测。但这是一项公开基准研究,相关公告没有说明 Ramp 为此支付了费用,不能把它当成一笔已经确认的 Enterprise AI 销售订单。
融资材料还列出了 Ramp、Blue Owl 和花旗等客户。不过名单没有提供具体合同和收入分类。
Mercor 没有披露 Enterprise AI 的收入、毛利、收费模式及客户续约情况。官网提供了具体交付案例,却还不足以证明这项业务已经形成多大的商业规模。
企业数据授权则是另一种交易。Mercor 帮助企业整理、匿名化邮件、文档、聊天和其他工作数据,再许可给模型公司。按照其官网说明,数据提供方不需要向 Mercor 支付费用,反而可以获得报酬。Mercor 承担数据提取、处理和授权交易的成本。
机器人视频采集也更接近数据获取与转售业务,不能直接归入传统企业向 Mercor 采购 Agent 服务的收入。
因此,Mercor 的企业增长前景包含了多种生意:AI 初创公司购买训练与评测,传统企业购买诊断和部署,另有企业向 Mercor 提供数据。它们的客户、交付方式和成本结构各不相同。
2026 年 8 月,据《福布斯》报道,Mercor 与腾讯存在业务关系,与阿里巴巴也存在采购协议。一名知情人士称,中国模型公司贡献了 Mercor 第二季度约 2% 的收入。报道还援引两名数据行业创业者转述的市场估算,称中国六家主要模型公司每年合计向美国数据供应商采购约 5 亿美元。
另一条联系来自公开研究。Mercor 使用 GLM、Qwen 等中国开放权重模型开展后训练,并在 APEX-Agents 1.1 中使用 DeepSeek 模型作为自动评分器的基础。开放权重允许研究团队修改模型、运行训练并公布结果,为 Mercor 展示数据和训练能力提供了技术底座。
中国业务目前不是 Mercor 的主要收入来源,却说明专业训练数据已经形成跨国采购市场。先进 AI 芯片受到美国出口管制,而专家数据没有受到同等范围的一般性禁售规定。随着数据在模型训练中的价值上升,相关交易也开始受到更多政策关注。
Mercor 已经建立了规模可观的收入基础,但财务数字也暴露出当前模式的限制。2026 年上半年,公司实现 6.14 亿美元总收入,其中 91% 来自基础模型公司。6 月,其 ARR 突破 20 亿美元。
Mercor 向投资者预测,2026 年全年总收入约为 20 亿美元。这是另一项尚未实现的全年预测,与 6 月的年化运行率属于不同指标。
按照公司此前约 60% 至 70% 的承包商支付比例,20 亿美元年化收入中,扣除承包商报酬后的金额粗估为 6 亿至 8 亿美元。剩余部分还需要承担内部员工、技术、销售和其他经营成本。
Mercor 2025 年毛利率为 27%,2026 年第二季度升至 33%。它预计 2027 年达到 46%,2030 年达到 56%,公司并未披露各类产品的收入和毛利贡献,因此无法确认预期改善究竟来自专家生产效率提高,还是数据集、环境软件和企业业务的扩大。
企业客户增加,可以降低 Mercor 对基础模型公司的收入依赖,却不必然降低人力成本。要改善毛利率,公司还需要提高专家数据的生产效率,或者扩大数据集、评测、环境等产品的可复用收入。
按照正在讨论的 200 亿美元估值,以及 6 月超过 20 亿美元的年化收入计算,估值约为年化收入的 10 倍。不过,Mercor 仍需将约三分之二的收入支付给承包商。不同公司的收入构成和毛利率差异较大,不能简单横向比较收入倍数。
讨论中的估值尚未最终确认,流传的融资材料信息表明,公司正在向潜在投资者展示一个与今天不同的收入结构。
目前,Mercor 九成以上的收入来自基础模型公司。按照管理层预测,到 2030 年,《财富》2000 强企业将贡献 57% 的总收入,基础模型公司的占比降至三分之一以下。
企业业务已经有产品和实际交付案例,Mercor 也开始将评测、环境和后训练能力用于更多场景。但这些业务的收入、毛利和续约情况尚未公开,现有财务信息不足以判断它们距离管理层预测的规模还有多远。
Mercor 还需要面对客户集中带来的风险。2026 年 3 月,Mercor 受到 LiteLLM 开源供应链攻击影响。恶意软件窃取凭证后,攻击者获得未经授权的系统访问。攻击者声称取得约 4TB 数据,包括数据库、源代码和视频。
4 月 3 日,WIRED 报道,Meta 已暂停与 Mercor 的合作。OpenAI 则在调查事故的同时继续现有项目。
6 月 25 日,Mercor 公布调查总结,称只有范围有限的专家敏感信息和客户资料受到影响,并表示所有前沿模型公司客户在过去几个月都增加了合作规模。
这起事故发生在一家掌握模型训练任务、评分标准和客户研发资料的供应商身上。客户对数据安全的要求,会随着 Mercor 向核心研究和企业工作流程深入而提高。
Mercor 自己承认,对于核心模型能力和数据安全,客户有充分理由将数据生产留在内部。外部采购在速度、弹性和专家供给方面仍有优势,但哪些环节会长期留给供应商,取决于客户自建能力的成本和效果。
英伟达向 Mercor 支付了数千万美元,同时使用其他供应商和内部团队;OpenAI 在安全事故后继续既有项目,Meta 则暂停合作。对收入高度集中的 Mercor 来说,客户可以分散采购、建设内部团队,也可以因安全问题暂停合作,这些选择都构成经营风险。
Mercor 今天的收入主要来自基础模型公司。它向投资者展示的未来,则是一家客户范围更广、毛利率更高,能够将专家数据、评测和训练能力销售给大量企业的公司。
这并非一个完全停留在融资材料里的设想。Mercor 已经建立起大规模专家生产体系,开发了专业评测和训练环境,参与了大型模型的后训练,也开始向企业提供 Agent 部署服务。这些能力为它进入更广泛的市场提供了基础。
目前尚不清楚的是,新业务何时能够形成足够大的收入,又能在多大程度上改善利润率。企业客户增加可以降低客户集中度,能否改变人力成本结构,还取决于数据、评测和环境的复用能力。
Mercor 的发展已经证明,专业知识和真实工作经验正在成为 AI 产业一门规模可观的生意。随着模型从回答问题走向完成工作,这类需求仍有继续扩展的空间。
Mercor 抓住了专家数据的增长机会。接下来更值得关注的,是它能否利用现有的人才、研究和环境能力,把这门生意进一步做成可规模化、可持续的训练与企业服务。