Scale AI 简调
Scale AI 是一家 AI 数据、模型评测与企业/政府 AI 应用基础设施公司,核心能力是用人类专家数据与评测流程帮助模型训练、后训练和部署。
Scale AI rlhf human-data model-evaluation public-sector-ai Scale AI 是一家 AI 数据、模型评测与企业/政府 AI 应用基础设施公司,核心能力是用人类专家数据与评测流程帮助模型训练、后训练和部署。
Scale AI
1. 调研缘由
这次把 Scale AI 放进简调,主要是它早已不止于“数据标注外包商”这一层身份。Scale 官网首页和 About 页称自己提供高质量数据和 full-stack 技术,帮顶尖模型公司、企业和政府构建、部署并监督 AI 应用;About 页也把业务拆成 Data at Scale、Evaluations、Applied AI 三块 [S1][S2]。
另一个直接信号是 2025 年 Meta 对 Scale 的大额少数股权投资。根据 Scale 的官方公告,Meta 这笔投资使公司估值超过 290 亿美元,创始人 Alexandr Wang 加入 Meta 参与 AI 工作,同时 Jason Droege 出任临时 CEO [S8]。Reuters 则报道 Meta 获得了 Scale 49% 股份,并指出这笔交易可能会影响 Scale 与 Meta 竞争对手之间的客户关系 [S9]。
这篇简调重点想回答三个问题:Scale 的核心生态位到底是数据标注、数据基础设施,还是评测基础设施;Meta 交易有没有改变它作为多家前沿模型公司中立数据供应商的角色;以及它的“专家数据”能力与人工数据劳务争议之间,怎么区分事实、评价和信息缺口。
2. 简介与产品工作流
Scale AI 总部在旧金山,定位是 AI 数据与应用基础设施公司。官网称它提供高质量数据和 full-stack technologies,帮顶尖模型公司、企业和政府构建、部署并监督 AI 应用 [S2]。
从产品工作流来看,Scale 主要切入模型和 AI 应用生命周期的四个环节:
- 数据准备:Scale Data Engine 做的是数据收集、整理、标注,并支持模型训练与评测的循环 [S3]。这里的“Data Engine”可以理解成一套把原始数据变成模型可用的训练/评测数据的流程与平台,不是简单地把任务派给标注员。
- 后训练与人类反馈:Scale 的 Generative AI Data Engine 支持定制化数据标注、模型评测以及 RLHF 数据,可通过 API、SDK 或 Web 前端来用 [S4]。RLHF 全称 Reinforcement Learning from Human Feedback,也就是用人类反馈帮模型调整回答偏好。
- 模型评测与红队:Scale 的 About 页把 Evaluations 定义为模型评测与红队,用来衡量、对标和改进 AI 表现 [S2]。这里的红队是用攻击性或边界性问题去测模型的弱点,跟传统网络安全里的红队不是一回事。
- 企业/政府 AI 应用落地:Scale GenAI Platform 负责连接企业数据、构建和编排 Agent,再用自动反馈和人类反馈去做监控、评分与改进;Donovan 则面向公共部门,提供任务导向的 AI Agent 以及模型比较和评测能力 [S5][S6]。
Scale 的目标用户覆盖前沿 AI 实验室、企业、政府和公共部门。官网称其客户包括 AI 实验室、企业和政府,并在 About 页把 Meta、Cohere、Adept、Cisco、TIME 等列为“Trusted by”对象 [S2]。
3. 团队与资本背景
Scale AI 2016 年成立,总部在加州旧金山。官网上列出的公司数字包括:2016 年成立、1000 多名员工、150 亿次用于训练 AI 模型的人类决策、向全球贡献者累计支付 10 亿美元,以及 290 亿美元估值 [S2]。
融资方面,Scale 在 2024 年 5 月宣布完成 10 亿美元融资,估值 138 亿美元。这轮由 Accel 领投,老股东有 Y Combinator、Index Ventures、Founders Fund、Coatue、Thrive Capital、Spark Capital、NVIDIA、Tiger Global、Greenoaks、Wellington Management,新进来的包括 Cisco Investments、Intel Capital、ServiceNow Ventures、AMD Ventures、Amazon、Meta、Qualcomm Ventures 等 [S7]。
2025 年 6 月,Scale 官方公告 Meta 对公司进行新投资,使 Scale 估值超过 290 亿美元;同一公告还提到,创始人 Alexandr Wang 加入 Meta 参与 AI 工作,继续担任 Scale 董事,Jason Droege 出任临时 CEO [S8]。据 Reuters 报道,Meta 取得 Scale 49% 股份,交易后 Meta 不打算取得董事会席位;报道还提到部分 Scale 员工会随 Wang 转入 Meta,Wang 仍留在董事会 [S9]。
团队稳定性方面,Scale 创始人转入 Meta 是需要单独拿出来看的一个组织变动,不是普通融资新闻。官方称 Scale 仍保持独立并继续保护客户数据 [S8];Reuters 则报道有客户担心与 Scale 合作会暴露研究优先级、路线图和原型产品信息 [S10]。
4. 技术基础与生态位
Scale 最主要的生态位是 data-eval-safety:它不直接做基础模型,而是围绕训练数据、后训练数据、模型评测、安全红队和人类反馈来提供服务。Scale 的 About 页把业务拆为 Data at Scale、Evaluations、Applied AI 三块——Data at Scale 包含训练数据、标注和 RLHF,Evaluations 包含模型评测和红队,Applied AI 面向企业与政府的 AI 应用构建、部署和监督 [S2]。所以 Scale 横跨“数据/评测/安全”和“企业及政府 AI 应用基础设施”两个层面;frontmatter 里的 primary_category 单选 data-eval-safety,只能覆盖它最主要的生态位,企业/政府 AI 应用基础设施这部分放在正文说明 [S2][S5][S6]。
从具体能力看,Scale Data Engine 能生成复杂的 prompt-response 对、RLHF、人类偏好、红队和评测,支持文本、图像、视频、3D Sensor Fusion 等数据类型 [S3]。Scale 的 Generative AI Data Engine 文档提到,客户可以通过 API、SDK 或 Web 前端拿到定制化的标注、模型评测和 RLHF 数据 [S4]。
Scale GenAI Platform 把生态位进一步延伸到企业 AI 应用基础设施。官方页面称 SGP 可以接入 Confluence、SharePoint、S3 等企业数据源,部署和编排长时间运行、多 Agent 协同的应用,并通过自动反馈和人类反馈来做监控、评分和改进 [S5]。同一页面还提到,SGP 支持部署在客户自己的 VPC 中,兼容 AWS、Azure、GCP,并能在 OpenAI、Google、Meta、Mistral 等主要模型之间测试、微调和部署 [S5]。
公共部门是 Scale 的另一个重要垂直场景。Scale Donovan 面向任务关键工作流,支持通过无代码界面创建知识库、选择模型、设定 Agent 指令、连接外部系统,并进行模型对比与评测 [S6]。其美国公共部门页面称,支持 Department of Defense、Intelligence Community 和 Federal Civilian agencies 的计算机视觉与 agentic GenAI 项目 [S11]。
在技术披露程度上,Scale 对产品能力、交付形态和部分安全/合规能力讲得比较清楚,但具体的数据质量控制算法、劳务调度系统、评测集构建细节以及客户项目的数据边界,公开信息就不多了。所以 frontmatter 里 technical_disclosure 标为 limited。
5. 市场与外部信号
Scale 的市场信号可以分成三类。
第一类是资本与估值信号。Scale 在 2024 年完成 10 亿美元融资时估值 138 亿美元 [S7];2025 年 Meta 投资后,官方称公司估值超过 290 亿美元 [S8],Reuters 报道 Meta 取得 Scale 49% 股份 [S9]。
第二类是客户与收入结构信号。Reuters 在 2025 年 6 月报道,Google 是 Scale 的最大客户,原计划当年向 Scale 支付约 2 亿美元;还提到 Scale 2024 年收入为 8.7 亿美元,其中来自 Google 的支出约 1.5 亿美元 [S10]。这些数字是 Reuters 引用知情人士的说法,Scale 未在官方公告中逐项披露。
第三类是公共部门与企业落地信号。Scale 官方在 2025 年 9 月宣布与 CDAO 签了一份上限 1 亿美元、为期 5 年的 AI 协议,让政府开发者在安全环境中微调、测试和部署生成式 AI 模型,并用 Donovan 帮情报分析员和任务操作人员处理非结构化数据 [S12]。Scale 官网也把 US Public Sector 和 Global Public Sector 列为独立方案线,并强调数据基础设施、模型评测、系统工程和人在环保障 [S11][S13]。
但 Meta 交易后,客户中立性成了一个主要的外部风险信号。据 Reuters 报道,Google 计划在 Meta 取得 Scale 49% 股份后切断与 Scale 的合作,Microsoft、xAI 也在后撤,OpenAI 更早几个月就已经减少了合作。报道还提到,AI 实验室担心跟 Scale 合作会暴露研究优先级、路线图和原型产品信息 [S10]。同一篇报道也引用了竞争对手的观点,说数据供应商的中立性正变得更重要,不过这些属于利益相关方的表态,需要和事实报道分开看 [S10]。
6. 公开评价与主要分歧
正面评价(官方 / 客户合作方 / 独立媒体):
- 官方层面,Scale 把自己描述为 AI 数据和 full-stack 技术提供商,2024 年融资公告里用了“data foundry for AI”这个定位 [S2][S7]。这属于官方自身的说法,不是独立评价。
- 客户与合作方层面,Scale Data Engine 页面展示了客户案例和引语,称其帮客户拿到了训练数据、省去了标注与质控工作 [S3]。这类内容来自官网,只能说明“官方放了客户案例”,不能当独立评价看。
- 独立媒体层面,Reuters 把 Scale 描述为一家向生成式 AI 模型公司提供专业人类训练者网络的公司,并说这类复杂标注被用在模型后训练上;报道还提到,随着模型变强,对更专业人类样例的需求也在上升 [S10]。这可以看作独立外部来源对 Scale 生态位的一种描述。
- WIRED 报道了 Scale/Remotasks 从低成本地区数据劳务扩展到美国和欧洲的专家数据劳务,并引用 Scale 数据运营负责人的话说,专家被用于事实核查和提升生成式 AI 输出质量 [S14]。这说明外部也观察到 Scale 从传统标注向专家数据转移,不过其中部分观点来自 Scale 高管,要标明来源边界。
- 整体来看,公开的独立正面评价其实不多;除了 Reuters 和 WIRED 对它的专家数据/后训练生态位有一些外部描述,大部分正面材料都出自官方页面或客户案例,不能当作独立评价 [S10][S14][S2][S3]。
主要批评/质疑(独立媒体 / 劳务争议 / 诉讼与监管报道):
- Washington Post 2023 年调查报道称,Scale 旗下 Remotasks 在菲律宾的部分工人反映存在低薪、延迟或取消付款、申诉渠道有限等问题;报道依据包括工人采访、内部公司消息、支付记录和财务文件 [S15]。
- Business Insider 2025 年报道了 Outlier 与 Scale 项目里,部分贡献者被要求编写和评估有害提示,用来做 AI 安全红队;报道还称 Scale 面临多起工人诉讼,Scale 发言人则回应说,训练模型防止有害内容是安全 AI 开发必不可少的,并称贡献者有事先预告、退出选择和健康支持 [S16]。
- Reuters 2025 年报道美国劳工部正在调查 Scale AI 是否遵守 Fair Labor Standards Act 规定的公平薪酬和工作条件要求;同篇报道也写到 Scale 称自己遵守适用法律、贡献者反馈总体积极、付款问题处理较快 [S17]。这是一则调查报道,不能写成监管已认定违规。
- The Guardian 2026 年报道称,部分 Outlier 工人描述了用公开社交媒体资料和版权作品训练 AI 的任务,并称 Scale 对部分指控做了否认或限制性回应;这篇报道适合作为“独立媒体披露的争议”,但不能单凭它就推出普遍结论 [S18]。
存在分歧之处:
- 中立性分歧:官方称 Scale 在 Meta 投资后仍保持独立并继续保护客户数据 [S8];Reuters 则报道 Google、Microsoft、xAI 等客户或潜在客户因 Meta 入股和 Wang 转入 Meta 而重新评估合作 [S10]。这里的分歧不在“Scale 有没有泄露数据”,而在于客户是否还相信它能维持中立供应商这个位置。
- 专家数据 vs 劳务风险:Scale 官网强调专家、语言学家和程序员网络、质量控制和高质量数据 [S3][S4];独立媒体盯着的则是 Remotasks/Outlier 工人的付款、劳动分类、心理健康、数据来源边界等争议 [S15][S16][S17][S18]。两方讨论的是同一条供应链的不同层面,不能互相替换。
- 评测可信度边界:Scale 参与构建和发布了模型评测,如 Humanity’s Last Exam [S19];但公开资料还不够判断它的企业私有评测在不同客户间是否有统一可审计标准,后续要看是否会有更多评测方法、数据治理和第三方审计的披露。
7. 同类对比(与头部/高知名度同类项目)
主要对标项目: Surge AI、Labelbox、Mercor。
这三家都和人类反馈、模型后训练或 AI 评测沾边,但切入点不一样:Surge AI 更聚焦 LLM/RLHF 数据与评测;Labelbox 当前公开定位为 RL data engine、custom evaluations 和 leaderboards;Mercor 更强调专家网络与 AI training projects [S20][S21][S22][S23]。下面的对比只做公开事实归纳,不下优劣判断。
关键维度对比(事实,标来源):
| 维度 | Scale AI | Surge AI | Labelbox | Mercor |
|---|---|---|---|---|
| 核心定位 | 数据、评测、企业/政府 AI 应用系统;官方拆为 Data at Scale、Evaluations、Applied AI [S2] | 面向 LLM 的 RLHF、人类反馈、专家标注、红队与快速实验接口;其 Anthropic 案例页如此描述 [S20] | 官方自称 “RL data engine for AI teams”,覆盖 environments、custom evaluations,并称服务美国 90% 以上 leading AI labs [S21] | 官方称连接专业人士参与 AI training projects,用人类专业知识来训练和评估模型 [S22] |
| 产品范围 | Data Engine、GenAI Data Engine、SGP、Donovan,覆盖训练数据、RLHF、红队、评测、Agent 部署 [S3][S5][S6] | RLHF 平台、专家标注、红队、API/RLHF interface,公开资料更集中在 LLM 数据与安全训练 [S20] | 官方页面强调 RL data engine、custom evaluations;leaderboard 页面称其用平台、科学流程和专家人类来衡量模型能力 [S21][S23] | 专家匹配、远程 AI training work、模型输出评估、样例创建与质量标准评估 [S22] |
| 目标客户 | AI labs、企业、政府和公共部门;官网明确列出企业、美国公共部门、全球公共部门方案 [S2][S11][S13] | 公开案例重点展示 Anthropic 使用 Surge 的 RLHF 与人类反馈 [S20] | 官方称服务美国 90% 以上 leading AI labs,并面向 frontier AI 团队 [S21] | 官方称服务 leading AI companies,并招募领域专家参与训练和评估 [S22] |
| 交付方式 | API、SDK、Web 前端;SGP 支持客户 VPC,政府方案支持安全环境 [S4][S5][S12] | 官网案例提到 API 和 RLHF interface,便于研究团队设计和启动任务 [S20] | SaaS 平台与评测/leaderboard 页面;公开资料显示可直接进入应用或联系销售 [S21][S23] | 专家平台与项目匹配;公开页面向工作者展示远程项目与申请流程 [S22] |
| 2025-2026 外部信号 | Meta 投资后,Reuters 报道 Google 等客户重新评估或减少合作,焦点是中立性 [S9][S10] | 本次未找到同等量级资本/客户中立性争议公开资料;公开资料主要是客户案例和研究/benchmark 内容 [S20] | Reuters 报道在 Scale-Meta 交易后,Labelbox 被视作可能承接部分客户转移的竞争者;Labelbox CEO 对潜在新增收入有表态,属利益相关方观点 [S10] | Reuters 报道 Mercor CEO 称许多 AI labs 想雇佣内部数据标注员,以保持数据安全;这是竞争者观点,应按来源边界处理 [S10] |
公开评价中的对比(标源,非个人裁决):
Reuters 的报道把 Scale 与 Labelbox、Handshake、Mercor、Turing 等放在同一个竞争语境里,核心变化是 Meta 入股 Scale 后,一些模型公司更看重数据供应商的中立性和数据安全 [S10]。这不是在说“谁更好”,而是说明数据供应链的竞争维度,已经从“能不能做高质量标注”扩展到了“客户信不信任供应商的股权和信息边界”。
Surge AI 公开的案例强调,Anthropic 曾需要一款能处理 LLM 人类反馈、领域专家、红队和快速实验的数据平台 [S20]。Labelbox 官网则强调 custom evaluations 和 leaderboards,leaderboard 页面说他们用专家人类评估模型能力 [S21][S23]。Mercor 官网强调用专业人士的领域知识去评估、改进和指导大模型 [S22]。这些公开表述共同指向一点:前沿模型训练的数据市场,正从普通数据标注转向更高技能、更偏评测导向的人类反馈工作,只是各家的组织形态和客户边界并不相同。
8. 信息缺口与后续观察
- 客户留存与收入结构:Reuters 报道了 Google、Microsoft、xAI、OpenAI 对 Scale 合作的调整,但 Scale 没有逐客户公开收入、续约、流失或替代供应商的信息。后续要看 2026 年会不会有更多客户案例、收入披露或客户迁移的报道。
- Meta 入股后的数据隔离机制:Scale 官方称公司仍独立并保护客户数据,但没公开足够细的隔离机制、审计机制或客户可验证条款。后续可以留意是否会出现第三方安全审计、客户信任声明或合规披露。
- 人工数据劳务治理:Outlier 官方说明平台由 Scale AI 运营,把专家连接到 AI 公司提供人类反馈 [S24];但独立媒体持续报道付款、劳动分类、心理健康、数据采集边界等争议。后续应关注诉讼、劳工监管调查和平台政策更新。
- 评测方法透明度:Scale 公开了部分评测和 benchmark,如 Humanity’s Last Exam [S19],也公开过 SEAL(Safety, Evaluations and Alignment Lab,Scale 的安全、评测与对齐实验室),称其用于构建评测产品并研究评测与红队问题 [S25]。但企业私有评测项目的题集构建、打分方式、偏差控制和第三方验证不一定公开。后续适合重点跟踪 SEAL、leaderboard、benchmark 文档和外部复现讨论。
- 公共部门部署边界:Scale 面向美国和全球公共部门的业务覆盖国防、情报、政府服务和主权 AI。公开资料能确认产品方向,但具体合同范围、实际部署效果和采购持续性,仍需更多一手合同或政府公告支撑。
9. 归纳洞察 ★
Scale AI 身上反映出一个趋势:AI 数据供应链正从“低成本标注”向“专家数据 + 模型评测 + 后训练反馈”迁移。早期的数据标注业务还在它的底层,但官网现在更强调 RLHF、红队、评测、企业 Agent 生命周期和政府 AI 应用。换句话说,“数据公司”的生态位已经从单纯给模型喂数据,扩展到了判断模型哪里错、该怎么改、能不能上线。
Meta 这笔交易让 Scale 从中立的中间层供应商,落到了一个更敏感的竞争位置上。Reuters 已经报道 Google、Microsoft、xAI、OpenAI 等客户或潜在客户在 Meta 入股后重新评估或减少了合作,这说明数据供应商的股权关系和信息边界,已经成了产品能力之外的关键变量 [S10]。
Scale 身上的争议还提示了一个容易被忽略的问题:高质量 AI 数据不是凭空冒出来的,它背后有专家、任务平台、审核流程、心理风险和劳动合规。官方讲的是“专家数据”和“人在环”,独立报道看到的则是平台劳务、付款和有害内容暴露。两者都属于同一条供应链,只是观察的位置不同。写这类项目时,需要把产品能力、公开评价和劳务争议分开处理,不能用任何一边去覆盖另一边。
10. 来源与更新时间
- 信息截至(as_of): 2026-07-13
- 最后复查(last_checked): 2026-07-13
- 最后更新(last_updated): null