今年以来,有这样一个现象在AI圈被反复讨论:模型在数学评测、竞赛频频刷新纪录,但一旦被放进真实的企业工作流,表现就明显打折扣。
有人说,这像是招了一个名校毕业的优等生,简历漂亮、考试满分,但第一天上班就手足无措。
过去几年,模型主要是通过两种方式“上学”:预训练阶段吞下海量互联网文本,记住了无数知识点;后训练阶段做大量选择题,学会判断哪个答案更好。这两种方式教会了模型“知道什么”,但没有教会它“怎么做事”。
很显然,模型不缺知识,但缺“工作经验”。真实世界里,写一份投研报告不是选择题。它涉及几十张Excel表、多份研报交叉验证,前后逻辑必须环环相扣;写一段生产环境可用的代码也不是单文件就能搞定,要在多个文件之间来回修改、运行、调试。
而这些任务往往有几个共同特征:
长步骤、多文件、信息不完整、没有标准答案,只能靠执行环境的反馈来判断方向。让模型学会处理这类任务,需要给它提供一套仿真工作环境——可以动手操作、收到反馈、反复重来,就像飞行模拟器训练飞行员一样。
然而,搭建这样的练习室并不容易。想要把这些“只可意会”的经验翻译成模型可训练、可验证的任务格式,需要的不是单点突破,而是一套连接行业专家判断与大语言模型学习的系统性基建。
模速空间
这正是Copula Lab选择进入的领域——也是这家刚刚入驻模速空间的新势力企业试图回答的问题:
把专家说不出的“感觉”,变成模型能练的“题库”。
Copula Lab的两位创始人都曾在MiniMax任职,并完整参与了Coding和Agent能力从早期到当前的演进。

CEO梁丽
毕业于北京大学,早期专注 NLP 方向。在腾讯产培生项目后加入MiniMax,曾作为Agent 业务负责人主导 Agent 产品从0 到 1 构建,带领团队实现核心业务数倍增长与千万级 GMV。

(右为Copula Lab CEO梁丽)

CTO蔡佳人
全栈工程师出身,技术栈覆盖预训练与后训练全链路。曾任 MiniMax 开源负责人及后训练数据算法。主导 M2 系列模型 Coding 方向的后训练数据构造与国际开源发布。

模速空间
目前,Copula Lab的四条产品线都在围绕这个核心展开:
Benchmarks基准榜单
以真实经济任务为基础的科学评测,主动定义下一代模型的落地方向。相当于为模型提供专业能力的“模拟考试”。
专家级RL环境
围绕高价值、长程、半开放场景设计的任务套组,以强化学习环境形式交付。
专家工作流数据
通过AI启发式访谈与多专家质检,从认证专家中提炼领域数据,再结构化为模型可学习、可评测、可审核的任务。
Bad Pattern数据集
界定前沿模型在长链条专业任务上的能力边界,覆盖事实引用、数字一致性、证据匹配、隐含规则、专家判断等典型失败模式。

通过基准榜单为模型提供专业能力的“模拟考试”,专家级RL环境则把投研、建模、复杂编程等真实高价值工作,转化为可交互、可验证的仿真任务。专家工作流数据相当于把专家脑子里的“案例库”整理成模型可以直接翻阅的“教科书”。最后,数据集则专门记录模型在长任务中容易犯的典型错误,帮助模型“避坑”。
这四样东西加在一起,就是Copula Lab想给大模型搭建的那间“职场练习室”——有考试、有实操、有教材、有错题本。
区别于其他公司,在 Copula 的管线中,顶尖专家不是流水线标注员,而是整个环境的挑战者,他们的核心价值,是去不断挑战、修正和定义模型所处环境的规则。
基于这套 Data Infra, Copula正在产出高质量的数据、环境和评测:
Coding:面向多文件、复杂交互与视觉可验证的前沿代码任务,构建可运行的沙箱环境和评测标准,用于模型在复杂开发与空间推理方向的后训练。
Copula Web3D 数据集:面向 Web3D 后训练场景,构建高保真、可交互、专家标准对齐的三维物体资产。
Cowork Agent:面向高价值的金融、法律等专业垂直领域,将真实、长程、多格式文件交织的复杂人类工作流,转化为模型可学习、可验证的连续任务环境。
Copula 金融长程任务数据集:面向金融投研与估值建模的高难长程任务构建后训练数据
Copula Lab的出现,和两百年前狄德罗用图纸把工匠说不出口的手艺变成了工业革命的通用教材,有着异曲同工之妙。同时也从另一个角度说明一件事,模型能力的边界,正在从算法和算力,慢慢转移到谁能拿到最稀缺、最贴近真实工作现场的那批数据。
模速空间
而这样的她们
也正在寻找同路人
全 职
01
算法研究员(后训练&数据方向)
02
大模型后训练 Agent 基建工程师
03
HRBP
04
专家平台运营
05
Agent 数据策略产品
兼职 / 实习
01
Web3D 专家(实习/兼职)
02
金融领域专家(兼职)
各岗位详情
1. 算法研究员(后训练&数据方向)
01
岗位职责
带领/协同团队开展前沿算法研究,推动数据构建、后训练、强化学习算法设计与优化,推动成果落地并发表论文
参与 benchmark、eval、rubric、数据质量标准和训练数据方案设计
与行业专家、算法、数据工程和交付团队协作,将专家判断和真实工作流拆解为可学习、可评测的任务单元
02
任职要求
研究生及以上学历(优秀本科可放宽),AI/计算机/数学相关专业
有大模型、多模态、Agent、模型评测、后训练或数据构造相关经验
精通 Python,具有 PyTorch、Megatron、LlamaFactory、verl 等框架开发经验
有大模型方向学术研究或工程项目经验,能独立完成论文阅读、实验设计、数据分析、错误归因和技术写作
ownership 与自我驱动强,能将模糊问题拆解为明确目标、实验路径和交付结果
03
加分项
作为主要作者在NeurIPS、ICLR、ICML、COLM、ACL、EMNLP、CVPR、ICCV等顶尖会议或TPAMI、JMLR等顶级期刊发表过文章
有头部 AI lab、大厂模型团队、研究机构或优秀创业公司经历
有后训练、benchmark、eval、agent 评测、多模态评测、代码评测或高质量数据集构建经验
对模型能力边界、synthetic data、agent training、RL environment、expert data 等方向有自己的判断
在开源社区(HuggingFace、GitHub)有突出贡献

2. 大模型后训练 Agent 基建工程师
01
岗位职责
建设后训练数据平台,覆盖数据构造、Agent rollout、轨迹采集、自动评测、人工复核打标、版本管理和训练数据导出
研究并接入 Claude Code、OpenCode、Codex 等 Agent 工具,沉淀工具调用、上下文管理、会话恢复与轨迹回放能力
建设 Agent Sandbox 集群及 LLM Gateway,保障环境构建与复现、资源隔离、并发执行、路由限流与调用观测
建立数据质量与治理能力,推动数据生产向异步 rollout 与训练闭环演进
02
任职要求
3 年以上后端、数据平台或大模型训练数据基础设施开发经验
熟练使用 Python、Go 等编程语言,熟悉 Linux、容器及工程化测试
具备复杂系统的数据建模、版本治理、可观测性、幂等和失败恢复经验
理解 SFT、偏好数据、rollout、reward、RLVR 等后训练基本概念
03
加分项
深度研究过 Claude Code、OpenCode、Codex、Deepseek Harness 等 Agent Harness,理解上下文管理、工具调用、权限控制、轨迹协议等关键机制
有 Agent Sandbox、运行集群或 LLM Gateway 开发经验
构建或维护过 Benchmark、评测平台、自动验证器或可执行任务环境,熟悉 SWE-bench、Terminal-Bench 等
有开源 Agent 框架、评测框架或后训练数据基础设施的贡献经验

3. HRBP
01
岗位职责
统筹从需求对齐、寻访、初筛、面试安排到发 offer、跟进入职的招聘全流程
通过招聘平台、社交网络、专家网络、内推和冷启动触达,为核心岗位建立稳定候选人 pipeline
与用人团队紧密配合,把模糊需求转化为清晰画像、渠道策略和评估标准
支持业务团队的入职引导、员工关系、目标落地、组织氛围与文化建设
搭建并迭代基础人事流程与制度,包括入转调离、考勤、薪酬福利对接、员工手册等
02
任职要求
2 年以上招聘经验,有互联网/科技公司 in-house 招聘、猎头,或专家网络项目管理背景
有 HRBP 或综合 HR 经验,熟悉入职、员工关系、绩效、组织与文化等模块
擅长主动寻访,能独立触达并吸引被动候选人,尤其是资深、稀缺人才
沟通与推动能力强,能同时对接用人团队、候选人与员工,高效协调多方
做事有条理、结果导向,能在快速变化的早期团队里独立跑通流程
对 AI 行业有兴趣,愿意快速学习不同领域(金融、法律、设计、工程)的人才画像
03
加分项
有从 0 到 1 搭建招聘/HR 体系或团队快速扩张阶段的经验
熟练使用 AI 工具辅助寻访、筛选、沟通与人事管理,提升效率

4. 专家平台运营
01
岗位职责
进行跨行业专家的寻访、招募与入库,覆盖法律、金融、咨询、医药、制造等领域
建立专家分级、标签化和评估体系,精准匹配专家专业背景与具体项目/任务需求
运营专家关系,包括日常沟通、专家管理、工作效率提升,以及长期合作机制建设
协同产品、工程、算法团队,组织专家参与 Agent 任务拆解、专家判断标准制定、评测 rubric 设计,并把控专家输入质量
02
任职要求
本科及以上学历,专业不限
3 年以上专家网络/专家咨询行业运营经验,有凯盛、GLG、Third Bridge 或同类平台经验优先
熟悉专家寻访全流程运营,包括渠道拓展、背景核实、专家分级等
具备较强行业敏感度,能快速理解不同专业领域(法律、金融、医药等)语境并判断专家匹配度
有较强沟通协调能力,能同时运营专家、客户/内部业务方两端关系
03
加分项
有从 0 到 1 搭建专家网络运营体系,或独立运营规模化专家库的经验
对 AI、Agent、LLM 相关业务有基本理解,能理解专家输入如何用于任务设计和模型评测
是 AI 工具的高频使用者,能用 AI 提升寻访效率、匹配推荐、流程自动化等工作

5. Agent 数据策略产品
01
岗位职责
定义跨行业 Agent 任务场景,与法律、金融、咨询、医药、专利、合规、设计、运营等领域专家合作,拆解专家判断和真实工作流
设计 Agent Eval 和 Benchmark,包括任务设计、评测指标、rubric、成功判定标准和质量验收方式
基于模型表现、专家反馈、客户需求和交付结果,持续迭代任务设计、数据标准、评测方案和产品流程
深度使用 AI 工具完成调研、任务拆解、原型设计、数据分析、文档生成和流程自动化
协同算法、工程和交付团队,将产品方案落地为可运行的任务环境、评测系统、数据生产流程和客户交付结果
02
任职要求
本科及以上学历,专业不限;人工智能、计算机、经济、管理、法学、金融、医学、设计、工业工程、信息管理等背景均可
有大厂或头部 AI 公司 AI 产品、Agent 产品工作或实习经历,参与过 Agent eval、Benchmark、模型评测、复杂任务评估、AI 产品测试或专家标注流程
对 Agent、LLM、post-training、eval、RL environment、AI data pipeline 等方向有持续兴趣
具备较强任务拆解能力,能把模糊业务问题拆成清晰流程、任务单元、判断标准和验收规则
具备较强文档能力
03
加分项
是 AI 工具的高频使用者,能主动用 AI 提升调研、写作、分析、原型和交付效率
有和行业专家、客户、一线业务人员或跨职能团队合作的经验,能快速理解专业语境并转化为产品语言

6. Web3D 专家
01
岗位职责
参与 Web3D 交互类训练数据/任务场景的搭建,包括场景构建、动效设计与交互反馈实现
使用 Coding Agent 辅助批量产出多样化、高质量的 Web3D 交互 demo 与任务样本
协同算法、数据团队把控 Web3D 交互内容的审美与质量标准,用于模型训练与评测
关注交互内容的多样性、稳定性与可复现性,确保产出可标注、可评测
02
任职要求
参与 Web3D 交互类训练数据/任务场景的搭建,包括场景构建、动效设计与交互反馈实现
使用 Coding Agent 辅助批量产出多样化、高质量的 Web3D 交互 demo 与任务样本
协同算法、数据团队把控 Web3D 交互内容的审美与质量标准,用于模型训练与评测
关注交互内容的多样性、稳定性与可复现性,确保产出可标注、可评测

7. 金融领域专家
01
岗位职责
参与金融领域 Agent 任务设计,将投研、建模等专业工作流拆解为可评测的任务单元
制定金融任务的评测标准与 rubric,把控输入与评测、交付质量
与产品、算法团队协作,帮助团队理解金融领域的专业语境与工作标准
02
任职要求
3 年以上 Tier-1 投行/头部券商(研究所或投行部)经验
精通金融建模与研报撰写,熟悉完整工作流与质量标准
逻辑拆解能力强,能把复杂的专业工作抽象为清晰、结构化的任务与标准
善于沟通,能把隐性的专业经验清晰表达给非金融背景的团队
CFA / FRM 或名校金融、会计相关背景优先
03
加分项
特定行业(TMT、消费、医药、新能源等)深度覆盖;
有讲师/带教背景
上下滑动,查看更多岗位
更多岗位欢迎查看:
https://www.copulalab.com/careers
欢迎投递:talents@copulalab.com
模速空间
两百年前,德尼·狄德罗用一部《百科全书》将工匠的“手感”编译为时代的“共识”,让知识从作坊流向了世界。今天,Copula Lab试图在数字世界完成一次镜像般的回响——把专家脑海中难以言表的“直觉”解构成模型可以反复操练的“技能”。
如果说模速空间是AI产业的“热带雨林”,提供了从算力到场景的完整生态,那么Copula Lab就是这片雨林中一位耐心的“园丁”,在后训练阶段以SFT和RL环境数据深入高经济价值、高门槛的专业工业流,为AI的狂奔铺下一条贴近地面的轨道。这家新势力正努力将未来的宏大叙事,拆解成一行行数据、一道道工序,让经验走出个人,最终流回真实的工作现场。