大模型研究员(Post-training 数据方向)(J10794)
  • 招聘类别:
  • 社会招聘
  • 工作性质:
  • 全职
  • 薪资范围:
  • 30000-50000 元/月
  • 招聘人数:
  • 若干
  • 发布时间:
  • 2026-09-09
  • 截止时间:
  •  
  • 工作地点:
  • 北京市

工作职责:

1. 后训练数据清洗与合成管线的设计及产品化
 负责设计面向监督微调和强化学习场景的超大规模数据预处理流程,包括噪声过滤、冗余消除、质量分级及智能增强策略;
 深入研究指令泛化、推理链条构造、复杂任务数据的自动生成与动态配比方法,将前沿的数据合成方法论转化为标准化、高稳定性的数据产品,交付给头部大模型客户使用。
2. 数据质量评估体系与评测基准开发
 构建以“数据质量驱动模型效果”为核心的内部评估框架,设计自动化流程,用于预判不同批次、不同来源数据对客户模型训练的潜在增益;
 面向客户需求,开发可定制的诊断式评测集,帮助客户精准识别其模型在特定维度的能力短板,并将评测能力作为增值服务输出。
3. 强化学习训练数据与环境设计
 设计适用于后训练对齐算法的奖励信号数据生产策略,涵盖多维度对比数据、对抗性提示生成及难度自适应机制;
 搭建模拟交互环境的数据生成引擎,产出高质量的多轮对话、工具调用及智能体行为轨迹数据,为客户后续的强化学习训练提供充足且多样化的“燃料”。
4. 客户协同与数据产品迭代
 配合客户将数据集成至其训练框架,根据客户训练反馈快速迭代数据清洗逻辑与合成策略;
 持续跟踪学术界及产业界最新数据处理方法论,保持公司数据产品的技术前瞻性。


任职资格:

基本条件:
 计算机、人工智能、数学、统计等相关专业硕士及以上学历,博士或具有高水平论文发表经历者优先;
 扎实的机器学习与深度学习理论基础,深入理解主流大模型架构及训练全流程,熟悉监督微调、强化学习对齐等后训练范式,并能清晰理解不同算法对数据形式与质量的需求;
 具备丰富的大规模数据处理经验,精通去重、质量过滤、隐私脱敏及混合增强等常用方法论,能熟练使用分布式计算平台处理海量数据,有将数据处理流程产品化的成功案例;
 对强化学习场景下的数据标注准则、模型作弊规避、对抗样本构造等有实际认知,有参与过奖励建模数据生产或交互环境搭建者优先;
 有评测体系构建经验,了解主流公开评估任务的底层逻辑,能独立开发自动化评测工具或定制化评测集合;
 编程功底扎实,精通常用编程语言,具备良好的工程化思维与代码规范意识,能将复杂流程封装为稳定可复用的系统模块。

加分项:
 有大模型训练数据的商业化交付经验,熟悉B端客户的数据验收标准与合规要求;
 参与过大型开源数据处理库或数据飞轮系统的设计与开发;
 具备多模态数据(如图文、视频、语音等)的清洗与合成经验;
 对数据版权、隐私合规及生成内容溯源有深入了解,并有相应的技术落地方案。

热招职位更多 >>
长招职位更多 >>