工作职责:
1. 协助后训练数据清洗与合成
参与大规模数据的去重、过滤、质量分级与增强流程。
在导师指导下完成多样化指令数据、复杂推理数据的自动构造实验,并整理效果对比。
2. 参与数据质量评估与评测基准建设
协助设计自动化评估脚本,整理评测结果,分析不同数据批次对模型表现的潜在影响。
参与诊断式评测集的题目构造、校验与维护,帮助客户定位模型的数据短板。
3. 协助交互式训练数据与环境设计
参与多轮对话、工具调用、智能体行为轨迹等数据的构造与清洗。
协助搭建模拟交互环境的数据生成流程,支持客户后续训练需求。
4. 客户项目支持与工具开发
协助将数据集成至客户训练流程,整理反馈并跟进迭代。
开发数据处理、可视化、自动化报告等辅助工具,提升团队效率。
5. 前沿跟踪与文档沉淀
跟踪大模型数据相关前沿工作,参与组内分享。
撰写实验记录、技术文档与项目总结,沉淀可复用的方法论。
任职资格:
1. 硕士及以上学历,具备机器学习、深度学习基础知识,了解大模型基本概念与训练流程。
2. 至少熟悉一门编程语言,有良好的代码习惯;有数据处理、脚本开发或数据分析项目经验。
3. 对数据清洗、数据合成、数据评估有浓厚兴趣,做事细致、有耐心,能处理大规模数据中的细节问题。
4. 具备良好的学习能力、沟通能力和团队协作意识,能阅读英文技术资料。
加分项
1. 有课程项目、竞赛、开源项目或论文复现经历,涉及大模型、数据工程、评测体系等方向。
2. 有数据标注、数据清洗、数据合成或评测集构建的实践经历。
3. 熟悉常用数据分析与可视化方法。
4. 有较强的文档撰写与结果呈现能力。