小红书招聘【REDstar】Dots-Post-Training算法工程师
招聘职位:
【REDstar】Dots-Post-Training算法工程师 搜索同类职位
岗位职责:
1、Post-Training Pipeline 设计与迭代:搭建并持续优化 SFT、RM、RLHF/RLAIF/ RLVF 等后训练流水线,支持多模态模型的高效迭代,让千亿级大模型在一次次“后训练”中真正变得聪明、智慧、安全;
2、可扩展监督与反馈系统:设计低成本人类 + AI 组合反馈机制,自动化完成偏好采集、对齐传递与数据质量评估,通过 Product-Research co-design 探索构建真实用户反馈的模型迭代机制;
3、通用推理与工具使用能力提升:构建跨模态强化学习环境和多样化奖励体系,帮助模型学会调用外部工具、提升模型利用文本-图像-语音跨模态信息进行复杂推理和问题解决能力;
4、长期记忆、个性化与终身学习:探索持久记忆与动态偏好建模,使模型能够跨会话记住用户偏好、持续学习而不遗忘核心能力;
5、安全评估与价值观对齐:搭建安全对齐机制、红队测试、越狱防御与自动化评测框架,量化模型幻觉、稳定性及价值观一致性,制定风险缓解策略,确保模型在开放场景中始终行为可控;
6、跨职能落地:与产品、设计、人文训练师及数据团队,把研究成果迅速推向真实场景,打造小红书下一代战略级 AI native 应用产品。
任职要求:
1、本科及以上学历,计算机等相关专业方向优先;
2、扎实机器学习与深度学习基础,熟练掌握PyTorch / JAX / TensorFlow等任一框架;
3、熟悉后训练常用技术(SFT、RLHF / DPO / RLAIF 等)或具备相关项目 / 竞赛 / 论文经验;
4、具备实验设计与问题定位能力,能独立分析大模型在不同数据分布和任务场景下的表现;
5、善于沟通和团队协作,乐于在快速迭代中分享想法、推动落地。
【加分项】
1、有深度参与贡献的顶会(ICML / NeurIPS / ICLR / ACL / CVPR 等)论文;
2、ACM-ICPC、NOI/IOI、Kaggle 等竞赛奖项;
3、参与过开源 / 闭源大模型的 Alignment / Post-Training 项目经历。
1、Post-Training Pipeline 设计与迭代:搭建并持续优化 SFT、RM、RLHF/RLAIF/ RLVF 等后训练流水线,支持多模态模型的高效迭代,让千亿级大模型在一次次“后训练”中真正变得聪明、智慧、安全;
2、可扩展监督与反馈系统:设计低成本人类 + AI 组合反馈机制,自动化完成偏好采集、对齐传递与数据质量评估,通过 Product-Research co-design 探索构建真实用户反馈的模型迭代机制;
3、通用推理与工具使用能力提升:构建跨模态强化学习环境和多样化奖励体系,帮助模型学会调用外部工具、提升模型利用文本-图像-语音跨模态信息进行复杂推理和问题解决能力;
4、长期记忆、个性化与终身学习:探索持久记忆与动态偏好建模,使模型能够跨会话记住用户偏好、持续学习而不遗忘核心能力;
5、安全评估与价值观对齐:搭建安全对齐机制、红队测试、越狱防御与自动化评测框架,量化模型幻觉、稳定性及价值观一致性,制定风险缓解策略,确保模型在开放场景中始终行为可控;
6、跨职能落地:与产品、设计、人文训练师及数据团队,把研究成果迅速推向真实场景,打造小红书下一代战略级 AI native 应用产品。
任职要求:
1、本科及以上学历,计算机等相关专业方向优先;
2、扎实机器学习与深度学习基础,熟练掌握PyTorch / JAX / TensorFlow等任一框架;
3、熟悉后训练常用技术(SFT、RLHF / DPO / RLAIF 等)或具备相关项目 / 竞赛 / 论文经验;
4、具备实验设计与问题定位能力,能独立分析大模型在不同数据分布和任务场景下的表现;
5、善于沟通和团队协作,乐于在快速迭代中分享想法、推动落地。
【加分项】
1、有深度参与贡献的顶会(ICML / NeurIPS / ICLR / ACL / CVPR 等)论文;
2、ACM-ICPC、NOI/IOI、Kaggle 等竞赛奖项;
3、参与过开源 / 闭源大模型的 Alignment / Post-Training 项目经历。
免责声明:
此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!