小红书(xiaohongshu)招聘大模型multi-turn RL实习生
招聘职位:
大模型multi-turn RL实习生 搜索同类职位
岗位职责:
1、参与 multi-turn-rm 数据建设(preference 对比、奖励维度拆解、rubric 设计)
2、研究 multi-turn RL 思路(RLAIF、GRPO、PPO、多轮奖励 credit assignment 等)
3、标注与分析对话数据:找坏例子 / 拆错误模式 / 总结好对话结构
4、评估并优化 session-level 对话体验(是否跑题、是否 self-consistent、是否达成任务目标)
5、与模型训练同学协作,把 RM/RL 想法落到实验与迭代验证
任职要求:
对 RLHF / RM / RLAIF / 长对话问题有基础认知和训练经验
1、参与 multi-turn-rm 数据建设(preference 对比、奖励维度拆解、rubric 设计)
2、研究 multi-turn RL 思路(RLAIF、GRPO、PPO、多轮奖励 credit assignment 等)
3、标注与分析对话数据:找坏例子 / 拆错误模式 / 总结好对话结构
4、评估并优化 session-level 对话体验(是否跑题、是否 self-consistent、是否达成任务目标)
5、与模型训练同学协作,把 RM/RL 想法落到实验与迭代验证
任职要求:
对 RLHF / RM / RLAIF / 长对话问题有基础认知和训练经验
免责声明:
此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!