美团(meituan)招聘大模型算法工程师(强化方向)
招聘职位:
大模型算法工程师(强化方向) 搜索同类职位
岗位职责:
1. 负责大语言模型强化学习全链路优化,包括高质量训练数据构建、奖励模型迭代(Reward Model / Process RM)、RL策略训练(PPO/DPO/GRPO等),持续提升模型推理质量与对齐效果;
2. 探索强化学习前沿技术并推动落地,包括但不限于:推理时计算优化(Test-time Compute)、基于搜索的推理增强、多步Agent决策优化、在线学习与自我进化;
3. 将大模型能力与美团搜索、推荐、广告等核心业务场景深度结合,设计并迭代基于RL的策略模型,实现可量化的业务目标提升。
任职要求:
1. 计算机科学、自动化、数学、统计学等相关专业硕士或博士,扎实的数学基础和编程能力;
2. 精通强化学习核心算法(Policy Gradient、PPO、DPO、GRPO等),理解Reward Modeling和RLHF/RLAIF对齐技术原理,有LLM对齐相关项目实践经验优先;
3. 熟悉PyTorch,有大规模分布式训练经验(DeepSpeed/Megatron-LM/FSDP),能独立完成从数据处理到模型训练部署的全流程;
4. 有以下经验者优先:大语言模型推理优化(vLLM/TensorRT-LLM)、Agent/工具调用场景RL训练、搜索推荐系统强化学习应用;
5. 在ICML、NeurIPS、ICLR等顶级会议发表RL/LLM方向论文者优先;
6. 良好的逻辑思维和沟通能力,自驱力强,乐于挑战开放性技术问题。
岗位亮点:
1. 前沿技术深水区:直接参与千亿参数大模型的RL训练,每天面对业界最前沿的Scaling RL挑战;
2. 端到端闭环落地:从算法研究到亿级用户场景验证,你的每一行代码都能产生真实业务价值,拒绝纸上谈兵;
3. 技术驱动文化:团队鼓励顶会投稿、内部技术分享,你可以在工作中同步保持学术竞争力。
1. 负责大语言模型强化学习全链路优化,包括高质量训练数据构建、奖励模型迭代(Reward Model / Process RM)、RL策略训练(PPO/DPO/GRPO等),持续提升模型推理质量与对齐效果;
2. 探索强化学习前沿技术并推动落地,包括但不限于:推理时计算优化(Test-time Compute)、基于搜索的推理增强、多步Agent决策优化、在线学习与自我进化;
3. 将大模型能力与美团搜索、推荐、广告等核心业务场景深度结合,设计并迭代基于RL的策略模型,实现可量化的业务目标提升。
任职要求:
1. 计算机科学、自动化、数学、统计学等相关专业硕士或博士,扎实的数学基础和编程能力;
2. 精通强化学习核心算法(Policy Gradient、PPO、DPO、GRPO等),理解Reward Modeling和RLHF/RLAIF对齐技术原理,有LLM对齐相关项目实践经验优先;
3. 熟悉PyTorch,有大规模分布式训练经验(DeepSpeed/Megatron-LM/FSDP),能独立完成从数据处理到模型训练部署的全流程;
4. 有以下经验者优先:大语言模型推理优化(vLLM/TensorRT-LLM)、Agent/工具调用场景RL训练、搜索推荐系统强化学习应用;
5. 在ICML、NeurIPS、ICLR等顶级会议发表RL/LLM方向论文者优先;
6. 良好的逻辑思维和沟通能力,自驱力强,乐于挑战开放性技术问题。
岗位亮点:
1. 前沿技术深水区:直接参与千亿参数大模型的RL训练,每天面对业界最前沿的Scaling RL挑战;
2. 端到端闭环落地:从算法研究到亿级用户场景验证,你的每一行代码都能产生真实业务价值,拒绝纸上谈兵;
3. 技术驱动文化:团队鼓励顶会投稿、内部技术分享,你可以在工作中同步保持学术竞争力。
免责声明:
此信息由美团官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“美团官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!