查看更多分享

哔哩哔哩(bilibili|b站)招聘【B-UP】强化学习训练框架工程师(实习)

招聘职位:

【B-UP】强化学习训练框架工程师(实习) 搜索同类职位
发布日期:
2026-07-30
工作地点:
职位类型:
兼职
职位类别:
实习
来源:
b站官网
岗位介绍:
职位描述

工作职责:
1、参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
2、参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
3、参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
工作要求:
1、本科及以上学历,计算机、人工智能、数学、自动化等相关专业;
2、了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
3、熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架;
4、熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力;
5、有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先;
6、在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先。

投递简历
免责声明:

此信息由b站官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“b站官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 哔哩哔哩(bilibili|b站)招聘常见问答

哔哩哔哩(bilibili|b站)招聘工作地点:
上海