哔哩哔哩(bilibili|b站)招聘游戏商业生态产品运营实习生(数据向)
招聘职位:
游戏商业生态产品运营实习生(数据向) 搜索同类职位
岗位介绍:
部门介绍
我们正在建设 Veda——一个面向内容理解算法的数据、训练、评测与 Agent 实验平台,帮助算法同学更高效地完成数据构建、模型训练、Prompt 调优、效果评测、实验管理和任务交付。
我们希望招聘一名同时具备算法基础和工程意识的实习生。你会参与 Qwen3.5 等大模型的后训练与评测,包括 SFT、GRPO、On-Policy 蒸馏等方向;同时也需要将验证有效的算法方案沉淀为稳定、可复现的平台流程。
这不是一个只负责提交训练任务的纯模型训练岗位,也不是一个常规前后端开发岗位。我们更看重你能否完成“数据分析—模型训练—效果评测—问题归因—流程沉淀”的完整闭环。
职位描述
工作职责:
1. 大模型训练与后训练
●基于 Qwen3.5 等开源大模型,开展 SFT、GRPO、DPO及知识蒸馏实验。
●参与 On-Policy 蒸馏流程建设,包括 Student Rollout、Teacher 反馈、训练样本构造、样本筛选和迭代评测。
●根据内容理解和 Agent 任务特点,设计训练数据、Prompt、Reward 与采样策略。
●分析 reward、loss、KL、entropy、response length、gradient norm 等训练指标。
●排查训练不稳定、Reward Hacking、长度偏置、模式坍缩、能力退化和训练推理不一致等问题。
●对不同模型、数据配比、训练策略和超参数进行对照与消融实验,形成可信、可复现的实验结论。
2. 模型与 Agent 效果评测
●建设面向内容理解、多模态分类和 Agent 任务的评估集。
●从 Precision、Recall、F1、格式合规率、任务完成率和稳定性等维度评价模型效果。
●分析模型 bad case,区分数据质量、Prompt、基础模型、训练策略、Reward 设计和工具调用等不同问题。
●设计固定评估集、回归集和对照实验,验证效果提升是否真实来自目标变量。
●关注训练指标与真实任务效果的一致性,不以 loss 下降或 reward 上升代替最终效果验证。
●对模型实验形成结构化结论,明确哪些方案有效、哪些无效,以及后续优化方向。
3. 算法流程平台化
●将数据构建、训练提交、模型推理、离线评测和结果分析流程沉淀为可复用的平台能力。
●建设自动化训练与评测流程,减少依赖个人环境和一次性脚本的人工操作。
●完善实验配置、任务状态、指标记录、模型版本和产物管理,保证实验可追踪、可比较、可复现。
●参与算法任务的异常处理、日志分析、监控告警和失败恢复。
●对自己负责的算法能力完成从实验验证到稳定交付的
工作要求:
1. 计算机、人工智能、软件工程、数学或相关专业在读。
2. 熟悉 Python,能够独立完成数据处理、模型训练、效果评测和问题排查。
3. 熟悉 PyTorch,能够阅读和修改常见的大模型训练代码。
4. 理解 Transformer、Attention、自回归生成、Tokenization 等基本原理。
5. 对大模型后训练有基本认识,至少实际接触过以下一个方向:
1)SFT 或指令微调;
2)GRPO、PPO、DPO 等强化学习或偏好优化方法;
3)知识蒸馏、模型压缩或合成数据构建;
4)多模态模型训练与评测。
6. 理解训练集、验证集和测试集的边界,能够设计基本的对照实验和消融实验。
7. 能够结合训练曲线、离线指标和 bad case 判断实验结果,而不只是确认训练任务是否成功。
8. 理解 Precision、Recall、F1 等常见指标,对多分类、多标签或层级分类评测有基本认识。
9. 具备基本的 Linux、Git 和 SQL 能力,能够独立运行任务、检查数据和排查日志。
10. 具备工程意识,愿意为算法流程补充测试、监控、异常处理和使用文档。
11. 对平台相关工作不排斥,愿意把有效的算法实验沉淀为其他同学可以稳定复用的能力。
投递简历
部门介绍
我们正在建设 Veda——一个面向内容理解算法的数据、训练、评测与 Agent 实验平台,帮助算法同学更高效地完成数据构建、模型训练、Prompt 调优、效果评测、实验管理和任务交付。
我们希望招聘一名同时具备算法基础和工程意识的实习生。你会参与 Qwen3.5 等大模型的后训练与评测,包括 SFT、GRPO、On-Policy 蒸馏等方向;同时也需要将验证有效的算法方案沉淀为稳定、可复现的平台流程。
这不是一个只负责提交训练任务的纯模型训练岗位,也不是一个常规前后端开发岗位。我们更看重你能否完成“数据分析—模型训练—效果评测—问题归因—流程沉淀”的完整闭环。
职位描述
工作职责:
1. 大模型训练与后训练
●基于 Qwen3.5 等开源大模型,开展 SFT、GRPO、DPO及知识蒸馏实验。
●参与 On-Policy 蒸馏流程建设,包括 Student Rollout、Teacher 反馈、训练样本构造、样本筛选和迭代评测。
●根据内容理解和 Agent 任务特点,设计训练数据、Prompt、Reward 与采样策略。
●分析 reward、loss、KL、entropy、response length、gradient norm 等训练指标。
●排查训练不稳定、Reward Hacking、长度偏置、模式坍缩、能力退化和训练推理不一致等问题。
●对不同模型、数据配比、训练策略和超参数进行对照与消融实验,形成可信、可复现的实验结论。
2. 模型与 Agent 效果评测
●建设面向内容理解、多模态分类和 Agent 任务的评估集。
●从 Precision、Recall、F1、格式合规率、任务完成率和稳定性等维度评价模型效果。
●分析模型 bad case,区分数据质量、Prompt、基础模型、训练策略、Reward 设计和工具调用等不同问题。
●设计固定评估集、回归集和对照实验,验证效果提升是否真实来自目标变量。
●关注训练指标与真实任务效果的一致性,不以 loss 下降或 reward 上升代替最终效果验证。
●对模型实验形成结构化结论,明确哪些方案有效、哪些无效,以及后续优化方向。
3. 算法流程平台化
●将数据构建、训练提交、模型推理、离线评测和结果分析流程沉淀为可复用的平台能力。
●建设自动化训练与评测流程,减少依赖个人环境和一次性脚本的人工操作。
●完善实验配置、任务状态、指标记录、模型版本和产物管理,保证实验可追踪、可比较、可复现。
●参与算法任务的异常处理、日志分析、监控告警和失败恢复。
●对自己负责的算法能力完成从实验验证到稳定交付的
工作要求:
1. 计算机、人工智能、软件工程、数学或相关专业在读。
2. 熟悉 Python,能够独立完成数据处理、模型训练、效果评测和问题排查。
3. 熟悉 PyTorch,能够阅读和修改常见的大模型训练代码。
4. 理解 Transformer、Attention、自回归生成、Tokenization 等基本原理。
5. 对大模型后训练有基本认识,至少实际接触过以下一个方向:
1)SFT 或指令微调;
2)GRPO、PPO、DPO 等强化学习或偏好优化方法;
3)知识蒸馏、模型压缩或合成数据构建;
4)多模态模型训练与评测。
6. 理解训练集、验证集和测试集的边界,能够设计基本的对照实验和消融实验。
7. 能够结合训练曲线、离线指标和 bad case 判断实验结果,而不只是确认训练任务是否成功。
8. 理解 Precision、Recall、F1 等常见指标,对多分类、多标签或层级分类评测有基本认识。
9. 具备基本的 Linux、Git 和 SQL 能力,能够独立运行任务、检查数据和排查日志。
10. 具备工程意识,愿意为算法流程补充测试、监控、异常处理和使用文档。
11. 对平台相关工作不排斥,愿意把有效的算法实验沉淀为其他同学可以稳定复用的能力。
投递简历
免责声明:
此信息由b站官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“b站官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!