深圳虾皮信息科技有限公司招聘(ASP Intern)LLM-大模型对齐算法工程师
招聘职位:
(ASP Intern)LLM-大模型对齐算法工程师 搜索同类职位关于团队Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 的演进。当前我们正聚焦下一代基座大模型(Compass V4,MoE 架构)的 Post-training,目标是在数学、代码、逻辑推理、指令遵循、长文本、多语言等核心能力上全面对标并超越业界最新开源模型。岗位描述我们正在系统性地推进大模型的能力对齐(Alignment),覆盖 Mid-training → SFT → RL 的全链路优化:用 mid-training 补齐基座能力上限,用 SFT 冷启,用全方位的强化学习算法(PPO、GRPO、DPO等)把模型潜力锐化为稳定可靠的输出。你将参与 Reasoning(数学 / 逻辑 / STEM)、Coding(代码生成 / SWE Agent)、General(指令遵循 / 多轮 / 长文本 / 多语言)中一个或多个方向的算法与数据建设,推动自训模型在关键 benchmark 上追平至超越目标模型。重点研究方向模型训练机理与可解释性。Motivation:Scaling 收益正显现边际递减效应,低垂的果实已被快速收获,新的突破必须从底层原理出发——深入理解 mid-training / SFT / RL 过程中模型能力如何形成、迁移与遗忘,为训练决策提供机理级依据而非经验试错。强化学习与模型能力边界提升。Motivation:前瞻性的强化学习技术储备。实验计划:细粒度反馈(fine-grained / process-level feedback)、类 AlphaZero 的自我探索(self-play / self-exploration)提升基础模型的能力上限。多领域能力合并(Multi-domain Merge)。研究在合并多个能力域(数学 / 代码 / 逻辑 / 指令遵循 / 长文本等)时如何减少相互掉点,探索达到帕累托最优的合并算法。数据构建。面向数学、代码、逻辑、STEM 等推理能力的高质量数据构建,包括:长思维链(long CoT)轨迹的合成与蒸馏、教师选型与胜者筛选、可验证答案 / 用例的自动生成、按考点分布与失败机制的定向配比、难度分层与去污染,以及 generate → verify → filter → train → regenerate 的自迭代闭环。岗位职责参与 Mid-training / SFT / RL 全链路 post-training 方法的研究与落地,掌握并灵活运用全方位的强化学习算法,包括 PPO、GRPO、DPO 等,在真实训练环境中做能力对齐。参与各阶段的联合优化:mid-training 的数据配比与基座能力抬升、SFT 的教师选型与配方、RL 的奖励设计与策略优化,理解并权衡三个阶段在能力天花板(pass@k)与稳定输出(pass@1)上的分工。探究 post-training 的 scaling 规律与能力边界提升,例如如何做更久 / 更稳定的 RL(延长有效训练步数、缓解熵坍缩与奖励饱和)、细粒度 / 过程级反馈(fine-grained / process reward),以及类 AlphaZero 的自我探索(self-play / self-exploration),持续抬升基础模型的能力上限。设计并实现奖励信号与自动评测器(如代码判题、数学答案校验、指令约束校验、Agent 任务成功率),保证 reward 正确性锚定在模型之外、不产生自我强化误差。参与高质量训练数据构建:数据合成与蒸馏、去重去污染、质量打分、失败样本挖掘、偏好数据构建,以及按「有效监督 token / 考点分布 / 失败机制」的定向配比策略。打通并优化 mid-training / SFT / RL 的训推链路(如 verl / SGLang / vLLM / Megatron),定位并修复训推不一致、熵坍缩、显存与吞吐瓶颈等工程问题。跟踪 LLM post-training、RL for LLM、reasoning models、Agentic RL、agent evaluation 等方向的前沿论文与开源框架,并快速复现或落地。岗位要求计算机、人工智能、机器学习、数学等相关专业硕士或博士在读。熟悉机器学习与深度学习基础,了解大模型训练、微调或 post-training 的基本流程。对强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力。对 LLM 的推理能力、代码智能体、指令遵循、多轮对话、RAG、长文本或多语言中的一个或多个方向有兴趣或实践经验。能独立阅读英文论文,具备较强的问题拆解、实验设计和结果分析能力。每周可实习 4 天及以上,实习期 3 个月以上优先。加分项有 LLM post-training、SFT、RLHF、RLAIF、DPO、PPO、GRPO、RLVR 等实践经验。熟悉 verl、TRL、Ray、vLLM、SGLang、Megatron、DeepSpeed 等训练 / 推理框架。有数据合成与蒸馏、reward design、自动判题、trajectory analysis、sandbox execution、Docker / 容器环境经验。在 NeurIPS、ICLR、ICML、ACL、EMNLP、AAAI 等会议发表过相关论文,或有高质量开源项目。有算法竞赛、Kaggle、ACM/ICPC、系统工程或复杂工程项目经验。你将获得深入参与前沿 LLM Mid-training / SFT / RL 全链路 post-training 方向的研究与落地,直接对标业界最新开源模型。接触真实的大规模训练与推理环境、可验证奖励体系、诊断驱动的数据引擎和完整的实验流程。与算法、工程、产品团队协作,将研究结果转化为下一代基座模型的核心能力。有机会产出论文、技术报告、开源项目或核心业务成果。
公司介绍
- 公司名称
- 深圳虾皮信息科技有限公司
- 所属行业
- 计算机软件
- 公司性质
- 外商独资/外企代表处
- 公司规模
- 1000-4999人
- 公司地址
- 广东省深圳市
此信息由国家大学生就业服务平台 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“国家大学生就业服务平台”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!