查看更多分享

深圳虾皮信息科技有限公司招聘(27届 ASP)LLM-大模型后训练算法工程师 -Gernal/Reasoning/Coding 方向

招聘职位:

(27届 ASP)LLM-大模型后训练算法工程师 -Gernal/Reasoning/Coding 方向 搜索同类职位
发布日期:
2026-09-02
工作地点:
职位类型:
全职
学历要求:
硕士及以上
招聘人数:
3
薪资待遇:
15k-99.9k

关于团队Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 的演进。当前我们正聚焦下一代基座大模型(Compass V4,MoE 架构)的 Post-training,目标是在数学、代码、逻辑推理、指令遵循、长文本、多语言等核心能力上全面对标并超越业界最新开源模型。岗位描述我们正在系统性地推进大模型的能力对齐(Alignment),覆盖 Mid-training → SFT → RL 的全链路优化:用 mid-training 补齐基座能力上限, SFT 冷启,再通过全方位的强化学习算法(PPO、GRPO、DPO等)把模型潜力锐化为稳定可靠的输出。你将参与 Reasoning(数学 / 逻辑 / 各类学科)、Coding(代码生成 / SWE Agent)、General(指令遵循 / 多轮 / 长文本 / 多语言)中一个或多个方向的算法与数据建设,推动自训模型在关键 benchmark 上追平至超越目标模型。岗位职责参与 Mid-training / SFT / RL 全链路 post-training 方法的研究与落地,掌握并灵活运用全方位的强化学习算法,包括 PPO、GRPO、DPO 等,在真实训练环境中做能力对齐。参与各阶段的联合优化:mid-training 的数据配比与基座能力抬升、SFT 的教师选型与配方、RL 的奖励设计与策略优化,理解并权衡三个阶段在能力天花板(pass@k)与稳定输出(pass@1)上的分工。研究在合并多个能力域(数学 / 代码 / 逻辑 / 指令遵循 / 长文本等)时如何减少相互掉点,探索达到帕累托最优的合并算法。探究 post-training 的 scaling 规律与能力边界提升,例如如何做更久 / 更稳定的 RL(延长有效训练步数、缓解熵坍缩与奖励饱和)、细粒度 / 过程级反馈(fine-grained / process reward),以及类 AlphaZero 的自我探索(self-play / self-exploration),持续抬升基础模型的能力上限。设计并实现奖励信号与自动评测器(如代码判题、数学答案校验、指令约束校验、Agent 任务成功率),保证 reward 正确性锚定在模型之外、不产生自我强化误差。参与高质量训练数据构建:数据合成与蒸馏、去重去污染、质量打分、失败样本挖掘、偏好数据构建,以及按「有效监督 token / 考点分布 / 失败机制」的定向配比策略。打通并优化 mid-training / SFT / RL 的训推链路(如 verl / SGLang / vLLM / Megatron),定位并修复训推不一致、熵坍缩、显存与吞吐瓶颈等工程问题。跟踪 LLM post-training、RL for LLM、reasoning models、Agentic RL、agent evaluation 等方向的前沿论文与开源框架,并快速复现或落地。岗位要求计算机、人工智能、机器学习、数学等相关专业硕士或博士。熟悉机器学习与深度学习基础,了解大模型 post-training 的基本流程。对SFT、强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力。对 LLM 的推理能力、代码智能体、指令遵循、多轮对话、RAG、长文本或多语言中的一个或多个方向有兴趣或实践经验。能独立阅读英文论文,具备较强的问题拆解、实验设计和结果分析能力。加分项有 LLM post-training、SFT、RLHF、RLAIF、DPO、PPO、GRPO、RLVR 等实践经验。熟悉 verl、TRL、Ray、vLLM、SGLang、Megatron、DeepSpeed 等训练 / 推理框架。有数据合成与蒸馏、reward design、自动判题、trajectory analysis、sandbox execution、Docker / 容器环境经验。在 NeurIPS、ICLR、ICML、ACL、EMNLP、AAAI 等会议发表过相关论文,或有高质量开源项目。有算法竞赛、Kaggle、ACM/ICPC、系统工程或复杂工程项目经验。你将获得深入参与前沿 LLM Mid-training / SFT / RL 全链路 post-training 方向的研究与落地,直接对标业界最新开源模型。接触真实的大规模训练与推理环境、可验证奖励体系、诊断驱动的数据引擎和完整的实验流程。与算法、工程、产品团队协作,将研究结果转化为下一代基座模型的核心能力。产出论文、技术报告、开源项目或核心业务成果。

公司介绍

公司名称
深圳虾皮信息科技有限公司
所属行业
计算机软件
公司性质
外商独资/外企代表处
公司规模
500-999人
公司地址
广东省深圳市
免责声明:

此信息由国家大学生就业服务平台 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“国家大学生就业服务平台”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 深圳虾皮信息科技有限公司招聘常见问答

深圳虾皮信息科技有限公司招聘学历要求:
硕士及以上
深圳虾皮信息科技有限公司招聘工作地点:
广东省深圳市
深圳虾皮信息科技有限公司招聘人数:
3
深圳虾皮信息科技有限公司工资情况:
15k-99.9k
深圳虾皮信息科技有限公司招聘专业要求:
【硕士】信息与通信工程,【硕士】计算机科学与技术,【硕士】通信工程,【硕士】计算机技术,【硕士】数学