小红书(xiaohongshu)招聘【REDstar】大模型 Infra 工程师
招聘职位:
【REDstar】大模型 Infra 工程师 搜索同类职位
岗位职责:
团队介绍
我们是小红书大模型基建部(RAI Studio),负责公司级 AI 大模型全链路基础设施建设。我们围绕「算力 - 框架 - 平台」三层体系,提供从大模型训练、压缩、部署、在离线服务到Agent构建发布的标准化能力,以解决大模型生产及应用过程中的效率、成本、稳定性和规模化交付问题。我们构建了 Relax RL 开源训练框架、RedSlim 模型压缩工具、rLLM 推理部署框架、以及大模型训练、部署、MaaS、Agent等平台设施,持续支撑社区、大商业、国际化、审核、企业智能等小红书核心业务的大模型落地。在这里,你会面对千卡级后训练、高并发推理、EPD 分离与 KV Cache 复用、低比特模型量化、国产异构芯片性能优化、万卡级 GPU 调度等真实业务的大规模 AI Infra 挑战。在这里你可以选择在训练、推理或模型压缩方向深耕,也可以参与跨方向系统设计,成长为真正理解大模型全链路的 AI Infra 工程师。团队持续参与开源与行业技术交流,期待有志于构建生产级 Infra 能力并持续提升个人行业影响力的优秀同学加入。
工作职责:
1、训练与推理框架研发: 参与 Relax RL 后训练框架和 rLLM 推理框架的核心研发,支撑 LLM、MLLM、Agent、DiT 等模型的高效训练与高性能在线推理;可根据个人专长重点负责训练、推理或模型压缩方向。
2、RL Pipeline 与分布式训练优化: 支持 SFT、DPO、PPO、GRPO、RLVR 等主流后训练范式,优化 Rollout、Reward Model、Actor、Reference Model 等模块间的资源调度与动态协同,并结合 TP / PP / DP / ZeRO / Sequence Parallel 等并行策略提升端到端训练吞吐。
3、分布式推理与服务架构建设: 建设 KV Router、PD 分离 / EPD 分离、KV Cache 管理、Prefix Cache 复用、Continuous Batching、动态请求调度等核心能力,持续提升 TTFT、TPOT、吞吐、并发能力和 GPU 利用率。
4、模型压缩与加速算法探索: 探索并落地低比特量化、蒸馏、剪枝、投机解码、KV Cache 压缩、CoT 压缩等技术,建设从效果评估到部署的完整闭环,在精度、延迟、吞吐、显存、成本和业务效果之间取得合理平衡。
5、大规模系统稳定性建设: 攻克千卡训练和高并发推理中的显存管理、跨节点通信、弹性容错、任务调度、请求迁移、故障检测、自愈恢复、灰度发布等挑战,提升训练成功率、推理 SLO 和集群资源利用率。
6、异构芯片与多模型适配: 负责训练及推理框架在 Nvidia GPU、国产 NPU / PPU 等硬件上的适配与深度优化,完成模型迁移、算子支持、Profiling、Kernel 调优、并行策略及服务架构优化,推动国产算力规模化使用。
7、大模型生产工具链建设: 打通训练、压缩、推理框架与训练部署及MaaS服务平台,建设可视化、自动调优、评估、故障诊断和部署等生产级能力,降低算法与业务团队的使用门槛。
8、业务协同与技术探索: 与算法和业务团队深度协作,支撑重点业务的算法探索与工程落地,通过算法与系统联合优化持续提升性能、稳定性和成本效率。
任职要求:
任职资格:
1、具备扎实的代码能力、数据结构和基础算法功底,熟悉 Python / C++ / Rust 中至少一门语言,具备良好的工程实现能力和代码质量意识。
2、在大模型训练、推理或模型压缩至少一个方向具备深入实践,能够阅读和修改框架源码,并有性能优化或生产级工程落地经验。
3、熟悉至少一种主流训练、后训练或推理框架,如 PyTorch、Megatron、DeepSpeed、veRL、OpenRLHF、TRL、vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo、AIBrix 等,并具备使用或二次开发经验。
4、理解分布式训练或推理的核心技术,包括并行策略、显存管理、跨机通信、KV Cache、请求调度、服务稳定性等;无需同时精通全部方向,但能够基于系统原理分析和解决复杂问题。
5、具备性能分析和问题定位能力,能够借助 Nsight Systems / Compute、PyTorch Profiler、日志、监控和实验分析等手段定位计算、通信、显存或系统瓶颈,并推动问题闭环。
6、能围绕吞吐、延迟、并发、稳定性、资源利用率、精度、成本和业务效果等指标进行系统分析,在技术效果与业务收益之间做出合理权衡。
7、具备良好的学习能力、沟通协作能力、自驱力和问题闭环意识,能够与算法、平台及业务团队协同推进技术落地。
加分项:
1、在大模型训练、推理、模型压缩、分布式系统或 MLSys 方向有高水平论文发表或优秀开源项目经历。
2、有千卡级大模型训练、后训练或大规模线上推理实战经验,解决过跨节点通信、显存优化、容错训练、高并发、故障迁移、弹性扩缩容或 SLO 保障等生产问题。
3、参与过 Megatron、DeepSpeed、veRL、OpenRLHF、vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo、AIBrix 等开源项目的核心模块开发或贡献。
4、有 CUDA Kernel、Fused Operator、Attention / GEMM、FlashAttention、PagedAttention 或通信计算重叠等底层优化经验。
5、有量化、蒸馏、剪枝、SmoothQuant、AWQ、GPTQ、KV Cache 压缩或投机解码等技术的工程落地经验。
6、有国产异构芯片(昇腾 Ascend、平头哥 PPU 等)训练或推理适配、Kernel 开发及规模化落地经验,熟悉 CANN / ROCm 等基础软件栈。
7、深入理解 GPU / NPU 硬件架构及性能瓶颈,能够结合 Tensor Core、内存层级、计算单元和通信拓扑进行差异化优化方案设计。
团队介绍
我们是小红书大模型基建部(RAI Studio),负责公司级 AI 大模型全链路基础设施建设。我们围绕「算力 - 框架 - 平台」三层体系,提供从大模型训练、压缩、部署、在离线服务到Agent构建发布的标准化能力,以解决大模型生产及应用过程中的效率、成本、稳定性和规模化交付问题。我们构建了 Relax RL 开源训练框架、RedSlim 模型压缩工具、rLLM 推理部署框架、以及大模型训练、部署、MaaS、Agent等平台设施,持续支撑社区、大商业、国际化、审核、企业智能等小红书核心业务的大模型落地。在这里,你会面对千卡级后训练、高并发推理、EPD 分离与 KV Cache 复用、低比特模型量化、国产异构芯片性能优化、万卡级 GPU 调度等真实业务的大规模 AI Infra 挑战。在这里你可以选择在训练、推理或模型压缩方向深耕,也可以参与跨方向系统设计,成长为真正理解大模型全链路的 AI Infra 工程师。团队持续参与开源与行业技术交流,期待有志于构建生产级 Infra 能力并持续提升个人行业影响力的优秀同学加入。
工作职责:
1、训练与推理框架研发: 参与 Relax RL 后训练框架和 rLLM 推理框架的核心研发,支撑 LLM、MLLM、Agent、DiT 等模型的高效训练与高性能在线推理;可根据个人专长重点负责训练、推理或模型压缩方向。
2、RL Pipeline 与分布式训练优化: 支持 SFT、DPO、PPO、GRPO、RLVR 等主流后训练范式,优化 Rollout、Reward Model、Actor、Reference Model 等模块间的资源调度与动态协同,并结合 TP / PP / DP / ZeRO / Sequence Parallel 等并行策略提升端到端训练吞吐。
3、分布式推理与服务架构建设: 建设 KV Router、PD 分离 / EPD 分离、KV Cache 管理、Prefix Cache 复用、Continuous Batching、动态请求调度等核心能力,持续提升 TTFT、TPOT、吞吐、并发能力和 GPU 利用率。
4、模型压缩与加速算法探索: 探索并落地低比特量化、蒸馏、剪枝、投机解码、KV Cache 压缩、CoT 压缩等技术,建设从效果评估到部署的完整闭环,在精度、延迟、吞吐、显存、成本和业务效果之间取得合理平衡。
5、大规模系统稳定性建设: 攻克千卡训练和高并发推理中的显存管理、跨节点通信、弹性容错、任务调度、请求迁移、故障检测、自愈恢复、灰度发布等挑战,提升训练成功率、推理 SLO 和集群资源利用率。
6、异构芯片与多模型适配: 负责训练及推理框架在 Nvidia GPU、国产 NPU / PPU 等硬件上的适配与深度优化,完成模型迁移、算子支持、Profiling、Kernel 调优、并行策略及服务架构优化,推动国产算力规模化使用。
7、大模型生产工具链建设: 打通训练、压缩、推理框架与训练部署及MaaS服务平台,建设可视化、自动调优、评估、故障诊断和部署等生产级能力,降低算法与业务团队的使用门槛。
8、业务协同与技术探索: 与算法和业务团队深度协作,支撑重点业务的算法探索与工程落地,通过算法与系统联合优化持续提升性能、稳定性和成本效率。
任职要求:
任职资格:
1、具备扎实的代码能力、数据结构和基础算法功底,熟悉 Python / C++ / Rust 中至少一门语言,具备良好的工程实现能力和代码质量意识。
2、在大模型训练、推理或模型压缩至少一个方向具备深入实践,能够阅读和修改框架源码,并有性能优化或生产级工程落地经验。
3、熟悉至少一种主流训练、后训练或推理框架,如 PyTorch、Megatron、DeepSpeed、veRL、OpenRLHF、TRL、vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo、AIBrix 等,并具备使用或二次开发经验。
4、理解分布式训练或推理的核心技术,包括并行策略、显存管理、跨机通信、KV Cache、请求调度、服务稳定性等;无需同时精通全部方向,但能够基于系统原理分析和解决复杂问题。
5、具备性能分析和问题定位能力,能够借助 Nsight Systems / Compute、PyTorch Profiler、日志、监控和实验分析等手段定位计算、通信、显存或系统瓶颈,并推动问题闭环。
6、能围绕吞吐、延迟、并发、稳定性、资源利用率、精度、成本和业务效果等指标进行系统分析,在技术效果与业务收益之间做出合理权衡。
7、具备良好的学习能力、沟通协作能力、自驱力和问题闭环意识,能够与算法、平台及业务团队协同推进技术落地。
加分项:
1、在大模型训练、推理、模型压缩、分布式系统或 MLSys 方向有高水平论文发表或优秀开源项目经历。
2、有千卡级大模型训练、后训练或大规模线上推理实战经验,解决过跨节点通信、显存优化、容错训练、高并发、故障迁移、弹性扩缩容或 SLO 保障等生产问题。
3、参与过 Megatron、DeepSpeed、veRL、OpenRLHF、vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo、AIBrix 等开源项目的核心模块开发或贡献。
4、有 CUDA Kernel、Fused Operator、Attention / GEMM、FlashAttention、PagedAttention 或通信计算重叠等底层优化经验。
5、有量化、蒸馏、剪枝、SmoothQuant、AWQ、GPTQ、KV Cache 压缩或投机解码等技术的工程落地经验。
6、有国产异构芯片(昇腾 Ascend、平头哥 PPU 等)训练或推理适配、Kernel 开发及规模化落地经验,熟悉 CANN / ROCm 等基础软件栈。
7、深入理解 GPU / NPU 硬件架构及性能瓶颈,能够结合 Tensor Core、内存层级、计算单元和通信拓扑进行差异化优化方案设计。
免责声明:
此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!