查看更多分享

小红书(xiaohongshu)招聘【Ace顶尖实习生】diffusion/Autoregressive范式下的LLM模型极致性能优化和SLO低时延探索

招聘职位:

【Ace顶尖实习生】diffusion/Autoregressive范式下的LLM模型极致性能优化和SLO低时延探索 搜索同类职位
发布日期:
2026-05-26
工作地点:
职位类型:
兼职
职位类别:
大模型
来源:
小红书官网
岗位职责:
本课题聚焦 Diffusion/Autoregressive 范式下 LLM 的极致性能优化与 SLO 低时延推理,面向大模型在线服务中 TTFT、TPOT、P99 时延与吞吐成本 难以兼顾的问题,结合最新 AI Infra SOTA 展开系统研究。自回归模型虽具备成熟生态,但受限于逐 token 串行生成;Diffusion Language Model 则具备并行去噪与迭代 refinement 潜力,有望突破解码瓶颈。

课题拟结合 vLLM/PagedAttention、FlashAttention、TensorRT-LLM、Speculative Decoding、Medusa、EAGLE、SGLang 等代表性工作,从 KV Cache 管理、连续批处理、动态调度、算子融合、并行解码、低比特量化与软硬件协同优化 等方向,构建统一的跨范式推理优化框架。

研究目标是在保证生成质量前提下,实现满足不同 SLO 的低时延、高吞吐与低成本推理,为大模型在智能问答、代码生成、Agent 与多模态服务中的规模化部署提供理论与工程支撑。
任职要求:
1、计算机及相关专业本科以上学历,具备高性能系统或 AI Infra 研发经验;
2、精通 C/C++,具备扎实的系统底层能力(内存、并发、网络),代码风格优雅,热衷技术分享;
3、深入理解至少一种主流训练/推理框架(XDL、TFRA、DeepRec、TorchRec、DeepSpeed、veRL、Megatron 等),对其执行模型与性能瓶颈有源码级洞察;
4、熟悉 TensorFlow Serving、TensorRT、OpenXLA、ONNX Runtime 等推理后端,具备大模型量化、编译优化与线上 A/B 调优实战经验;
5、了解推荐/广告典型模型(DeepFM、DIEN、SIM、OneRec、RankMixer 等),熟悉样本生成→训练→上线→推理→特征服务的完整链路;
6、有 GPU/TPU 集群建设与性能调优经验,熟练使用 CUDA、cuDNN、TensorRT 等工具,能够定位并解决分布式环境中的复杂性能瓶颈。
【加分项】
• 主导或核心参与过万卡级以上 AI 训练/推理平台的架构设计、实现和升级;
• 在 TensorFlow、PyTorch、DeepSpeed 等社区有持续代码贡献;或有高质量技术博客、顶会论文(OSDI、SOSP、MLSys、KDD、RecSys 等)。
免责声明:

此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!