小红书(xiaohongshu)招聘Dots-【Ace顶尖实习生】Long Horizon Agentic Task 能力提升研究
招聘职位:
Dots-【Ace顶尖实习生】Long Horizon Agentic Task 能力提升研究 搜索同类职位
岗位职责:
本课题聚焦于提升大模型在上百轮交互的超长程 Agent 任务中的自主执行能力,目标场景涵盖 CLI/GUI Computer Use、Software Engineering、科研与专业任务等,并致力于让模型从被动响应指令转变为能够主动推进任务的 Proactive Agent。当前面临的核心挑战贯穿训练与推理两侧:在训练侧,缺乏能够覆盖真实世界复杂性与多样性的 RL 训练环境,现有环境难以模拟长程任务中工具调用、状态变迁与多步依赖的真实分布;稀疏的结果奖励无法为上百步的中间过程提供有效训练信号,如何设计面向长程任务的 Reward Signal 与 Credit Assignment 机制是关键瓶颈;在推理侧,模型在长时执行中面临目标漂移、错误累积与上下文认知负载持续增长等问题,缺乏有效的自我监控与恢复能力。研究将围绕复杂真实多样的 RL 训练环境合成、特定场景下长程稀疏奖励下关键决策步骤的信用归因,以及主动规划与长程目标对齐等核心问题展开。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、优秀的代码能力、数据结构和基础算法功底,熟练掌握至少一门编程语言,包括但不限于Python等;
3、有LLM/MLLM等多模态理解技术背景,或大规模模型训练实际项目经验者优先;
4、在TPAMI/CVPR/NeurIPS/ICCV/ICML/ICLR等顶级期刊会议上发表相关论文者优先;
5、良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,推进技术进步。
本课题聚焦于提升大模型在上百轮交互的超长程 Agent 任务中的自主执行能力,目标场景涵盖 CLI/GUI Computer Use、Software Engineering、科研与专业任务等,并致力于让模型从被动响应指令转变为能够主动推进任务的 Proactive Agent。当前面临的核心挑战贯穿训练与推理两侧:在训练侧,缺乏能够覆盖真实世界复杂性与多样性的 RL 训练环境,现有环境难以模拟长程任务中工具调用、状态变迁与多步依赖的真实分布;稀疏的结果奖励无法为上百步的中间过程提供有效训练信号,如何设计面向长程任务的 Reward Signal 与 Credit Assignment 机制是关键瓶颈;在推理侧,模型在长时执行中面临目标漂移、错误累积与上下文认知负载持续增长等问题,缺乏有效的自我监控与恢复能力。研究将围绕复杂真实多样的 RL 训练环境合成、特定场景下长程稀疏奖励下关键决策步骤的信用归因,以及主动规划与长程目标对齐等核心问题展开。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、优秀的代码能力、数据结构和基础算法功底,熟练掌握至少一门编程语言,包括但不限于Python等;
3、有LLM/MLLM等多模态理解技术背景,或大规模模型训练实际项目经验者优先;
4、在TPAMI/CVPR/NeurIPS/ICCV/ICML/ICLR等顶级期刊会议上发表相关论文者优先;
5、良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,推进技术进步。
免责声明:
此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!