小红书(xiaohongshu)招聘ACE实习生——大模型数据采集
招聘职位:
ACE实习生——大模型数据采集 搜索同类职位
岗位职责:
我们是公司最核心的"造脑"团队。在这里,我们掌管着 万卡级别的算力集群,致力于训练下一代千亿/万亿参数的基座模型(Base Model)。
但算力只是容器,数据才是灵魂。 作为支撑这艘万卡巨轮运转的"燃料"输送团队,我们坚信:在通往 AGI 的道路上,如果有谁能决定基座模型的知识广度,那就是掌握了互联网数据全貌的人。
我们致力于构建下一代互联网数据索引系统。我们不仅仅是信息的"淘金者",更是信息熵的"鉴赏家"。我们用极致的分布式工程手段,处理 PB 级别的全球网络数据,并通过严谨的实验闭环,为千亿参数模型提供最纯净、最高信噪比的训练语料。
【你将面临的挑战】
这不需要你从头设计 Transformer 架构,但需要你拥有驾驭海量数据的工程野心。这绝对不是一份"写写 Python 脚本抓网页"的无聊工作。我们要解决的是 "如何把整个互联网装进硬盘,并读懂它" 的终极难题:
1. 通用全网索引构建 (The "Google Index" Challenge)
• 挑战目标: 这是一个重新索引互联网的工程。不局限于特定站点的爬虫,我们需要设计通用的、覆盖全网的发现与采集策略。
• 核心工作: 面对指数级膨胀的 URL 队列,设计高效的调度算法与链路分析策略,从海量垃圾中精准定位高价值信息孤岛,构建高质量的互联网快照。
2. 基于模型的智能解析 (Intelligent Parsing Pipeline)
• 挑战目标: 传统的正则提取已经过时,我们要挑战数千亿网页的深度理解。
• 核心工作: 探索基于视觉/语言模型(VLM/LLM)的通用网页解析技术,像人类一样"看懂"复杂的网页布局、PDF 文档与学术论文,从中无损提取推理(Reasoning)与代码数据。你需要在 Spark 集群上优化这些算法,使其能在 PB 级数据上快速迭代。
3. 数据价值评估闭环 (Data Value Evaluation)
• 挑战目标: 建立数据质量的"度量衡"。
• 核心工作: 参与基座模型的训练实验,量化不同来源数据对模型最终效果的贡献。
• 我们将给予你足够的算力支持,去验证你的数据假设。
• 你需要用客观的 Loss 曲线和评测指标(Metrics)反向指导采集策略——告诉爬虫下一台该去抓什么,而不是盲目地堆砌数量。
【我们在寻找这样的你】
我们寻找的是系统型与算法型的复合人才。我们不在乎你是否发过顶会 Paper,我们在乎你的代码在处理 100TB 数据时会不会 OOM。
任职要求:
• 基础要求:
• 计算机相关专业本科在读,保证每周 4 天以上实习时间。
• 极客般的 Coding 能力: C++ 或 Python 功底深厚,对内存管理、并发控制有极致的追求。
• 大数据工程素养: 熟悉 Linux 生态,不仅会用,更懂得如何调试复杂的分布式任务。
• 加分项(满足任一条请直接联系):
• 竞赛大神: ACM-ICPC / CCPC 金银牌选手,或 Codeforces 高分选手。(我们需要你解决 O(n) 复杂度下的海量数据去重与图算法问题)
• Spark 内核玩家: 熟悉 Spark/Flink 原理,甚至阅读过源码、提交过核心模块 PR 者优先。(这里是我们的主战场)
• 工程洁癖: 痛恨低效代码,对性能极其敏感,致力于将数据处理效率提升 10 倍以上。
• (注:我们更看重你的算法潜力与工程直觉,无需具备特定的爬虫经验)
【你将获得】
1. 顶级视野: 你的工作处于大模型训练的最上游,你构建的数据集将直接决定 SOTA 模型的上限。
2. 核心位置: 在"数据为王"的时代,你掌握了定义"什么是好数据"的权力。
3. 工程历练: 接触工业界真实的 PB 级数据处理挑战,解决教科书里遇不到的分布式难题。
4. 硬核导师: 直接汇报给预训练核心成员,深入理解从 Data Collection 到 Model Training 的完整数据生命周期。
5. 极具竞争力的实习薪资。
我们是公司最核心的"造脑"团队。在这里,我们掌管着 万卡级别的算力集群,致力于训练下一代千亿/万亿参数的基座模型(Base Model)。
但算力只是容器,数据才是灵魂。 作为支撑这艘万卡巨轮运转的"燃料"输送团队,我们坚信:在通往 AGI 的道路上,如果有谁能决定基座模型的知识广度,那就是掌握了互联网数据全貌的人。
我们致力于构建下一代互联网数据索引系统。我们不仅仅是信息的"淘金者",更是信息熵的"鉴赏家"。我们用极致的分布式工程手段,处理 PB 级别的全球网络数据,并通过严谨的实验闭环,为千亿参数模型提供最纯净、最高信噪比的训练语料。
【你将面临的挑战】
这不需要你从头设计 Transformer 架构,但需要你拥有驾驭海量数据的工程野心。这绝对不是一份"写写 Python 脚本抓网页"的无聊工作。我们要解决的是 "如何把整个互联网装进硬盘,并读懂它" 的终极难题:
1. 通用全网索引构建 (The "Google Index" Challenge)
• 挑战目标: 这是一个重新索引互联网的工程。不局限于特定站点的爬虫,我们需要设计通用的、覆盖全网的发现与采集策略。
• 核心工作: 面对指数级膨胀的 URL 队列,设计高效的调度算法与链路分析策略,从海量垃圾中精准定位高价值信息孤岛,构建高质量的互联网快照。
2. 基于模型的智能解析 (Intelligent Parsing Pipeline)
• 挑战目标: 传统的正则提取已经过时,我们要挑战数千亿网页的深度理解。
• 核心工作: 探索基于视觉/语言模型(VLM/LLM)的通用网页解析技术,像人类一样"看懂"复杂的网页布局、PDF 文档与学术论文,从中无损提取推理(Reasoning)与代码数据。你需要在 Spark 集群上优化这些算法,使其能在 PB 级数据上快速迭代。
3. 数据价值评估闭环 (Data Value Evaluation)
• 挑战目标: 建立数据质量的"度量衡"。
• 核心工作: 参与基座模型的训练实验,量化不同来源数据对模型最终效果的贡献。
• 我们将给予你足够的算力支持,去验证你的数据假设。
• 你需要用客观的 Loss 曲线和评测指标(Metrics)反向指导采集策略——告诉爬虫下一台该去抓什么,而不是盲目地堆砌数量。
【我们在寻找这样的你】
我们寻找的是系统型与算法型的复合人才。我们不在乎你是否发过顶会 Paper,我们在乎你的代码在处理 100TB 数据时会不会 OOM。
任职要求:
• 基础要求:
• 计算机相关专业本科在读,保证每周 4 天以上实习时间。
• 极客般的 Coding 能力: C++ 或 Python 功底深厚,对内存管理、并发控制有极致的追求。
• 大数据工程素养: 熟悉 Linux 生态,不仅会用,更懂得如何调试复杂的分布式任务。
• 加分项(满足任一条请直接联系):
• 竞赛大神: ACM-ICPC / CCPC 金银牌选手,或 Codeforces 高分选手。(我们需要你解决 O(n) 复杂度下的海量数据去重与图算法问题)
• Spark 内核玩家: 熟悉 Spark/Flink 原理,甚至阅读过源码、提交过核心模块 PR 者优先。(这里是我们的主战场)
• 工程洁癖: 痛恨低效代码,对性能极其敏感,致力于将数据处理效率提升 10 倍以上。
• (注:我们更看重你的算法潜力与工程直觉,无需具备特定的爬虫经验)
【你将获得】
1. 顶级视野: 你的工作处于大模型训练的最上游,你构建的数据集将直接决定 SOTA 模型的上限。
2. 核心位置: 在"数据为王"的时代,你掌握了定义"什么是好数据"的权力。
3. 工程历练: 接触工业界真实的 PB 级数据处理挑战,解决教科书里遇不到的分布式难题。
4. 硬核导师: 直接汇报给预训练核心成员,深入理解从 Data Collection 到 Model Training 的完整数据生命周期。
5. 极具竞争力的实习薪资。
免责声明:
此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!