哔哩哔哩(bilibili|b站)招聘语音大模型算法实习生
招聘职位:
语音大模型算法实习生 搜索同类职位
岗位介绍:
职位描述
工作职责:
1.负责语音大模型(Speech LLM)及语音生成技术的研发与迭代,聚焦高保真语音合成(TTS)、零样本音色克隆、情感/风格可控语音生成等方向,持续挑战技术边界。
2.紧密跟踪语音合成领域最新进展(如基于 LLM 的端到端语音生成、扩散/流匹配语音模型等),推动研究成果向业务转化,并在顶级会议/期刊发表高水平论文。
3.将语音生成技术工程化落地于 B站视频出海、内容创作、虚拟主播等核心场景,解决音色相似度、情感表现力、多语言支持等实际业务痛点,打造行业领先的语音创作工具。
工作要求:
1.计算机科学、人工智能、信号处理等相关专业硕士及以上学历,具备扎实的机器学习、深度学习理论基础。
2.深入理解多模态与生成式模型原理,熟悉大模型底层技术(如 Transformer、Diffusion、Flow Matching、自回归建模等);在语音生成领域有前沿技术研究及论文发表经验,敢于挑战技术边界。
3.对主流语音合成架构有深入理解,熟悉 IndexTTS、CosyVoice等开源语音合成模型,具备模型训练、微调、推理优化及工程化部署的实战经验;
4.有 ACM/ICPC、Kaggle 等编程竞赛获奖经历,或 GitHub 开源项目具有较大影响力者优先。
5. InterSpeech、ICASSP、NeurIPS、ICML、ACL 等语音或 AI 顶会/顶刊发表过相关论文者优先。
投递简历
职位描述
工作职责:
1.负责语音大模型(Speech LLM)及语音生成技术的研发与迭代,聚焦高保真语音合成(TTS)、零样本音色克隆、情感/风格可控语音生成等方向,持续挑战技术边界。
2.紧密跟踪语音合成领域最新进展(如基于 LLM 的端到端语音生成、扩散/流匹配语音模型等),推动研究成果向业务转化,并在顶级会议/期刊发表高水平论文。
3.将语音生成技术工程化落地于 B站视频出海、内容创作、虚拟主播等核心场景,解决音色相似度、情感表现力、多语言支持等实际业务痛点,打造行业领先的语音创作工具。
工作要求:
1.计算机科学、人工智能、信号处理等相关专业硕士及以上学历,具备扎实的机器学习、深度学习理论基础。
2.深入理解多模态与生成式模型原理,熟悉大模型底层技术(如 Transformer、Diffusion、Flow Matching、自回归建模等);在语音生成领域有前沿技术研究及论文发表经验,敢于挑战技术边界。
3.对主流语音合成架构有深入理解,熟悉 IndexTTS、CosyVoice等开源语音合成模型,具备模型训练、微调、推理优化及工程化部署的实战经验;
4.有 ACM/ICPC、Kaggle 等编程竞赛获奖经历,或 GitHub 开源项目具有较大影响力者优先。
5. InterSpeech、ICASSP、NeurIPS、ICML、ACL 等语音或 AI 顶会/顶刊发表过相关论文者优先。
投递简历
免责声明:
此信息由b站官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“b站官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!