岗位描述(节选)
1. 负责推动LLaDA系列扩散模型在实时音视频多模态场景的技术探索和突破;
2. 负责实时音视频大模型技术带来的新特性(如交错交互等)从实验性走向实用性全流程所需的训练、语料优化、评测反馈等环节相关工作;
【任职要求】
1. 有丰富的音视频大模型相关一手研发经验,包括不限于模型结构、tokenizer、预训练、后训练、语料采集优化、评测体系等;
2. 动手能力强;
3. 参与过有影响力的音视频开源模型研发者优先;
4. 在顶会如NeurIPS、ICML、ICLR、ACL、CVPR、ICCV等上面有代表性高质量工作发表;
5. 较强的表达和沟通能力,工作认真、严谨、敬业。有强烈的责任心和自驱力;
6. 有扩散模型相关经验者优先。