岗位描述(节选)
1. 负责AI模型的网络级压缩与优化,涵盖量化(QAT/PTQ)、投机采样(Speculative Decoding)、Token压缩、知识蒸馏等技术;
2. 针对大小模型设计并实现差异化量化方案,如小模型的KL散度、Percentile、AdaRound等,大模型的SmoothQuant、AWQ等;
3. 参与模型网络结构的优化与重构,将现有网络的算子、Block替换为高效、硬件友好的架构;
4. 参与模型训练与微调,能够复现、分析并改进前沿模型结构;
5. 与硬件团队紧密合作,提供模型优化视角的硬件设计建议,推动下一代芯片对新型算子与网络结构的支持。
1. 计算机科学、人工智能、数学等相关专业硕士及以上学历;
2. 深入理解模型量化技术(PTQ/QAT),至少熟悉一种小模型或大模型量化方案,并有实际部署经验;
3. 熟悉大模型推理优化技术,如投机采样、Token剪枝、稀疏化等……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。