岗位描述(节选)
1. 研发并落地低比特量化技术,包括FP8、FP4、INT8、INT4、KV Cache量化、MoE量化、混合精度量化、QAT/PTQ等方向,解决大规模模型低比特部署下的精度、稳定性和性能问题;
2. 参与投机解码、稀疏化、剪枝、蒸馏、Token剪枝、Prompt压缩、CoT压缩、KV Cache压缩等推理加速技术探索与落地,持续提升Decode效率并降低显存与计算开销;
3. 建立和完善模型压缩效果评估与回归机制,协同模型、算子、框架和业务团队完成算法方案到线上部署的闭环,对模型效果、推理成本和吞吐收益负责。
【任职要求】
1. 在量化、稀疏、蒸馏、投机解码、KV Cache压缩、Token压缩等至少一个方向有深入研究或大规模工程落地经验;
2. 具备扎实的Python/PyTorch开发能力和严谨的实验分析能力,能够设计评测集、消融实验和回归机制,平衡模型效果、推理延迟、吞吐和成本收……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。