岗位描述(节选)
岗位职责:
跟踪并研究模型量化(Quantization)、剪枝(Pruning)、知识蒸馏(Knowledge Distillation)、低秩分解(Low-Rank Factorization)等领域的最新技术进展。
负责前沿压缩算法的复现、评估和创新,并将其应用于主流的大语言模型(如Llama系列、Qwen系列等)。
负责大模型的训练后量化(PTQ)和量化感知训练(QAT)流程,开发高效的校准(Calibration)策略,在保证模型精度的前提下,实现INT8、INT4、FP8等低比特量化。
针对不同硬件平台(如高通)的特性,进行深度定制的量化方案设计与优化。
建立并完善模型压缩后的性能评测体系,从模型精度(如Perplexity、MMLU benchmarks)、推理速度(Latency/Throughput)、内存占用(Memory Footprint)和功耗等多个维度进行综合评……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。