岗位描述(节选)
岗位职责
负责 LLM、多模态模型的工程落地,完成模型转换、部署、推理链路开发与性能调优;
深入理解 Transformer 等主流模型结构,剖析 Prefill/Decode 推理流程,针对 KV Cache、注意力机制、采样策略开展优化;
使用 PyTorch、ONNX Runtime、llama.cpp 等框架完成模型封装、量化、算子调试,解决内存占用、推理时延、吞吐瓶颈;
搭建模型评测基准,对比不同硬件、推理引擎下模型表现,输出优化方案;
协同算法、客户端、内核团队推进 AI 功能集成,支撑端侧 / 本地 AI 推理方案落地;
跟踪前沿模型架构、推理加速技术,沉淀工程化工具链。
岗位要求
本科及以上,计算机、人工智能、电子信息相关专业;
深入理解 Transformer 基础架构,熟悉大模型前向推理完整流程,掌握 Prefill、Decode 阶段运行原理,了解 KV Cache、……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。