岗位描述(节选)
该岗位负责算法模型从交付到生产运行的工程化闭环。与算法团队协作,将大语言模型,Embedding 模型,Rerank 模型,计算机视觉模型,语音模型以及传统机器学习模型,部署为标准化的 CPU 或 GPU 在线推理服务。核心目标不是创造新算法,而是让模型服务具备可靠性,性能,扩展性,可观测性和成本效率。
我们不要求你训练出更聪明的模型,我们需要你让模型稳定地服务真实用户。
岗位职责:
1. 模型服务化与标准接入:
- 建立模型交付规范,覆盖模型文件,运行环境,配置参数,前后处理,接口协议,健康检查,版本信息与验收标准;
- 根据模型类型选择合适的推理运行时,基于 vLLM,NVIDIA Triton Inference Server,ONNX Runtime,PyTorch 或其他框架,将 CPU 与 GPU 模型封装为可复用的在线服务;
- 支持 HTTP,gRPC,SSE 流式响应,同……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。