岗位描述(节选)
1.负责腾讯云 AI 平台大模型推理服务的平台化建设:模型接入与版本管理、服务编排与一键部署、弹性扩缩容、流量调度与多租户隔离、灰度发布与容灾切换;
2.负责主流推理引擎的服务化部署与调优:完成引擎封装与参数调优(并行策略、批处理调度、KV Cache 与前缀缓存、量化模型加载等),持续优化 TTFT、TPOT、吞吐与单位 token 成本;
3.负责推理链路的稳定性与可观测性:指标采集与看板建设、容量评估与压测、SLO 保障、故障定位与根因分析;
4.参与异构算力部署适配(NVIDIA / AMD / 国产加速卡)及新技术落地(长上下文、多模态推理、PD 分离、多级缓存等),持续提升业务指标。