岗位描述(节选)
1. 保障AI服务稳定性: 覆盖大模型训练以及后训练、AI Agent、模型推理部署与性能、评测环境、安全沙箱等全链路以及相关平台,构建预警、定位、自愈、降级等核心可靠性能力,负责全站全生命周期应急工作;
2. 构建资源治理与成本优化体系: 面向算力使用,落地资源配额、极致的训推资源调度效率提升与优先级管理,成本归因及优化方案,保障AI业务规模化下的经济可持续运营。
3. 探索AI驱动的智能化运维: 将AIOps与AI Agent融入稳定性工作,建设异常检测、质量退化识别等智能运维能力,共同探索运维harness架构,用AI保障AI的运行可靠性。
【任职要求】
● 必备项:
○ 工程能力扎实,熟悉AI技术栈,精通Python/Golang/Java至少一种。
○ 二选一,熟悉推理服务架构(vLLM/SGLang/tensorRT/Triton等)或Agent执行链路/熟悉训练服……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。