岗位描述(节选)
工作职责:
1. 算力基础设施运维:负责智算(GPU/加速卡服务器、IB/RoCE高速网络、分布式存储)与通算(x86/ARM通用服务器、虚拟化平台、云管平台)基础设施的日常巡检、监控告警与配置管理,承担设备上架部署、固件驱动升级、硬件维护及资源生命周期管理,保障设备健康率与可用性达标。
2. 算力资源池运营:负责算力/计算资源池统一管理,承接资源开通、变更、回收等运营流程,开展容量规划与利用率分析,输出运行日报/周报,支撑资源调配、成本核算与节能降耗。
3. 故障处理与应急响应:快速响应系统级及算力级故障告警,完成诊断、定位与恢复,保障服务SLA;开展根因分析(RCA)并形成改进措施,完善应急预案并定期演练。
4. AI智能体与大模型运营:承接业务侧AI智能体需求,完成场景梳理、Prompt设计与优化、工作流编排、知识库配置及上线支撑,跟踪准确率、满意度、调用量、成本等运营指标并输出优化……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。