岗位描述(节选)
【岗位职责】
一、岗位定位
参与建设支撑大模型训练与推理的主机基础设施,将大规模 GPU 服务器打造为可编程、可观测、可诊断、可自愈的标准化计算节点,持续提升 AI 集群的稳定性、资源利用率和扩展效率。
二、你将负责
1. 设计和研发 GPU 主机管理控制面,实现节点状态管理、配置下发、故障诊断、自动恢复和交付验收。
2. 打通物理硬件、Linux 操作系统、容器与资源调度平台,推动主机能力标准化、平台化。
3. 深入 GPU、CPU、内存、网络和存储等关键链路,定位并解决复杂的稳定性与性能问题。
4. 建设面向大规模节点的监控、故障决策和自动化运维体系,降低人工维护成本。
5. 优化主机系统架构与运行机制,提升集群资源利用率、可靠性和规模化交付效
率。
6. 与硬件、数据中心、网络、存储、调度及业务团队协作,推动基础设施能力持续演进。
【任职要求】……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 19019 个北京岗位(全城各职能合计),其中 2814 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 9K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3923 个小米集团 1142 个快手 1017 个阿里巴巴集团(含高德/阿里云) 801 个美团 753 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。