岗位描述(节选)
【岗位职责】
1、基于算力集群的资源监控,维护并完善现有"资源利用率"评估体系。
2、承接业务维度的模型资源利用率评估:将算力消耗与具体训练任务、模型、业务线关联,建立资源画像与成本分摊视图。并可以进一步演进到模型训练的业务价值评估体系建设。
3、优化训练任务的调度与资源管理(Kubernetes + Volcano 等),优化排队、抢占、弹性伸缩策略,提升集群整体利用率。
4、使用性能分析工具(PyTorch Profiler、Nsight)定位低效训练,协助提升 MFU / GPU 有效利用率。
5、编写自动化脚本与工具,沉淀 FinOps 度量指标与报表,支撑业务价值评估层的数据采集。
【任职要求】
1、计算机 / 电子 / 自动化 / 数学等相关专业本科及以上。
2、扎实的 Linux 基础,熟悉 Shell,掌握至少一门编程语言(Python 优先)。
3、了解 Kuberne……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。