进入工作台 →

大模型训练工程专家-稳定性方向

🏢 稀宇科技📍 北京招聘
🎯 社招 来源:企业官网(飞书招聘多租户)
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

【岗位职责】 一、一句话定位 为大模型「预训练 + 后训练」的基础设施稳定性与效率负总责的资深工程师——横向拉通 GPU 算力、RDMA 网络、通信库、高性能存储、集群调度、训练任务生命周期等多个技术域,确保大规模训练不中断 / 少中断,并持续把有效训练算力(MFU / ETTR)做上去。 二、为什么这个岗位重要 大模型训练是公司最核心、最烧算力的战役。训练稳定性直接决定旗舰模型能否按期炼成。 这是一个端到端 Owner 岗,不是分工到某个组件的螺丝钉——你对"训练能不能稳、跑得快不快"这个结果负责,向上直面算法 / 训练团队的真实诉求。 你将有从 0 到 1 搭建训练稳定性体系的空间:可观测、故障自愈、预案、效率工程,都还有大片可建设的地带。 三、你将负责什么(职责) 1. 训练全栈基础设施保障(横向拉通,核心) GPU 算力:GPU 机器交付与健康管理、坏卡 / 掉卡 / 降频的检…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。

北京招聘行情

本站当前在招 19019 个北京岗位(全城各职能合计),其中 2814 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 9K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3923 个小米集团 1142 个快手 1017 个阿里巴巴集团(含高德/阿里云) 801 个美团 753 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。

北京 其他在招岗位

按城市浏览招聘

© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像