岗位描述(节选)
1. 公司、集群、公有云三层可观测性系统(日志、监控、Trace、告警)的研发、部署、运维
2. 超大规模 GPU 训练集群的指标、日志、Trace 采集与查询性能优化(百万级 series、TB / 日 日志)
3. 多租户用户侧 Dashboard 与查询界面的开发,搜索性能调优
4. 训练任务级监控接入(step time、loss、GPU SM/Mem 利用率、通信带宽)
5. RDMA 监控指标接入(PFC pause、ECN mark、QP 状态、HCA counter)
6. 与 NOC、运维协作沉淀告警标准、降噪、SOP
【任职要求】
- 本科及以上,3 年以上 SRE / 可观测性平台研发经验
- 精通 Prometheus / VictoriaMetrics / Thanos 至少一个,有大规模联邦或分片治理经验
- 熟悉 Loki / Elasticsearch /……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。