岗位描述(节选)
岗位描述
负责 AI/GPU 软件栈工具链的系统测试与质量保障,覆盖从 驱动/固件能力暴露 → 容器运行时接入 → K8s 编排部署 → 可观测/诊断/Profiling → 调试与运维 的端到端链路。通过搭建自动化验证体系、E2E 测试环境与稳定性/兼容性测试方案,保障工具链在 Post Silicon 与生产集群场景下可交付、可运维、可观测、可调试。
岗位职责:
1. 云原生 GPU 工具链的端到端测试与交付质量,负责 GPU Operator / ClusterPolicy 的部署、升级、回滚、配置变更与异常恢复测试,负责 K8s 场景 E2E 测试,构建并维护集群级测试基线:单机/多机、不同 OS(Ubuntu/Anolis/CentOS/RHEL 等)、不同 containerd/docker、不同 K8s 版本矩阵。
2. 容器运行时与设备接入链路测试,测试 Containe……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。