岗位描述(节选)
1. 负责 AI Agent以及平台的可用性、性能与容量保障,设计并落地 SLO/SLI/Error Budget 体系,建设全链路可观测性与限流熔断、灰度发布、快速回滚等容灾能力
2. 负责 Agent 执行基础设施的可靠性保障:代码执行沙箱、工具调用网关、会话与状态存储等的资源隔离、弹性伸缩、性能优化与容量规划
3. 负责云资源运维(K8s 集群、存储、网络等),保障弹性伸缩与配额安全,建设资源利用率与成本可观测体系,推动 FinOps 实践
4. 建设 Agentic 运维体系:基于 LLM + 工具调用(Tool Use / MCP)构建自主运维 Agent,实现告警聚合、根因分析、故障自愈的闭环;设计工具权限边界、审批流、人工兜底(Human-in-the-Loop)机制与动作评测体系
5. 保障云上资源访问安全与审计合规(IAM、密钥管理、网络隔离),确保 Agent 自动化操……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。