岗位描述(节选)
负责 CatPaw Agent 稳定性测试和评测体系建设,设计并实现覆盖 Skill/Plugin、工具调用、端到端任务完成度的评测框架与自动化测试基建,支撑模型与策略选型决策,以及持续量化并提升开发者体验。
面向 CatPaw 多智能体集群构建运行时评测能力,针对路由调度、会话管理、记忆系统等模块设计场景化用例集与回归基线,识别多轮长链路下的能力衰减与稳定性风险。
主导长程任务 harness 效果评估工作,围绕Prompt 工程、tool Calling 、上下文管理、以及memory能力建立指标体系,评测驱动Agent持续优化。
主导CatPaw Agent产品需求交付质量保障、AI自动化测试开发,保障Agent产品的高质量高效上线。
覆盖 IM/社交/办公等多端渠道及浏览器自动化场景的真实链路验收,badcase分析,沉淀可复用的场景数据集与自动化巡检能力,推动线上质量可观测,以及……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。