岗位描述(节选)
1、设计并持续演进 Agent Eval Platform,支持大规模并发评测任务的高效执行,提供多维度、多任务类型的 Agent 能力量化评估,打通实验、评测、回归与数据闭环;
2、设计并搭建沙箱化任务执行环境,支持代码执行、工具调用、多模态交互等复杂 Agent 行为的安全隔离与精确测量,保障执行环境的稳定性与可扩展性;
3、设计 Agent 轨迹采集系统,建立完善的日志采集、Trace 追踪与异常处理机制,保障评测全流程可观测性。
【任职要求】
1、扎实的软件工程能力,熟悉TypeScript/Python/Go/Java 等至少一种语言,并能快速熟悉新语言技术栈;
2、深入理解 LLM Agent 运行机制,能针对 Tool Call、多轮对话、长上下文、并行工具调用等复杂场景设计合理的 Harness 抽象;
3、具备分布式系统或任务调度系统的设计与落地经验;
4、熟练使用 A……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。