岗位描述(节选)
1.岗位职责;
2.负责大模型评测平台的架构设计与核心能力建设,打造稳定、高效、可扩展的评测运行底座,支持文本、语音、图像、视频及 Agent 等多类型模型和应用的评测需求;
3.负责评测任务全生命周期的工程化建设,包括环境与依赖管理、任务编排、并发调度、资源隔离、失败重试及结果管理等;
4.建设大规模评测执行能力,持续优化平台的吞吐、延迟、资源利用率和任务成功率,保障评测任务在生产环境下稳定运行且结果可复现;
5.建设评测平台的可观测与诊断体系,完善日志、指标、链路追踪、异常检测和问题归因能力,保障评测结果准确、可信、可解释;
6.跟进大模型及 Agent 技术发展,探索自动化评测、模型裁判、智能归因和 AI 辅助研发等方向,持续提升评测效率与平台智能化水平。