岗位描述(节选)
1. 按产品架构与业务要求,设计覆盖功能与非功能需求的评测策略,保障 AI/算法类产品效果符合设计预期与系统稳定性;
2. 面向复杂推理、Agentic Workflows 等前沿能力构建高难度评测集;开发支持万级并发、对接训练集群的评测流水线,实现 Checkpoint 边训边评与分钟级反馈;规模化落地 LLM-as-a-Judge 解决开放式生成量化难题;对 Bad Case 做算法级归因,反馈 AI 研发团队,指导数据配比、合成数据生成、AI短板能力提升;
3. 研究评测新技术方法,攻克评测复杂技术/算法问题;
4. 结合 AI 行业趋势制定评测技术发展规划,提升团队技术视野与影响力。
【任职要求】
1. 5年以上互联网/传统行业AI评测经验,含3年以上 AI/算法类产品评测经验(大模型/推荐/搜索/NLP),有基座模型评测工程经验者优先;
2. 熟悉算法服务测试场景(精度验证、A……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。