岗位描述(节选)
1. 深入理解语言、多模态大模型的原理及应用场景,设计算法评测方案,参与编写并执行算法评测工作,对算法的准确性、安全性等方面进行评估,记录并分析测试过程中出现的异常情况,撰写评测报告。
2. 协助开展性能测试、稳定性测试等工作,使用专业工具或自建工具模拟高并发场景,测试大模型在不同负载下的响应速度、吞吐量等性能指标,分析测试结果,产出测试报告。
3. 负责测试资产的整理与维护,包括迭代测试方案、构造测试数据集、归档测试报告等。
4. 对标国内外主流评测基准,基于行业通用 Benchmark 评测体系,搭建大模型 / 智能体算法基准测试框架,设计标准化评测数据集与指标体系,开展模型版本回归、准出验收与效果对比,输出 Benchmark 横向评测报告,支撑算法迭代与上线决策。
5. 学习并掌握大模型相关技术和测试方法,跟踪行业前沿动态,结合业务场景优化测试流程与方法,提升评测效率、精准度与整体……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。