岗位描述(节选)
1. 负责AI产品核心效果评估与精度度量:主导大模型及AI应用在业务场景下的效果评测全流程,包括构建多维度评测指标体系(如准确率、召回率、幻觉率、Rouge/BLEU及任务完成率),制定严谨的AB实验方案,并对评测数据进行深度统计与归因分析。
2. 构建对抗性评测与稳定性验证体系:设计并执行覆盖边界Case、长尾分布及恶意攻击的测试用例,系统性评估模型在复杂场景下的鲁棒性、安全性与语义稳定性,输出可量化的风险评估报告。
3. 推动效果回归与用户体验闭环:建立版本迭代的效果回归基线,利用自动化工具持续监控模型更新带来的精度波动;同时建立“线上数据回流-线下标注验证-模型优化”的闭环机制,推动产品体验的持续优化。
4. 设计自动化评测工具与数据飞轮:开发或集成AI自动化评测脚本(如基于API的批量推理、断言校验),建设数据标注与结果分析平台,提升效果评估的效率和可复现性;主导评测数据集的构建与……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。