岗位描述(节选)
1、负责建设面向安全场景的大模型评测体系,涵盖通用能力评测与安全业务场景定制评测,构建基于LLM-as-Judge、自动化评测模型训练与人工评估相结合的多维度评测框架,保障评测结果的全面性和可靠性
2、建设基于真实安全攻防场景的Agentic评测环境,构建面向安全长程任务的Agentic评测,提升大模型在安全场景的Agentic能力
3、跟踪业界主流安全大模型评测方法与Benchmark动态,持续优化内部评测体系,对标行业前沿能力水平,发布开源评测集
4、深度参与大模型迭代过程中的知识与评测驱动优化,建设“评测归因分析→知识短板发现→训练数据生产→模型训练增强→评测反馈验证”的高效自进化闭环,以评测数据反哺训练,用领域知识增强训练数据,持续提升模型在安全场景中的能力表现
【任职要求】
1、计算机、人工智能、信息安全或相关专业硕士及以上学历,1年以上大模型研发相关工作经验
2、精通大模型基……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。