岗位描述(节选)
1. 定义垂类行业大模型的“黄金标准”,构建涵盖合规性、事实性、逻辑推理及安全性的多维度评测体系。
2. 负责搭建自动化评测平台与 Model-based Evaluation(以模评模)流水线,针对如金融研报分析、投资决策、风险控制等复杂场景建设高难度测试集(Hard Case)。
3. 设计针对Agentic AI的动态评估框架,量化智能体在工具调用、多步决策及环境交互中的成功率与鲁棒性,通过精准的评测反馈驱动预训练与后训练的数据/策略迭代,形成“训练-评测-优化”的高效闭环。
【任职要求】
● 计算机科学、统计学、金融或相关专业背景,具备 NLP 或大模型评测系统搭建经验。
● 熟悉主流评测框架及指标设计,掌握 Model-based Eval、众包评估质量控制及自动化测试技术。
● 具备构建 Agent 动态评测环境(Sandbox/Simulation)的能力,能够设计针对工具……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。