岗位描述(节选)
1.建设金融领域深度 Benchmark:抽象投资理财领域的真实任务,把金融专家的研究框架、分析逻辑与业务规则沉淀为可泛化、可规模化的 Rubric / Checkpoint;从真实流量、典型任务、长尾与高风险 Case 构造有代表性的金融评测集,持续提升蚂小财的金融专业力与事实准确性;
2.设计金融专业评测标准与多路 Judge:联合金融专家、产品、算法团队,将专业判断转化为原子、可追溯的标准;组合 LLM Judge、金融事实核验、规则 / Python Judge、Vision 与 Trace Judge,并结合专家 Gold 持续校准,提升评测可信度;
3.开展版本评测与根因归因:搭建生产级评测工程,通过同口径 A/B、配对实验、置信区间与噪声基线判断版本变化是否真实,链路定位问题,区分模型错误、金融口径差异、检索供给错误、工具故障与 Judge 误判;
4.推动质量改进闭环:将评……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。