岗位描述(节选)
职位概述
探索行业前沿的大模型技术,建立科学、全面的评测体系,支持模型演进、产品落地、竞对分析评估,通过自动化归因等方案反馈优化模型算法与系统。
核心工作
1)高质量Benchmark 建设
构建高区分度评测集:针对医疗多专科、复杂对话决策、长链路推理、记忆/一致性、工具使用、RAG 证据依赖等难点设计专项集。
负责评测数据全流程治理,建立数据泄露/污染检测机制,防止评测虚高。
推动“可持续评测”:小样本高敏感集 + 大样本回归集的组合,支撑日常迭代与版本回归。
2)自动化评测框架与裁判模型 建设
设计并落地自动评测框架:支持规则/打分 Rubric、程序化评估(如工具调用/代码)、以及 LLM-as-a-Judge 混合评测,保证高吞吐、低成本、强复现。
构建评测流水线,必要时训练/微调裁判模型或 reward model,用于特定医疗任务下的稳定评判与偏差控制。
3)效果诊断与后训练闭……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。