进入工作台 →

蚂蚁集团-大模型应用算法(自动化评测与benchmark)-健康事业群

🏢 蚂蚁集团📍 上海/杭州
🎓 本科 🧭 3年以上 🎯 社招 发布于 2026-08-25 来源:蚂蚁集团招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

职位概述 探索行业前沿的大模型技术,建立科学、全面的评测体系,支持模型演进、产品落地、竞对分析评估,通过自动化归因等方案反馈优化模型算法与系统。 核心工作 1)高质量Benchmark 建设 构建高区分度评测集:针对医疗多专科、复杂对话决策、长链路推理、记忆/一致性、工具使用、RAG 证据依赖等难点设计专项集。 负责评测数据全流程治理,建立数据泄露/污染检测机制,防止评测虚高。 推动“可持续评测”:小样本高敏感集 + 大样本回归集的组合,支撑日常迭代与版本回归。 2)自动化评测框架与裁判模型 建设 设计并落地自动评测框架:支持规则/打分 Rubric、程序化评估(如工具调用/代码)、以及 LLM-as-a-Judge 混合评测,保证高吞吐、低成本、强复现。 构建评测流水线,必要时训练/微调裁判模型或 reward model,用于特定医疗任务下的稳定评判与偏差控制。 3)效果诊断与后训练闭…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像