岗位描述(节选)
Agent评估体系搭建与优化:
1. 负责智能Agent、大模型应用智能体的评估体系设计、搭建与迭代优化,覆盖Agent规划、工具调用、记忆交互、多轮决策等核心能力评估。
2. 从事大模型Agent评估领域前沿技术研究,探索自动化评估、客观量化评估、主观体验评测等方案的落地应用,包含评测数据集构建、评估指标体系设计、评测流程迭代优化。
3. 负责产品级智能Agent的效果评估与迭代优化,针对Agent推理错误、工具滥用、决策低效、多轮一致性差等实际问题,设计针对性评测方案与优化策略,持续提升智能Agent的综合交互与任务执行效果。
算法研究与创新:
跟踪大模型Agent、智能体评估、大模型评测领域的前沿研究成果,将先进评估算法、评测框架落地应用于公司智能Agent产品,沉淀标准化评测工具与方法论,优质成果可整理为学术论文、技术专利或技术报告对外输出。
1. 本科及以上学历,在读研究……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。