进入工作台 →

大模型评测测试工程师

🏢 理想汽车📍 北京
🎯 社招 来源:理想汽车招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

【岗位职责】 1. 负责 AI 眼镜语言、语音、视觉及 Agent 能力的整体评测工作,建立覆盖模型选型、产品准入、版本验收和线上复盘的评测体系。 2. 结合 AI 眼镜真实使用场景,定义核心评测维度、指标体系和测试标准,包括准确性、任务完成率、响应速度、稳定性、幻觉、安全性、弱网表现、功耗与成本等。 3. 分方向建设专项评测能力: - 语言:意图理解、知识问答、指令遵循、上下文理解与生成质量; - 语音:唤醒、ASR、TTS、打断、远场、噪声及多人环境表现; - 视觉:拍照问答、OCR、物体与场景理解、视频理解及多模态推理; - Agent:工具调用、任务规划、状态管理、异常恢复及端到端任务完成率。 4. 建设与维护具有代表性的评测数据集、场景库、Bad Case 库和回归测试集,确保评测结果能够反映真实产品体验。 5. 负责不同模型、不同技术方案及不同版本的横向评测,形成清晰、可信的分…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像