岗位描述(节选)
1. 构建智能化全维评估体系
(1)体系设计: 主导搭建面向多任务、多模态(文本/视觉/代码)的大模型及智能体自动化评估框架,定义标准化的性能指标(如准确性、鲁棒性、响应延迟、资源消耗)。
(2)场景覆盖: 深度覆盖逻辑推理、长文本摘要、复杂指令遵循、多轮对话保持等核心场景,通过量化数据精准刻画模型能力边界。
2. 深化安全合规与红蓝对抗 (Security & Red Teaming)
(1)主动防御: 建立金融级 AI 安全合规基线,实施全周期的内容风控测试,精准识别偏见歧视、幻觉生成、敏感数据泄露及隐私侵犯风险。
(2)对抗演练: 主导红队演练(Red Teaming)与对抗样本攻击测试,模拟极端恶意输入,挖掘模型潜在漏洞,提升系统在复杂对抗环境下的鲁棒性与内容可控性。
3. 研发 AI 效能引擎与自动化平台 (AI Efficiency Engine)
(1)平台构建: 主导/参与……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。