岗位描述(节选)
大模型能力正在向自主决策、多模态交互等前沿边界升级演变的同时,前沿风险同时在催生。我们的任务是从原理层面发现和定义新 型AI风险,构建前沿评测与防御体系,输出高质量研究成果(如顶会论文、技术白皮书等)并推动真实业务场景安全实践落地(如蚂蚁阿福、蚂小财、灵光、阿 宝等战略级Native AI产品)。研究方向包括但不限于:
- 新型AI风险评测:面向 Agentic AI 自主行动等场景,发现并定义新型风险类别(如多轮内生安全对齐可靠性、虚实结合的具身智能风险等),设计前沿风险评测体系和benchmark;
- 安全对齐与可控性研究:探索 RLHF、DPO、Constitutional AI 等对齐方法在 Agentic AI 场景的适配与演进,研究对齐有效性与持久性,应对微调退化、对齐税、自主行动偏离等前沿挑战;
- 可解释性与风险归因:研究大模型及智能体的决策可解释性方法,构建面向自主行动……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。