岗位描述(节选)
1. 防御机制拆解: 跟踪国内外主流模型的安全策略,通过实验分析其在内容过滤、逻辑保护方面的实现路径,并输出分析报告。
2. 安全围栏建设: 参与公司模型的内容审计系统开发,编写并维护核心的防御 Prompt 和过滤规则库。
3. 风险路径探测: 对模型系统(含插件、沙箱)进行常规的安全评估,识别提示词泄露和接口滥用的潜在风险,并提出加固建议。
4. 反蒸馏技术落地: 协助落地基础的防爬取、模型输出干扰等风控方案,保护公司模型资产。
5. 跨团队协作: 与算法团队配合,将发现的安全漏洞转化为模型微调(SFT)或对齐(RLHF)的训练样本。
【任职要求】
1. 教育背景: 计算机、信息安全相关专业本科及以上学历, 对大模型底层原理(Transformer、RLHF等)有一定理解。
2. 专业技能:
1) 熟悉 Python/Go 至少一种,有扎实的编码功底,能自己写工具。
2) 对……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。