← 研究方向DEEPSHARE / RESEARCH

大模型与智能体安全研究科研指导

大模型与智能体安全研究

课题研究黑盒场景下的大模型与智能体安全研究通过研究对抗性交互从而挖掘出大模型可能的误用威胁和场景,从而让大模型整体变得更加安全。该领域已在提示注入、越狱攻击、智能体操控等任务中展现出重要的研究价值。

近年来,斯坦福、MIT、UC Berkeley等顶尖高校和OpenAI、Anthropic、Google DeepMind等领先企业在NeurIPS、ICML、ICLR等顶级会议中发表了大量相关研究成果。该方向具有研究周期相对较短、实验验证相对便捷的特点,既适合学术研究又具备实际应用转化潜力,已被多家AI安全公司和大型科技企业广泛采用。

本课程将从基础的对抗攻击理论出发,逐步深入到红队测试、安全对齐、鲁棒性评估、多模态攻防以及真实世界部署等前沿内容。以黑盒攻防技术为核心,聚焦大模型在实际应用中面临的安全挑战,帮助学员掌握提示注入、越狱攻击、智能体操控、后门攻击等关键技术,培养从理论到实践的全方位安全研究能力,最终指导学员从0到1完成一项高质量的科研选题并产出具有影响力的学术论文。

通过系统性的理论学习与实践操作,学员将深入理解大模型安全的核心挑战,掌握前沿的攻防技术,并具备独立开展相关研究的能力,为未来在AI安全领域的深入发展奠定坚实基础。

科研咨询 LET'S TALK RESEARCH

聊聊你的科研计划

微信扫码,与我们沟通研究方向和目标。

请使用微信扫描科研咨询二维码查看二维码原图 ↗
放大图片打开原图 ↗