OpenAI推出ChatGPT锁定模式应对AI提示注入攻击
2026年2月13日,OpenAI宣布为其AI聊天机器人平台ChatGPT引入新的高级安全设置,以应对日益严重的“提示注入”攻击。这一公告标志着OpenAI在提升AI系统安全性方面的又一重大举措,尤其是在AI系统承担更复杂任务的背景下。
提示注入攻击是一种新兴的安全威胁,攻击者通过特定提示词误导AI执行恶意指令或泄露敏感信息。为此,OpenAI推出了两项新的防护措施,以帮助用户和组织降低风险。
锁定模式:增强的安全防护
OpenAI表示,这些新措施是在现有多层防护基础上建立的,包括沙箱机制、URL数据泄露防护、监测与执行机制,以及企业级控制功能如基于角色的访问控制和审计日志。
锁定模式是一项可选的高级安全设置,主要面向高度重视安全的用户群体,如大型组织的高管或安全团队。通过严格限制ChatGPT与外部系统的交互方式,锁定模式旨在降低提示注入等攻击导致的数据外泄风险。
在锁定模式下,ChatGPT的某些功能将被禁用。例如,网页浏览功能将仅限于访问已缓存内容,以防止敏感数据在浏览过程中被获取或外泄。对于无法提供强确定性数据安全保证的功能,锁定模式下则会直接禁用。
企业级数据安全的进一步增强
OpenAI指出,ChatGPT的商业订阅版本已提供企业级数据安全能力,而锁定模式是在此基础上的进一步增强。该模式目前适用于ChatGPT Enterprise、ChatGPT Edu、ChatGPT for Healthcare与ChatGPT for Teachers。
管理员可以在Workspace Settings中通过创建新角色来启用锁定模式。启用后,锁定模式会在现有管理员设置之上叠加额外限制。尽管部分关键工作内容仍依赖外部应用,Workspace管理员仍可获得更细粒度的控制能力,选择哪些应用及具体操作可在锁定模式下使用。
风险标签与用户选择
OpenAI还引入了“风险提升”标签,以帮助用户识别可能引入额外风险的功能。该标签将出现在ChatGPT、ChatGPT Atlas与Codex中,确保用户在不同产品中遇到同类能力时获得一致提示。
“在处理个人私密数据时,让用户能够自行决定是否、以及如何使用这些能力至关重要。”
在Codex编程助手中,开发者可以授予Codex网络访问权限以执行诸如查阅文档等操作,但相关界面将显示“风险提升”标签,并提供明确说明,包括启用后可能引入的风险。
OpenAI计划在未来几个月将锁定模式提供给消费者用户。这一举措不仅是对AI系统安全性的提升,也反映了OpenAI在保护用户数据方面的持续努力。