26.1 大模型安全威胁模型:当模型具备执行能力时的攻击面#

大模型安全的核心断言是,模型的输出不构成授权。任何进入上下文的文本(用户输入、网页、PDF、邮件、工具返回、MCP server 描述)都可能由攻击者构造,模型无法从中区分可信指令与不可信数据,因此真正的安全边界必须由模型之外的确定性执行器来维持。

登录后才可看