幸知日报
← 返回 2026-08-12 日报
综合

论文 13:SHE — 轨迹驱动的 Agent 安全装置进化

- 作者: Wanying Qu 等 15 人(复旦系) - 方向: Agent 安全 / 运行时防护 - 一句话价值: 安全不只靠模型权重——把 agent 的"安全装置"(harness)从固定部署物变成可从轨迹学习进化的活系统,ASR 降低 3.1 倍。 核心内容: - 问题:LLM agent 安全取决于 harness(管理上下文/记忆/工具/权限/运行时控制),但现有机制把 harness 当固定产物,无法随新风险进化;组件间功能耦合导致责任归属不清。 - SHE 将 harness 分解为 4 个明确安全职责的构件: 1. System Prompt(系统提示) 2. Rule Bank(规则库) 3. Safety Memory(安全记忆) 4. Tool Policy(工具策略) - 归因引导进化循环:轨迹失败 → 结构化诊断 → 学习构件级边界精化 → 安全-效用验证选优。 - 实证:Agent-SafetyBench 上 ASR 较静态 SafeHarness 降低 3.1 倍,同时提升良性效用;泛化到未见风险(AgentHarm 保留集);跨 agent 模型迁