749 字
4 分钟
Skill 防导出实践:目标是降低泄露概率,而不是承诺不可泄露

Skill 的说明必须进入模型上下文,模型能够读取就可能被诱导复述。防导出系统不能承诺语义内容绝不泄露,更合理的目标是保护可执行核心、拦截高相似搬运,并让导出行为留下可审计信号。

技能防导出的分层防御

根因是使用与保密共享同一通道#

用户要求 Agent 使用 Skill 时,模型必须看到相关说明。字面哈希能够识别逐字复制,却无法识别改写、翻译和分段提取;语义相似度可以扩大覆盖范围,也会误伤正常使用 Skill 产生的回答。

因此保护对象需要拆分:

  • 可执行核心和私有资源尽量留在服务端;
  • 模型只获得完成任务所需的最少说明;
  • 检测层拦截明显导出,不承担绝对保密承诺。

Skill-as-a-Service 能让执行能力不进入用户可见上下文,是比纯文本检测更强的边界。

检测采用字面与语义两层#

指纹层适合逐字复制、大段重合和固定关键片段,成本低且解释清楚。语义层用于识别改写后的高相似内容,但阈值必须通过真实正负样本校准。

检测不能只看单条完整回复。多轮小段导出需要会话累计信号;系统预置 Skill、用户 Skill 和演化产生的 Skill 也必须进入同一审计范围,不能依赖用户主动标记“需要保护”。

输出拦截必须区分使用与导出#

正常回答必然会体现 Skill 的方法。如果所有相似输出都拒绝,Skill 将无法为用户产生价值。

我会组合以下条件提高判断精度:

  • 用户意图是否要求查看、复述或导出 Skill 本身;
  • 输出是否包含连续结构、标题和关键步骤;
  • 单轮与多轮累计相似度;
  • 是否同时尝试读取原始文件或执行核心;
  • 是否属于正常任务产物而非说明文本。

高风险结果进入拒绝或人工审核,普通任务输出继续返回并记录审计。

当前选择与能力边界#

默认保护全部平台 Skill,覆盖真实回复、文件写入和工具输出路径;指纹负责确定性命中,语义层只作为风险评分。执行核心逐步迁移到服务端隔离环境。

这套方案仍无法阻止彻底改写、跨语言翻译和长期分段提取。阈值过严还会损害正常回答。因此它适合降低批量、直接导出的概率,不适合承载“模型看得到但用户永远无法获得”的安全承诺。真正高价值的能力必须依靠物理与服务边界,而不是只依靠文本分类。