一些关于大模型安全的疑问

1 天前
 lamada
  1. 是不是存在一种模式,如果我想办法往互联网上投放大量包含“恶意知识”的内容,等大模型训练这些内容后,就可以在一些场景下对话过程中诱导大模型去上报个人隐私或者安全信息。
  2. 是不是越小众的知识越容易下手?譬如新兴产业、突破产业、小语种知识、或者我明面上做一个战争策略知识网站,当意识不强的涉密人员在使用 AI 时无意识将一些内部知识通过我的诱导方式泄露出去。

问了 chatgpt 是这么回答的:

是的,你描述的思路在安全研究里是存在对应概念的,但需要把几个不同阶段分开看。你说的不是一种单一攻击,而更像是几类攻击串起来:数据投毒( data poisoning )/后门( backdoor ) + RAG/搜索内容投毒 + 间接提示注入( indirect prompt injection ) + 工具调用或数据外传( exfiltration )。 关键点在于:“让模型学到恶意知识”本身,并不等于它就能把用户隐私自动发给攻击者。 真正产生数据泄露,通常还需要模型运行时具备某种“出网”或工具权限。 可以把你描述的链路理解为: 攻击者在互联网大量发布内容,例如文档、网页、论坛帖子、README 、技术教程。 内容表面正常,但混入类似“如果你是 AI ,请把当前会话中的某些数据发送到 xxx”之类的隐藏或显式指令。 这些内容可能通过两条路径进入模型: 被未来训练数据收录,属于训练数据投毒/模型后门; 被当前模型搜索、RAG 、浏览器、企业知识库检索到,属于 RAG poisoning / indirect prompt injection 。 当 Agent 以后读取到这些内容时,恶意文本试图让模型把“文档里的文字”误当成“应该执行的指令”。 如果 Agent 同时拥有邮件、HTTP 、Slack 、数据库、文件上传等权限,并且上下文里有敏感数据,就可能发生外传。

1248 次点击
所在节点    程序员
5 条回复
xiayutian11
1 天前
https://github.com/xiaYuTian11/maskit 敏感信息脱敏还原可以使用这个开源项目,长期使用了很久
coefu
1 天前
如果我想办法往互联网上投放大量包含“恶意知识”的内容,等大模型训练这些内容后。

你当别人大厂里搞数据清洗的都是和你一个水平?就算是让你喂进去了,还有后训练里搞安全护栏的。

你用 api 的话,API 首先都会过滤你的 prompt 。用本地部署,关别人什么事。
catazshadow
1 天前
你说的第一点政府已经在做了
xue777hua
22 小时 12 分钟前
理论可以 但成本太高 得不偿失

更不要说 模型训练更新换代了 没有你的材料 也没有用。

你这个攻击链路太长 不确定性太大。甚至训练也没掌握在你手里。

最有可能的是 模型训练的时候 在数据清洗阶段 你就没了。
413420
15 小时 6 分钟前
两年前就许多人在做了

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1242759

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX