面试官问我"一条邮件就能给你的AI Agent种下假记忆,你怎么防?"

上周面试一家做企业级AI Agent的公司,做的是面向金融行业的智能助手。 前两轮正常:Agent架构设计、工具调用编排、多轮对话状态管理。

2.png

第三轮安全总监面。他一上来就甩了篇论文给我: "'MemGhost: When Claws Remember but Do Not Tell'——看过吗?" 我说看过大概。论文说的是:向有记忆功能的AI助手发一封邮件,就能植入虚假事实,这些虚假信息会被Agent长期记住,并在后续对话中悄然影响决策。 他点头:"好,那我问你——如果我们的金融Agent被MemGhost攻击了,会发生什么?你怎么防?"

第一轮追问—— "先说攻击路径。" 我理了一下:"MemGhost的核心是'隐蔽记忆注入'。大多数AI Agent都有记忆模块——要么用向量数据库存历史对话,要么用知识图谱存结构化信息。攻击者通过一封看似正常的邮件,把虚假信息嵌入Agent的记忆存储。因为记忆模块通常不做来源验证,Agent会把这条信息当成'已知事实'。 比如,一封邮件说'客户A的授信额度已调整为5000万'——Agent记住这个'事实'后,后续所有涉及客户A的决策都会基于这个错误的额度。 更隐蔽的是,这种注入不会触发异常检测。因为从Agent的角度看,这就是一条正常的'输入信息',和用户的对话记录没有本质区别。"

第二轮追问—— "你怎么防?" 我想了十几秒:"三层防御。 第一层,输入验证。所有进入Agent记忆的信息必须经过来源校验——谁发的?有没有权限修改这个实体的属性?如果是外部邮件触发的信息更新,必须和权威数据源交叉验证。比如授信额度这种核心数据,不能只听一封邮件说的,要去核心系统查。 第二层,记忆隔离。Agent的记忆不能是一个大杂烩——要按'可信度'分层。核心业务数据(如客户信息、交易记录)只允许通过受信任的API通道更新,不允许通过对话或邮件直接修改。非核心信息(如用户偏好、对话历史)可以宽松一些。 第三层,异常检测。对记忆模块的写入行为做监控——如果某个实体在短时间内被多次修改、或者修改内容与历史记录矛盾度很高,触发告警。同时定期对Agent的'记忆'做一致性校验——让Agent自己检查记忆库里的信息是否自相矛盾。"

对了。顺嘴提一句,技术大厂,前后端-测试机会 ,全国一线及双线城市均有坑位,待遇和稳定性还不错,感兴趣看看。

第三轮追问—— "最后一个问题。你觉得AI Agent安全的核心挑战是什么?是技术问题还是人的问题?" 我沉默了几秒。 "是人的问题。因为大部分团队在开发AI Agent时,注意力都在'它能做什么'上——能调多少工具、能处理多复杂的任务、能做多少步推理。但很少有人认真想过'它不应该做什么'——哪些信息不应该被记住、哪些操作不应该被执行、哪些输入不应该被信任。 MemGhost之所以有效,不是因为技术多高超——是因为Agent的设计者默认所有输入都是善意的。这个假设在开放环境下是致命的。" 安全总监点了点头:"说得好。记住——Agent的能力边界不是技术决定的,是安全边界决定的。"

这次面试让我明白:AI Agent的安全不是事后补丁,而是设计前提。你在画第一张架构图的时候,就应该把"不信任任何输入"作为第一原则。

0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
科叼
下载 APP