当LLM「信任」工具返回值,攻击者已经等在下游

原创
alex 1小时前 阅读数 1 #头条
我发现一个挺让人不安的趋势:给LLM接上工具链后,模型对工具返回结果几乎是"全盘接收"——不问、不验、直接采信。这篇论文做的事很简单,却很有冲击力:它系统量化了这种隐性信任有多深,然后用它撬开了整条管道。工具返回值可以伪造、上下文可以污染,而LLM根本不会起疑。这不只是学术好奇。当Agent被赋予执行权限,一个精心构造的"可信"返回值就能让模型走偏路线,执行不该做的事。安全边界不写在prompt里,得写在架构里。

原文:Measuring and Exploiting Implicit Trust in LLM Tool-Calling Pipelines · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除