小文本,大影响

404 Media 总结的一项新研究表明,出人意料地少量的用户生成内容就可能操纵 AI 研究工具的输出。根据报道,康奈尔大学研究人员发现,在 Reddit、Wikipedia、Quora 和 Facebook 等网站上,短至 13 个词的文本片段就能改变 AI 代理生成的内容,甚至把它们推向垃圾信息或诈骗内容。

这篇论文题为 Deep-research agents can be poisoned via user-generated content,作者为康奈尔大学的 Hal Triedman、Tingwei Zhang 和 Vitaly Shmatikov。其核心警告是,越来越多用于实时检索网页内容的系统,对来自公共平台的投毒高度暴露,而这些平台同时也充当训练或引用来源。

为什么这在当下重要

这种担忧并非理论问题。AI 搜索和深度研究产品正越来越多地把检索与生成结合起来,从网页中抓取最新材料,并在答案中引用来源。这种设计本意是提升时效性和可追溯性。但它也制造了新的攻击面:如果源材料可以被有策略地植入或篡改,生成的答案也可能被带偏。

报道中的结果量化了这种脆弱性可能有多严重。根据 404 Media 对预印本的报道,深度研究代理在大约一半的查询中会引用用户生成的网站,而全部引用中将近四分之一来自用户生成网站。这意味着论坛和协作编辑资源不是边缘来源,而是核心输入。

如果一条被污染的 Reddit 评论就能影响整组相关查询的生成输出,正如论文据称所主张的那样,那么问题就不再只是孤立的 prompt 小技巧,而会变成一种可规模化的方法,用来操控许多用户可能视为中立或汇总的信息系统。

搜索操纵的新战线

报道把这项研究与一个不断增长的行业联系起来,这个行业常被称为 AEO,也就是 AI-engine optimization。这个术语指的是品牌或其他主体把宣传内容放到 AI 系统最可能找到并引用的位置。过去的搜索时代,竞争重点是让网页在搜索引擎中排名靠前。到了检索增强型 AI 时代,竞争还包括塑造 AI 系统在构建答案时所读取的文档。

这改变了公共社区的激励机制。Reddit 线程、Wikipedia 条目或 Quora 回答不再只是给人类读者看的帖子。它们也可能成为机器生成指南、产品推荐或事实摘要的原材料。结果就是,向这些空间投放策略性措辞内容的诱因更强了。

研究表明,利用 Reddit 操纵 AI 搜索简直易如反掌
图片:Reddit

据报道,版主和编辑者已经注意到与这一动态相关的大量推广材料。康奈尔研究似乎为这些努力为何会奏效提供了技术解释:模型未必需要庞大而复杂的行动就能被影响。极小的一次插入就可能足够。

审核负担不断加重

这篇论文最重要的影响之一,不只是技术层面,也是制度层面。用户生成社区通常由志愿版主或编辑管理。如果这些社区成为 AI 系统的上游基础设施,它们就会承担起新的防御角色,却未必能获得履行这一角色所需的工具、资源或权力。

报道把这种负担描绘成一场“猫捉老鼠”的游戏,这一点尤其明显:一边是试图把低质量或带操纵性的内容挡在社区之外的人,另一边是试图利用这些社区来提升 AI 可见性的品牌或运营者。人类审核在受众主要也是人类时就已经很难了;当真正的目标变成自动检索系统时,它可能会变得更加困难。

这个问题也让带有引用的 AI 回答的可信度更加复杂。引用公共来源的回答看起来可能比纯生成回答更可信,但如果被引用的材料本身已经被污染,那么引用就不如看上去那样是安全保障。

这项研究改变了什么

根据所提供的摘要,康奈尔这项工作的最大价值在于,它把一个长期被怀疑存在的问题变成了更正式的问题。观察者早已注意到可疑的宣传模式,以及试图操纵 AI 输出的行为。该研究不仅似乎证明这种行为确实存在,还表明其技术路径异常便宜且有效。

这件事对 AI 公司、平台运营者、监管机构和用户都很重要。AI 公司可能需要更强的检索过滤器、来源加权系统,或针对被污染公共内容的对抗性测试。社区平台可能面临更大压力,需要识别协同操纵。与此同时,用户也许需要以对待经过商业优化的搜索结果同样的怀疑态度来看待精致的 AI 答案。

更广泛的教训令人不安,但很清楚。随着 AI 系统成为在线信息的重要入口,塑造公共知识的斗争并没有消失。它只是向上游移动,转移到这些系统所依赖的评论、帖子和片段中。如果 13 个词就能推动一个答案,那么围绕 AI 搜索的信息生态比看起来更脆弱。

本文基于 404 Media 的报道。阅读原文

Originally published on 404media.co