新基准FORGE测试了12个商业及开源LLM,发现所有模型在检索增强推荐中均易受GEO内容污染影响:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。研究还发现推理会生成虚假社会证明,且现有防御措施效果有限。
FORGE基准揭示检索增强推荐系统易受单页污染影响