昊梵体育网

[CL]《Pretraining Data Can Be Poisoned th

[CL]《Pretraining Data Can Be Poisoned through Computational Propaganda》V Graf, H Hajishirzi, N A. Smith, D Kohlbrenner… [University of Washington] (2026)

在大规模语言模型预训练领域,数据污染的防御始终存在一个致命假定:认为只要通过质量过滤和去重,就能剔除有害信息。过去的研究大多局限于维基百科等高权威数据源,忽视了占语料库 90% 以上的杂乱网页数据。这种认知盲区导致开发者无法评估“计算宣传”(如评论区灌水)在工业级清洗流程下的真实渗透率。

本文的核心洞见是:将开放网页的公共评论区视为一种低成本、高渗透的“计算宣传”载体。通过构建名为 HALFLIFE 的概率评估框架,研究者模拟了毒素从注入、抓取到通过 Dolma 等专业清洗管线的全过程。实验发现,即便毒素仅占总文档数的 0.13%,其规模也足以超过整个维基百科子集,并成功在预训练阶段扭曲模型的价值偏好。

这项工作真正留下的遗产是证明了 Web 规模的数据投毒并非理论威胁,而是极低门槛的工程现实。它迫使学术界将防御重心从单纯的“内容质量过滤”转向“数据溯源过滤”,建议对用户生成片段进行差异化提取。但尚未跨过的门槛是,如何在不牺牲语料多样性的前提下,精准识别那些在语义上高度模拟自然语言的深度伪造毒素。

arxiv.org/abs/2607.15267 机器学习 人工智能 论文 AI创造营