FLAWED 的缺陷及其对业界研究的影响
发布于 2026 年 9 月 22 日
免责声明:本文观点仅代表我个人,不代表我现任或曾任职的任何雇主或关联组织的立场。
9 月 17 日,我转推并引用了 Trail of Bits 的一篇博文,题为《1Password 的 AI 修补基准具有误导性》,该文也引用了 Davi Ottenheimer 的《1Password 散布虚假信息:其 AI 修补报告是假的》。两篇文章都对 1Password Off-by-1 Labs 发出的《前沿模型的漏洞修补常常存在 F.L.A.W.E.D》(下文简称 "FLAWED")提出了批评。
我在 FLAWED 发布时就看过了,并与其他研究者讨论过;我们当时就把它归类为粗制滥造之作(slop),便不再关注。但我当时没有意识到 1Password 的传播渠道把它推得有多远:它已经进入了新闻报道和防御方的路线图。看到它让真正严谨的研究被资源更少的团队掩盖,促使我在 Twitter 上发文,而收到的回复又促使我写下这篇博文。
原始推文线程
以下是该推文线程(含两条后续回复)的逐字转载。
- 除了 Davi 和 ToB 提出的评估问题之外,这篇论文还有不少明显的硬伤——其中一些问题甚至让我怀疑其中人工与 AI 协助的比例——但其中有几处太过离谱,以至于我们必须思考:对业界实验室的研究规范究竟应当提出怎样的要求。
- 这些错误包括错误的图表(例如图 1 声称相关步骤上标有星号,但星号在哪里?)、算术错误(例如 2.8 ≠ 约 4),以及仅凭略读就能发现的内部文本矛盾;但最严重的还是引用问题。
! - 业界论文的引用密度合理地可以略低一些。但 FLAWED 采用了严谨研究的体例与修辞(甚至声称在这一具体领域"几乎没有前期工作"),却只引用了 19 个来源(大多是公司博客文章,外加一张 XKCD)。!
! - 这种说法与文献现状不符。与之同期发表的 PatchBench 论文有 73 条引用(https://arxiv.org/pdf/2609.04075 ),其中大部分是学术研究论文。举例而言,Meta 的 AutoPatchBench 显然是与此直接相关的前期工作,由知名研究者完成,却未被引用。
- FLAWED 没有引用、也没有读过这篇 NDSS 论文(https://ndss-symposium.org/ndss-paper/chasing-shadows-pitfalls-in-llm-security-research/ ),该论文讨论了 LLM 安全研究中的陷阱,包括其所涉的具体子领域;如果读过的话将大大有助于这项工作,因为 FLAWED 恰好存在这些已被识别出的陷阱。
- 在 Patch the Planet 方面也存在事实性问题。根据 OpenAI 的说法,Calif 和 HackerOne 参与了"漏洞分诊、协调披露以及额外的针对性漏洞发现工作",但这篇论文只提到了 ToB 的工程师。
- 我理解 ToB 为什么受到关注;他们是 OpenAI 的合作伙伴,也是论文所有作者最近的前雇主。作为 ToB 的前员工,我深知引用脑海中浮现的内容是多么容易。但该陈述仍然是不准确的,对一篇研究论文来说,这种不准确是不合适的。
- 我自己也做过变成博客文章和白皮书的业界研究,也发表过学术成果。文体的惯例会带来相应的期待。这篇文章主张并采用了权威性研究的语气与格式,却没有采纳必要的严谨性。
- 错误是正常的;这正是我们发表、再现并批评研究的意义所在。但这也正是为什么需要勘误,以及在必要时需要撤稿的原因。
- 我希望 1Password 发出撤稿或勘误。我希望他们至少与学术研究者合作,聘请具有研究背景的人员,或与社区交流,以避免再次发布错误如此集中且后果严重的研究成果。
- 我这样说,是作为一名希望他们做这项工作的 1Password 用户。AI 安全需要来自独立于前沿实验室的团体的研究,尤其是审视潜在营销声明的工作。然而,这恰恰使得执行严格的研究规范更加重要,而不是更不重要。
- 尽管 1Password 的 Off-by-1 Labs 不是世界上最严重的违规者,我原本希望他们能产出有质量、有诚信的作品——因为如果要说有什么,他们的利益本应倾向于可信的研究,而不是粗制滥造之作。
针对有人提到前沿实验室,我回复道:
- 当然!如果你翻看我其他推文和转推,你会发现无论是作为个人的我还是我所转发的研究,对前沿实验室都曾有过大量批评。但以公司品牌发布粗制滥造之作,不过是不追究科技公司责任的另一种方式。
- 解决之道是诚实与严谨,而不是以省略式的剽窃和粗制滥造。我们应当放大来自学术界或 EleutherAI 等机构的真实、优秀、独立的工作——它们的资源和影响力都远小于业界实验室。
- 省略直接相关的学术工作会加深这种不平衡。1Password 的工作获得关注、新闻稿等,而真正的思考者却没有。错误粗略一读便显而易见时,这种漫不经心很难被原谅。1Password 可不是什么可怜的弱者!!
- 我确实希望 OpenAI 的说法被认真评估!开源软件值得将资源投向真正让它更安全的方向。CISPA、UMD 和 Drexel 都做过关于类似问题的严谨且对 LLM 在安全方面的能力持批评态度的研究,1Password 本可以资助这些工作。
针对有人对我反驳质量的担忧,我也回复道:
- 我会指出不当行为和粗制滥造之作。我非常想知道真相,并期待真正严谨的研究出现。欢迎对所链接的反驳评估发表评论。但证明一个声明是错误的,并不要求同时找出正确的那个;这种不对称正是研究运作的方式。
之后,CISO、学者、业界研究者和从业者纷纷向我反映,他们也注意到了同样的问题。许多人不曾公开提出,是因为缺乏合适的平台或担心遭到报复。这些回应还暴露出一些二级代价——尤其是对学术界而言——对不熟悉研究周围社会系统的人来说可能不那么明显。
研究不应被当作体育运动
1Password 雇用了许多有才华的员工,并在高质量工作方面享有声誉。尽管如此,FLAWED 的严重问题必须被指出。
如果你认为这些问题不应被提起,仅仅因为 FLAWED 批评了 OpenAI,那么请明白:研究不是体育。OpenAI 不是马刺队,1Password 不是尼克斯队,Off-by-1 Labs 也不是杰伦·布伦森。所有的研究都应当接受健康的怀疑。
对前沿实验室声明进行严谨评估是可能的,也是必要的,包括对 Patch the Planet 中固有声明的评估。EleutherAI 经常在该领域发布精确的研究。AI Now Institute 发布了一份对 Patch the Planet 的合理报告(虽然它不是研究论文,但引用数比 FLAWED 还多)。
研究不应变成影响力行动
FLAWED 印证了许多人已有的先入之见,这或许能部分解释它为何获得如此多的关注。但我们不能仅仅因为研究契合我们的先验信念就去相信并放大它。严谨的意义正在于保护我们远离那些我们希望接受却并不真实的结论。
如果我们不执行这一规范,最坏的情况是什么?这将为恶意行为者打开大门——他们可以反复挑选取悦其机构或个人利益的结论,使用薄弱的方法,并借助公司分发渠道和社交工程使这些结论获得不成比例的影响力。我绝不是在以任何形式指控本文存在这种情况。
我所描述的是研究生态系统中独立于这篇具体论文及其作者意图而存在的脆弱性。这些讨论对营造高诚信的研究环境不可或缺。正如 Carlini 在《我为何攻击》 中所写:"你不知道它坏了,就无法修复它,所以必须有人指出坏在哪里。"
论文不是博文
安全研究涵盖广泛的活动:漏洞发现、漏洞利用与工具开发、威胁情报和实证研究。关于人机交互的实证性、科学性声明需要研究设计和证据,远超演示一个漏洞所需。
!
撰写时 https://1password.com/research 页面截图
同样的区分也适用于文体。一篇博文可以呈现基于数据的观察,而不必声称具备科学权威。一篇以科学严谨性和同行评审姿态出现的论文,则承担了额外的义务。事实上,FLAWED 用"同行评审"一词来描述作者所感谢的三位业界同行的评审,而不是学术意义上的同行评审流程。
引用数量本身并非严谨性的衡量标准,但它是有用的代理指标,可用于评估作者是否准确审视自身声明并负责任地与相关文献对话(它位列标准研究论文阅读方法 的开篇是有原因的)。省略式的剽窃是严重的。任何不引用该领域基础性论文的研究(例如这篇论文 被视为 AI 修补研究的基础之作)都会令我起疑,因为这要么说明作者缺乏对相关文献的了解,要么表明他们有意忽视,要么意味着他们根本不在乎。
在我们结束之前,我必须说一句关于 ToB 的话:尽管他们发布了那份具有重要意义的批评博客,但他们没有要求我的任何审阅或认可,而我也没有提供任何审阅或认可。我转推他们的博文,是因为它对我的批评做出了实质性补充,而我对那些批评承担全部责任。这篇博文是我的独立分析,ToB 不必为其背书,正如我对他们的分析不必负责一样。
最后一点:我对 FLAWED 的批评源于对其研究质量——而非其商业成果——的关切。这并非针对 1Password 的全盘否定。在 ToB 和 Davi 已经指出的技术评估问题之外,我这里重点讨论的是研究规范本身的失败。如果有人认为纠正这些问题有损他们关于前沿模型的论点,那么他们应当扪心自问:他们的论点本应建立在何种基础之上?我希望业界和学术界都能认真对待这些关切。我们所有人都在面对 AI 安全方面真正困难的问题,而严谨性是我们共同前进的唯一可靠道路。