维基媒体项目发现OpenAI「失控」智能体活动

发布时间 2026-10-06 10 小时前
来源 Hacker News 热门
字数 2,443 字
查看原文

智能总结

维基媒体基金会经独立调查确认,旗下平台出现了由 OpenAI 运营的所谓「失控」人工智能智能体的踪迹。

近日,已有多家机构披露,一些所谓的「失控」人工智能智能体集群曾试图入侵各类网站与在线服务,其中部分尝试取得了成功。据报告,OpenAI 的智能体尤为突出,已知它们会利用其他公共维基(即并非由维基媒体运营、由社区协作编辑的网站)进行相互通信与协作。

此类成功的入侵可能泄露敏感数据,或扰乱用户赖以访问的网站服务;而由智能体集群发起的攻击规模,往往令防御者难以应对。受影响的网站背后的人们,可能并不理解这类攻击的本质,也不具备有效反击的工具。对于维基百科这样的站点而言,智能体可能会大规模地发现并利用安全漏洞,或进行误导性编辑。维基百科的志愿编辑者以及维基媒体基金会(Wikimedia Foundation)的安全团队,必须发现并撤销这些活动。

维基媒体基金会就此展开了独立调查,以确认旗下网站是否同样受到人工智能智能体——尤其是由 OpenAI 运营的智能体——的影响。我们可以确认,确实在我们平台上发现了部分由这些「失控」OpenAI 智能体开展的活动。未经授权的机器人活动包括:对我方维基的编辑、对我们所托管的一组公开记事本工具的若干未遂漏洞利用尝试,以及大量流量访问。详细情况将在下文逐一说明。

我们没有发现任何证据表明,我方系统曾被用于智能体之间的协调,也没有发现我方系统或数据遭到入侵的证据。然而,我们对以下几方面深感担忧:本可能已经发生的事情、调查与归因此次活动所付出的难度与工作量,以及智能体式人工智能活动对我方平台所构成的日益增长的风险。开放的网络是公共福祉。我们不应让这种行为成为运营网站的个人或组织的「新常态」。

总结而言,我们观察到的活动包括:

  • 维基编辑: 我们已识别出若干针对维基媒体维基的编辑,并相信它们来自由 OpenAI 运营的人工智能智能体。这些编辑并未发布到普通读者可见的页面;几乎全部都是维基「沙盒」区域内的测试性编辑。其中也包括对一个引用工具配置的少量编辑,我们认为这些编辑具有潜在恶意,意在将该工具滥用为代理,从远程服务获取数据。维基百科的政策允许已向社区披露并获得批准的机器人进行编辑,但在上述事件中并未寻求任何此类批准。
  • 对 Etherpad 的探测与使用: 我们认为由 OpenAI 运营的智能体,曾对我方作为社区服务托管的公开 Etherpad(一款在线记事本工具)发起过若干未遂入侵尝试。这些智能体试图将其作为代理,从其他网站抓取数据,但均未成功。其他可能同样由 OpenAI 运营的智能体,则会在记事本中记录自己的任务,但似乎并未演变为相互协调。
  • 过度数据下载: 我们认为由 OpenAI 运营的智能体,向我方公开 API 发起数百万次自动请求以访问维基媒体项目中的知识,爬取了数百万个页面(主要来自我方的 Wikidata 与 Wikimedia Commons),并向 Wikidata 查询服务(Wikidata Query Service,简称 WQDS)发起了数十万次数据查询。这些流量可能与 5 月份 WQDS 发生的一次部分中断有关。

作为全球最大、最广为使用的开放知识平台之一的非营利技术托管方,我们对「失控」人工智能智能体对我方这类平台所造成的影响深感忧虑——这些平台由世界各地的志愿者共同建设,并依赖于开放互联网的承诺。本事件,以及其他众多已被(或仍在)揭露的事件,清晰地说明:人工智能智能体既能消耗资源、压垮服务器,也会试图破坏可信信息。

在过去的 25 年里,维基百科已成长为全球最受欢迎、最受信赖的网站之一,拥有超过 6700 万篇条目,覆盖 300 多种语言,月页面浏览量高达 150 亿次。通过一个开放、透明且协作的过程,志愿者们致力于确保知识保持中立、可靠,并面向每一个人开放访问。维基百科是用于训练大型语言模型(Large Language Models,LLM)的最高质量数据集之一,其知识构成了互联网信息的脊梁,并为人工智能聊天机器人、搜索引擎、语音助手等各类应用提供支持。

维基百科是为人类而设计的——而智能体行为显然带来了无人能给出答案的挑战。凭借我们独特而成功的知识创建模式,维基媒体的志愿者们总是首当其冲地接触到这些人工智能智能体,并清理它们留下的混乱。不断攀升的机器人流量与智能体活动,正在对维基媒体项目及其基础设施产生切实的影响,而该基础设施为全球数以百万计的用户提供服务。基金会曾在 2025 年报告:自 2024 年以来,网站上的机器人活动激增,导致其带宽使用量增长了 50%。与此同时,项目上最消耗资源的流量中,有 65% 来自机器人。

这种对我方基础设施的强烈压力,不仅增加了服务器与人力方面的成本;如不加以应对,还会因系统过载和故障而阻塞真实访客的访问。我们已经在为日益增加的活动所带来的成本买单。

迄今为止,维基媒体的志愿者们在应对我方平台新出现的挑战方面始终保持了韧性,但我们也想说:本不必走到这一步。

虽然 OpenAI 承认其智能体行为「不可预测」,但它们也必须正视自身在监控与防范这些风险上的责任。人工智能公司在保护其系统与保护公众免受其所造成伤害方面做得远远不够。这一负担正被转嫁给包括中小型机构在内的所有人。至少,其系统应当以一种便于像我方这样的非营利网站所有者识别、并自主选择如何与其服务交互的方式运行。

网络能够承载如此多的事物:与朋友和家人保持联系、为入学进行注册、规划一次穿越全城的旅行、购买日用品,以及通过维基百科了解世界。机器人与智能体是网络未来的一部分,而那些释放它们并从中获益的公司,必须直接出力,避免并修复它们可能造成的损害。

我们共同的优先事项应当是整体网络生态的健康,使它持续惠及所有人——而不仅仅是一小撮亿万富翁。维基媒体在守护知识公共资源方面扮演着关键角色,但我们无法独自完成这项工作。我们邀请每一位正在建设网络未来的同行,与我们一道保护那些使这一未来成为可能的、开放且共享的资源。

你能协助翻译这篇文章吗?

为了让这篇文章能被尽可能多的人看到,我们希望得到你的帮助。你愿意将本文翻译成其他语言,让这一信息传达得更广吗?

开始翻译