本文依据截至2026年9月22日的公开来源撰写,不是独立取证调查,不是新的武器系统试验,也未经同行评议。
关键词 人工智能 · 网络安全 · 也门 · 沙特阿拉伯 · 能力评估 · 独立验证
- 1
观察到使用
- 2
产生了输出
- 3
完成独立验证
- 4
得到可接受结果
每一层都需要新增证据;仅仅观察到使用或产出,并不能证明结果质量或运行有效性。
本文目录
三个窗口,一道并不虚拟的难题
在 Anthropic 记录的也门北部案例中,一个小组同时运行多个 Claude 实例:一个写作,一个检索,一个复核。用过智能体的团队对此并不陌生,真正改变问题性质的是项目本身。Anthropic 称,这项工作涉及制导武器研发项目中的软件。它不是聊天窗口里的一次随口提问,而是一套工程流程;Claude Code 被用于原本通常需要专业人员完成的若干环节。1
值得讨论的故事从这里开始。把它概括成“聊天机器人造出了导弹”,很适合做标题,却不适合做分析;因为一次失败就断言事情无关紧要,同样站不住脚。失败可能终结一次尝试,也可能成为下一次尝试的输入。更准确的说法是:语言模型进入了编写、模拟、复核和测试的循环,而关键问题依然悬而未决——它究竟增加了什么?
Anthropic 表示,一次发射测试似乎失败,用户随后回到服务中分析原因。该公司也同样明确地表示,没有证据表明这些行为者成功部署了可运行的系统。两句话必须同时保留。前一句说明这并非纯理论兴趣,后一句则阻止我们把一次被观察到的尝试抬高为成功的实战能力。1
这些事实很容易诱使作者描绘一间由机器包办一切的秘密房间。但这种画面遮蔽的内容多于揭示的内容:报告没有让我们看到供应链、用户此前的经验、平台周围的人类工作,也没有说明产出如何被验收。眼前所见固然重要,却只是项目的一部分。分析因此要先抵抗“制造”或“研发”这类单个动词,因为一个动词往往吞进了几十个并未得到同等观察的步骤。
我们知道什么,又缺少什么
第一手来源是一家看见其服务内部活动的公司。这扇窗口很重要:公司可以描述账户、请求序列,以及经由平台处理的部分文件和产出。但它并未独立调查武器在现实中的表现。仅凭使用记录,我们无法判断代码是否正确、硬件是否合适,也无法知道系统能否承受真实运行环境。1
归属判断还有另一重限制。Anthropic 指出这是一个位于也门北部的集群,却没有宣布用户属于胡塞武装。媒体根据当地控制格局和区域背景把事件与该组织联系起来;美联社也刊登了该组织政治办公室一名成员的回应,后者否认依靠公开来源建立军事能力这一说法。这种背景推断值得说明,但重复再多次,也不会自动变成得到确认的组织身份。2
这里的区分不是语言上的过度谨慎。若认错行为者,政治分析就会建立在未经证实的基础上;若误判结果,一次失败测试就会被写成战备宣告;若夸大工具贡献,我们还会把开户以前已存在的知识、部件和经验归到模型名下。可靠的研究,应把每项主张放回产生它的观察窗口。
因此,与其堆积链接,我更愿意维护一份简单的主张清单:谁在何时说了什么?说话者如何接触到事件?又有哪些事情是其来源看不见的?公司可能最适合描述自家账户,记者可能最适合记录政治回应,联合国报告则可能最适合呈现专家组判断。窗口不同并不会削弱来源价值;它能防止某个领域里的强来源,被误当成所有领域的绝对权威。
关键不是文本,而是循环
这起事件的意义,不在于模型写出了几行代码。代码早已广泛流通,开源库和大学教材也从来不是秘密。真正可能的新变化,是检索、写作、比较和复核被集中到一个界面中,以不同速度完成,还可以分配给多个智能体。这没有取消工程师的必要性,却可能改变项目中最稀缺的环节。
可以用一般化的方式描述流程:先界定问题,再生成软件产出,随后独立测试,最后决定接受或拒绝。混淆这些层级,错误就会出现。有产出不等于通过测试;通过有限测试不等于现实中有效;一次取得可接受结果,也不等于流程已经可靠。因此,本文采用一条证据阶梯:观察到使用、产生了输出、完成独立验证、得到可接受结果。
Anthropic 宣布关闭了与该活动有关的账户,同时表示用户已经制作出一套本地运行的模拟工具。本地工具仍然存在,并不能证明它有用或准确,却说明了一个根本差别:云端会话可以终止,已经导出的东西却不能假定会随之收回。关闭入口是重要的安全措施;要判断其效果,还得知道什么停了、什么留下了,以及之后如何被使用。1
真正可能发生变化的正是这一循环。若从问题到草稿、从草稿到复核的时间缩短,即使单次成功概率没有变化,用户也可能更愿意反复尝试。但所谓提速,不能用消息数量或文件长度衡量。它应由完整耗时、明确质量、复核成本,以及另一方有权拒绝的结果来衡量。否则,我们只能知道工作在动,不能知道它是否前进。
历史并非从聊天窗口开始
即便有关胡塞武装的背景推断成立,模型进入的也不是技术真空。联合国报告记录了长期针对沙特的导弹和无人机发射,也记录了针对艾卜哈机场以及民用、经济设施的袭击。后续材料还表明,红海危机把影响扩展到航运和供应链。这些事实不能证明 Anthropic 所称集群就是同一个行为者,却解释了为何不能把事件当成孤立的软件实验。9 10 11
2026年9月19日,胡塞武装宣布袭击利雅得和延布;联军则称拦截了一枚飞向利雅得的导弹,并挫败其他袭击。关于打击是否成功、损失有多大,各方叙述仍有冲突。这个例子的价值不在于把它与 Claude 相连——没有来源证明两者存在因果关系——而在于提醒我们,讨论发生在一个熟悉警报、停摆和拦截后果的地区,而非虚拟剧场。6
背景提高了问题的重要性,却不会替我们回答问题。既有能力不证明人工智能改善了这种能力;联合国报告所述的外部支持,也不证明每次行动都由外部指挥,或每个集群都属于同一结构。能力是经验、部件、测试、后勤和决策构成的网络。把它缩成单一工具,反而会丢失真正需要衡量的对象。12
2026年9月,也门战事和流离失所重新加剧,世界粮食计划署正在扩大援助。时间上的重合不证明它与 Claude 事件有关,我也不会让这段背景承担它没有的因果功能。它之所以应当出现,是因为冲突的影响并不止于比较两种武器的参数;影响会抵达港口、机场、粮食和人们生存的能力。讨论技术尝试成本下降时,人类成本不该被漂亮术语遮住。4
飞行物不会独自看见世界
公共讨论常把目光只放在飞行物本身,仿佛精度是封存在一块金属里的属性。真正的运行能力还需要目标信息、观测、通信、指挥、测试和维护。联合国报告及军方通报曾记录胡塞武装体系中的雷达和通信设备,或有关方面声称运往该组织的相关货物。各类来源的证据性质不同,能够支持的结论也不同。12 13 16
信息可能迟到,观测可能残缺,干扰、天气和目标移动都会改变决策质量。优秀的软件不能弥补糟糕的输入,良好的传感器也不会自动修复薄弱的决策链。成功若真的发生,也是整个系统的属性,而不是某个部件的奖状。
因此,已公开的材料不允许我们声称 Claude 生成的软件接入了雷达,或实际改善了目标选择。我查阅的来源没有这类证据。它只允许提出一个更克制的问题:系统所需的某些认知性工作,是否变得更快或更便宜?如果是,验证、硬件和集成是否仍是更重的约束?这些是测量问题,不是邀请读者补齐缺失的操作细节。
从“沙蒙”到专长经济
对沙特而言,技术与国家安全的交叉并非始于2026年。Unit 42 后来的评估称,2012年的“沙蒙”行动影响了三万台或更多系统;该机构随后又记录了更新版本在2016年重新针对沙特目标。调查、技术评估、政府立场和司法裁判的归属强度并不相同,差别必须保留。可以确定的是,软件曾严重破坏一家大型机构的数字系统连续性;这不等于证明工业生产因此停摆。18
此后,企业和政府机构记录了与伊朗有关、或被归因于其相关人员的间谍活动,目标涉及能源、航空和科研。2026年8月,美国司法部公布一份扩大的替代起诉书,起诉 Mabna Institute 的17名成员,其中9人已在2018年受到起诉。起诉书中的内容是司法指控,不是有罪判决。这并非形式上的保留,而是“被指控”与“罪名经法院证实”之间的实质差别。7 19
这段历史有一条共同线索:技术知识本身就是竞争场域的一部分。软件过去被用于破坏或间谍;如今,智能平台也可能成为用户请求协助建立新能力的地方。防御问题于是从“谁进入了我的网络”扩展到“我的平台帮助用户生产了什么”。新问题没有取代旧问题,却增加了传统监测工具无法完整看见的一层。
在也门,Recorded Future 还记录了 OilAlpha 的活动,并把它评估为一个可能支持胡塞武装的组织;相关行动针对与人道主义和人权机构有关的工作人员。这是安全企业对另一个组织的评估,不能证明它就是 Anthropic 所称集群。它却拓宽了“敏感资产”的含义:敏感对象未必是设施图纸,也可能是援助人员的手机或登录信息。同样,定向攻击或冒充行为并不证明某机构的核心系统已被攻破。20
人工智能真的创造了能力吗
“人工智能提升了能力”是一句不完整的话,除非先说明“提升”指什么。是缩短某项任务的时间,减少稀缺专家的工时,增加尝试次数,改善结果质量,还是只让用户更有信心?这些结果并不相同,甚至可能朝相反方向变化。草稿生成可以更快,复核成本却可能更高;试验范围可以扩大,成功率却未必改善。
问题在于,事件只给我们一条路径:使用工具后发生了什么。它没有给出同一情境下不使用工具的另一个世界,因此无法把两段时间相减,再声称得到了精确增量。Anthropic 把该案例作为能力提升的例子,却也在配套研究中承认,测试与模拟不能直接测出对现实世界的影响幅度,从软件过渡到硬件仍是根本约束。24
与现有证据最相符的理解,是工具可能降低部分符号工作的摩擦,包括检索、写作、比较和迭代。它可能让一次尝试更便宜,却不保证成功。对国家安全而言,下一轮尝试的成本降低,本身就值得重视;但这不等于拥有可靠系统,也不能据此宣布工程师已经消失。
设想一个民用项目:生成草稿需要两小时,复核、测试和集成需要八小时。即使前两小时完全消失,项目也没有消失;总成本只是从十小时降为八小时。这是算术示例,不是实验结果。它说明为何体感可能跑在结果前面:工具有时压缩的是演示中最显眼的部分,而承担法律和运行责任的部分依旧存在。
三个智能体并不是三个证人
让一个模型写作、一个检索、一个复核,也许能改善组织方式,却不保证判断独立,也不保证错误来源彼此不同。如果它们接收相同信息、依赖同一假设,或在开始验证前就看见彼此答案,它们完全可能自信地赞同一个错误结论。打开三个聊天窗口,本身不会成立一个独立审查委员会。
多智能体系统研究也支持这种谨慎。一项研究分析了多个框架中的1600多条执行记录,把失败归纳为14种模式,涉及系统设计、智能体协调和任务验证。该研究并不评估也门案例,却提醒我们:智能体数量不是充分的质量指标。25
独立复核要从另一套标准开始,使用能够推翻产出的证据,并在信息不足时有权叫停。因此,真正实用的问题是:复核智能体是否发现了作者智能体无法自行发现的东西,还是只是改写了同一种信心?一致意见在展示中很好看,可靠性却要求流程真正允许提出异议。
这种独立性可以直接设计出来:复核者从任务规格开始,能够接触原始证据,不被要求为已有答案辩护,并按发现和漏过的缺陷接受评估。复核者可以是人、工具,或两者结合;关键是其路径能够以“证据不足”结束。不能拒绝的复核,不是复核,只是生产流程里又加了一步。
平台只看得见自己的窗口
模型提供商拥有一种新的安全视野。它们可能看见问题解决过程的一部分,而不只是最终文件:用户问了什么,请求如何变化,调用了哪些工具。这种视野确实让提供商报告具有价值,尤其是在报告与使用政策的执行相连时。但它始终只是平台视野,不是对现实世界的普查。
Anthropic 自己说明,报告中的案例因醒目或新颖而被选中,并不代表日常使用的典型样本。因此,公开案例数量不能换算成流行率。活动可能增多,检测能力可能提高,披露政策也可能改变。正如数据研究者所知,被发现案例增加,并不能单独说明上述哪一种解释发生了。1
2026年9月9日,Google Threat Intelligence Group 描述了部分对手从简单提示转向智能体工作流和相互连接的自动化。它为一个更广泛的趋势提供独立证据,却不验证也门案例,也不给出普遍适用的能力提升系数。并读两份报告有助于理解趋势;把它们当成同一事件的两位证人,则是方法上的错误。3
从沙特视角看,下一步是什么
本地讨论不应只问对手能做什么。相应的问题是:我们如何在自己的机构中使用这些工具,让结果可检验、错误可控制、工具失效或变化时服务仍能继续?如果复核方式不随之改变,降低试验成本的技术,也可能让更多错误抵达运行团队。
2026年7月5日,沙特国家网络安全局就人工智能网络安全指南启动公开征求意见,议题包括治理、防御、韧性和第三方,并覆盖生成式与智能体式人工智能。该页面证明公开咨询已经启动,并不证明具有约束力的最终规则在当日已经发布。监管状态需要像技术状态一样被准确描述。8
机构治理应从任务与权限开始:智能体需要读取什么,能够修改什么,何种进入生产环境的动作必须经过有记录的复核?随后是结果记录,包括工具版本、所用来源、人工修改、执行的测试以及批准使用的责任方。目的不是保存员工的每一句对话,而是留下足以重建决策并追究流程责任的材料。
更有意义的指标,不是请求数量,也不是用户感觉节省了多少小时,而是每项通过独立测试的可接受结果所需的完整成本:准备、运行、复核、返工,以及预先定义的质量。若这一尺度上的价值提高,我们才证明了有用的改进;若只看到表面活动增多,也许只是更快地生产以后还得修补的东西。
这一测量还应进入事件响应。模型若协助摘要安全运营中心的告警,不能只数它处理了多少条;还要测量摘要漏掉什么、分析人员验证花了多久、多少判断经复核后仍成立。模型若协助维护或运行决策,错误出现时也必须保留清晰的回退路径。良好治理不会惩罚试验,而会让试验能够产生学习,不留下来路不明的结果。
应该留下的那个问题
这则新闻有两种省事的讲法。第一种说,胡塞武装使用 Claude 制造先进武器;它在身份和结果两方面都跑到了证据前面。第二种说,测试失败了,所以没有重要事情发生;它忽略了一个工程流程已经走到实体测试,而且已经存在无需实时连接平台的离线模拟环境;不过,这既不证明其有效,也不能确定 Claude 对它的贡献。证据没有要求我们在夸大与安抚之间二选一。
更准确的叙述是:Anthropic 观察到一个位于也门北部的集群,在武器相关软件工作的若干环节使用先进模型;一次测试似乎失败;公司没有证据表明可运行系统已经部署;用户的组织身份也没有确定。这一故事保持原样,已经足够值得重视。1 2
也许,“人工智能能不能制造导弹”从一开始就是问错了。问题太宽,反而藏起了真正的工作。更好的问题是:知识转化为一次尝试的过程中,哪一环变得更便宜?测试、材料、经验和决策,又在哪里继续构成无法靠语言越过的约束?
方程、研究和软件库原本就存在。新的变量,可能是把它们组织进工作流的成本下降。因此,研究者应把注意力放在屏幕与可接受结果之间:观察到了什么,产生了什么,什么经过独立方验证,什么已经证明有效。只有到那时,我们才知道面对的是一段令人信服的文本,还是一种可靠能力。
这一区别对决策者同样重要。若把每项产出都当成能力,注意力会被告警耗尽;若只关心已经成功的系统,变化就会在完成后才被看见。最困难的工作在两者之间:观察尝试成本的下降,同时不给每次尝试授予“成果”头衔。这不浪漫,却更接近真正的安全工作——界定证据、比较替代解释,并在更好的测试到来时更新判断。
这也不是模型公司单独能够完成的任务。提供商要检测滥用并执行政策,机构要约束工具权限,研究者要抵抗跨越证据层级的冲动,记者要在句子里保留归属说明。国家则要看完整条链:流动的知识、留存的产出、失败的测试,以及最终抵达人们生活的影响。没有任何一方能独自拼出全貌,因此也不应由任何一方单独宣布成功。
参考文献
- 检测并遏制人工智能滥用:2026年9月Anthropic
- Anthropic称,也门胡塞武装控制区用户曾尝试借助人工智能开发先进武器Associated Press, 2026-09-11
- GTIG人工智能威胁追踪:从提示到自主——对抗性人工智能的演变Google Threat Intelligence Group, 2026-09-09
- 也门战事导致数千人流离失所,世界粮食计划署扩大响应World Food Programme, 2026-09-17
- 利雅得机场附近出现火光与浓烟;胡塞武装宣称袭击沙特首都Reuters, 2026-09-19
- 17名伊朗人被控代表伊斯兰革命卫队及其他伊朗实体实施大规模网络窃取U.S. Department of Justice, 2026-08-18
- 国家网络安全局就人工智能网络安全指南启动公开征求意见National Cybersecurity Authority, 2026-07-05
- 也门问题专家小组最终报告United Nations Security Council
- 联合国也门国家工作队2021年度报告United Nations in Yemen
- 红海弹道导弹袭击引发亚洲对防御系统的关注Reuters, 2024-02-21
- 也门问题专家小组最终报告United Nations Security Council, 2024-10-11
- 美军及盟友实施联合打击U.S. Central Command, 2024-01-11
- 也门问题专家小组最终报告United Nations Security Council, 2025-10-17
- 沙蒙2:Disttrack擦除程序卷土重来Unit 42, 2016-11-30
- APT33:对伊朗网络间谍活动的观察Mandiant, 2017-09-20
- OilAlpha间谍软件被用于攻击人道主义援助组织Recorded Future
- 常规武器能力中的情报与目标信息Anthropic
- 多智能体大语言模型系统为何失败?arXiv, 2025-03-17