AI幻觉军事情报险些触发美国拦截行动

  |  

今年春天,一架美国战机已经升空,准备拦截一艘中国货船。然而,官员们在意识到此次行动的情报竟然是由聊天机器人捏造后,立即取消了行动。这一事件最初由CNN报道,随后TechCrunch和Ars Technica也进行了详细报道。这起事件已成为迄今为止最令人震惊的人工智能制造幻觉导致军事情报失误的案例之一——一位消息人士告诉CNN,这次险些酿成战争的事件“几乎引发了一场战争”。

要点总结

  • 美国一份情报报告错误地声称一艘中国船只运载着核武器计划部件,而这一结论是基于人工智能聊天机器人的臆想分析得出的。
  • 在官员发现错误之前,军用飞机已经升空,准备在空中支援下进行拦截。
  • 该聊天机器人将开源情报与机密信号情报融合在一起,然后将虚假调查结果格式化为看似官方的摘要。
  • 美国国防部同时也在扩大其在 GenAI.mil 平台上使用生成式人工智能工具的范围,包括谷歌的 Gemini for Government 和 Grok for Government。
  • Anthropic 公司的 Claude 无人机也曾为美国情报工作进行过定制,但由于该公司反对将其产品用于自主武器系统,于 3 月份被列入黑名单。

人工智能幻觉险些引发美军拦截中国船只

这份虚假情报报告源自美国特种作战司令部的一名分析员,他使用聊天机器人解读了与中国船只货物清单相关的数据。据美国有线电视新闻网(CNN)报道,“四位知情人士”称,最终生成的报告声称该船正在中东运输核武器项目的部件,并且该情报在两伊战争期间流传。TechCrunch报道称,该工具被使用了两次:第一次是用于综合分析材料,第二次是将错误的结论格式化成一份看似官方的、经过润色的摘要,然后逐级上报。

核成分的错误识别

据CNN报道,这款聊天机器人“将开源情报与政府掌握的秘密信号情报融合在一起”,结果却出了错。该工具错误地识别了船上的实际货物,得出的结论毫无事实依据,但读起来却足够令人信服,以至于被当作可信情报对待。

人工智能聊天机器人在生成错误报告中的作用

这就是美国军方使用生成式人工智能的危险之处:一份存在缺陷的输出结果,一旦被包装成正式报告,就能在指挥系统中流传,而不会有人质疑其来源。GovAI 的研究学者、美国陆军退伍军官杰克·斯泰克勒 (Jake Steckler) 告诉 TechCrunch,“军人必须了解低级逻辑模型 (LLM) 固有的不确定性”,并补充说,这一点对于“任何可能导致动用武力的决策,例如目标选择、情报分析或作战计划”都至关重要,因为“这些决策关乎生死”。

避免潜在的军事冲突

当官员们发现错误时,美军已经准备好在空中支援下拦截并登船。行动在最后一刻被取消。一位消息人士向CNN直言不讳地描述了这场险些酿成灾难的事件:“它差点引发一场战争”。Ars Technica指出,此案是已知人工智能系统产生幻觉并干扰专业报告的最具影响力的案例之一——自“幻觉”(hallucinate)一词在2023年被剑桥词典评为年度词汇以来,这种现象已经让作家、记者、法官、医生、警察部门和企业呼叫中心等都栽了跟头。研究人员认为,彻底消除大型语言模型中的幻觉可能几乎是不可能的。

美国国防部人工智能战略和工具

尽管出现了恐慌,但五角大楼推进更深层次军事人工智能安全整合的步伐并未放缓——恰恰相反,还在加速。今年1月,国防部推出了一项名为“人工智能加速战略”的计划,旨在“使所有相关数据在联合IT系统中可用,以用于人工智能的应用,包括各个军种和部门的任务系统”。

人工智能加速战略于1月份启动

国防部长皮特·赫格塞斯将这项计划的重点放在数据准备而非谨慎上:“人工智能的效能取决于它所接收的数据,我们将确保数据充足,”他在公布这项战略时说道。据国防部称,该计划的目标是加快决策速度,并保持五角大楼所称的“杀伤链”(即从探测目标到采取行动的一系列步骤)中的关键优势。

在 GenAI.mil 平台上使用 Google 的 Gemini 和 Grok

去年12月,国防部宣布将基于谷歌的Gemini for Government构建其定制的“GenAI.mil”平台。上个月,该平台又新增了Grok for Government作为第二个选项。到今年6月,一位五角大楼代表向国会报告称,生成式人工智能工具已被用于协助起草国会授权的报告,并且已有150万现役国防部人员在不同程度上使用过军方的生成式人工智能工具——这一规模凸显了这些系统在日常运作中已根深蒂固。

人形影视的克劳德模型及其被列入黑名单

Anthropic公司还为美国情报机构提供定制版的Claude模型。但该公司与五角大楼的关系一直不太顺利。今年3月,由于Anthropic公司拒绝将其模型用于自主武器系统,美国国防部将其列入黑名单。上个月,一位联邦法官裁定,此举构成“违反美国宪法第一修正案的非法报复”——这一裁决凸显了军方对人工智能能力的需求与一些人工智能开发者试图坚守的伦理底线之间的矛盾。

军事人工智能应用中的监管和伦理考量

这次险些酿成大祸的事件,恰恰印证了长期以来关于人工智能防御风险需要更强有力的人工审核,而不仅仅是更快的系统这一警告。2023年,美国国务院发布了《关于负责任地将人工智能和自主系统用于军事用途的宣言》,其中强调,武装部队“有原则地”使用人工智能“应包括对风险和收益的仔细权衡”,并应“最大限度地减少无意的偏见和事故”。该宣言还坚持认为,负责任地使用人工智能必须始终包含“人为因素,即负责任的人工指挥和控制链”。

美国国务院关于负责任使用人工智能的原则

该框架旨在指导应对今年春天发生的这类情况——一份人工智能生成的报告几乎引发了一场现实世界的军事行动。拦截命令下达之前,人机交互原则是否得到有效应用,正是这一事件提出的问题,因为错误的结论已经传递到足够高的层级,最终触发了武装行动的准备工作。

人为监督和“人机协同”机制

实际上,这个案例表明,当聊天机器人的输出看起来足够完美,足以以假乱真时,人工监督层可能薄弱得不堪。这不仅仅关乎个别事件:随着五角大楼150万人工智能用户越来越多地依赖这些工具进行分析、格式化和报告,虚假结论通过审查的可能性也随之增加,尤其是在速度被视为衡量成功的主要指标时。

自主武器的兴起及其引发的伦理问题

军事人工智能的整体发展轨迹加剧了事态的严重性。据 Ars Technica 援引的报道,全自动攻击无人机已在俄罗斯与乌克兰的冲突中使用,并由北约支持的军事承包商进行过测试。在此背景下,险些引发海上拦截的人工智能幻觉与其说是孤立的故障,不如说是一个早期预警信号,预示着自主和生成式人工智能系统正以前所未有的速度被纳入到关乎生死存亡的决策中。

常问问题

关于中国船只的虚假情报报告是如何产生的?

人工智能聊天机器人融合了开源情报和秘密情报,产生了幻觉,错误地将中国船只的货物识别为核部件。

美国军方距离根据虚假情报采取行动究竟有多近?

在发现错误之前,美军正准备在空中支援下拦截并登船检查这艘中国船只。

美国国防部在军事人工智能行动中使用哪些人工智能工具?

美国国防部在其 GenAI.mil 生成式人工智能平台中使用了谷歌的 Gemini for Government 和 Grok for Government。

美国军方在负责任地使用人工智能方面有哪些指导原则?

美国国务院 2023 年的声明强调,人工智能的使用应遵循原则,包括人工监督,并最大限度地减少风险和偏见。

本文由人工智能辅助生成,并经编辑团队审核。

推荐阅读