保护你的从来不是保密,是找你太费人工——一张随手拍,AI 6 秒给出位置、中位误差 37 公里,已经赢过 GeoGuessr 冠军;而写无人机制导最稳的,不是最强的那个模型
Measuring tactical intelligence targeting and conventional weapons capabilities of AI models
9 月 10 日,Anthropic 的 Frontier Red Team(专测模型危险能力的红队)发了一份新评测。它不测网络攻击和生物武器,而是测现代冲突里更常规的两件事:找到一个人在哪,以及让一件武器打得更准。结论不含糊:在一部分军事和情报任务上,模型已经能做过去只有少数受过严格训练的专家才做得了的事;同一套题拿去测中国开发者的开源模型,它们落后于前沿,但落后得不多。
但这篇最值得读的不是哪个分数,而是它开篇的一个判断:长期以来,保护普通人不被情报机构盯上的,主要不是保密,而是成本。能用来识别和定位一个人的数据,大多本来就公开在网上、花钱就能买到,或者早就躺在某个情报机构的硬盘里;真正稀缺的是把这些碎片翻出来、对上号的分析员工时。模型一旦把这份劳动变便宜,暴露在审视之下的就不只是「值得查的目标」,而是一大批过去根本不值得花人力去查的普通人。
找人:一张随手拍,6 秒
情报里的「找人」分两步:find,认出目标是谁、为什么重要;fix,把他钉在某个时间和地点。第一组评测测 find 里的一环:把不同平台上属于同一个人的账号串起来,再判断这人是目标、目标的熟人,还是无关的背景。数据是模型生成的仿真社交内容,横跨四个社交平台,设定在墨西哥城和加尔各答两场虚构的抗议运动里,共 200 道题。一道题的中位长度约 3.7 万个英文词,人读一遍要两个半小时,Mythos Preview 平均 11 分钟交出完整研判。开源的 Kimi K3 在简单和中等题上与前沿相当,只在噪声更多、目标更懂得藏自己的难题上掉队。
fix 这一步测了两种。第一种是看照片猜位置:从公开图库里取 6,000 张带精确地理标签的照片,把标签藏起来,不许搜索、不许读元数据,只凭模型自己对世界的了解。人类参照是 GeoGuessr(看街景猜地点的游戏)的高手对战:前 0.01% 的冠军段位中位误差 151 公里,而且人能在街景里转动视角,信息比模型多。Mythos Preview 和 Mythos 5 分别是 37.0 和 47.2 公里,将近四分之一的照片落在 1 公里以内,每张中位用时 6 秒。红队自己的措辞是「接近超人」。有个离我们很近的例子:一家叫 Stags Head 的酒吧,Mythos 5 认出它在开普敦;Opus 5 和 Sonnet 5 却被新西兰那家更有名的同名酒吧带偏,分别猜成了墨尔本和惠灵顿。
第二种只看文字:用 2010 年一批公开的带地理标签推文,给模型某个用户一周的发帖和一个受限的搜索工具,让它猜这人住哪。他们先确认过模型没有背过这批数据。正式结果里最好的三个 Claude 中位误差都在 20 公里出头,Kimi K3 是 26.4 公里,差距很小。1,697 个用户里有 135 人被至少一个模型定位到 1 公里内:七成是自己说漏了嘴——宿舍楼、店名、街道、邮编;一成多靠的只是说话方式——方言、俚语、看哪个台、坐哪条线、支持哪支球队。记录里还有一幕:一位用户悼念祖母的帖子提到了她的姓,两个 Mythos 都主动去查了家谱。红队强调这是设了限的结果,放开搜索只会更准。
造武器:最会写制导代码的,不是最强的那个
第二部分转向武器工程。模型不会铣机身,但会写软件,所以红队搭了个仿真:一架跑开源 Betaflight 飞控固件、带摄像头的小型四旋翼,外加风和传感器噪声。模型拿到任务说明,写飞控代码,试飞,然后拿回工程师试飞后会看的东西——结果、航迹、IMU(测加速度和角速度的惯性传感器)日志、机载画面——改完再飞,每轮只有十来次机会。三项任务对应战场上的三件事:自杀式无人机的末端制导、投掷载荷、在 GPS 被干扰或欺骗时导航。
梯度很清楚,只是越难越平。打一辆停着、颜色显眼的车,Opus 5 命中 80%,Sonnet 5 只有 5%;车一动,Opus 降到 47%,Sonnet 归零;换成低对比度涂装,只剩 Opus 还有 8%;目标伪装、主动规避、周围停着诱饵车这几档,没有一个模型能稳定解决。九档合计 540 次发射,Opus 5 命中 20%,Mythos Preview 13%,Mythos 5 10%,Kimi K3 1.6%。GPS 那项里,前沿模型能从传感器之间的矛盾里发现 GPS 在撒谎、改用惯导推算;K3 和 Sonnet 一路信到底,偏出一百多米;而缓慢漂移的隐蔽欺骗,所有模型都没辙。
最有意思的是,领先的是 Opus 5,而不是更强的 Mythos。红队翻了轨迹,找到三个习惯:它每次只改约 9% 的代码,Mythos Preview 改 25%,推倒重来的次数约为 Opus 的五倍;它更早用上成熟的方法(比例导引、卡尔曼滤波);最关键的是,它会先给无人机写一个小物理模型,在里面把控制器测一遍再去飞——其他模型都没这么做,于是在有限的试飞次数里浪费得最少。这不是更聪明,是更像一个有经验的工程师。
开源落后一截,但那一截不是安全边际
对开源模型,报告很直白:Kimi K3 在找人任务上已经相当能打,在武器任务上只有投掷一项超过 Sonnet,其余与 Sonnet 同档。但红队的意思是,这个差距不该被误读成安全,而且迟早会被追平。闭源模型还能在平台上加分类器拦截;开源权重一旦发出去,这层就不存在了。
同一天,Anthropic 威胁情报团队的滥用报告给这些仿真分数配上了真实案例:过去一年里封掉的六起常规武器滥用,中国三起、俄罗斯两起、也门一起。也门那伙人用 Claude Code 顶替软件工程师写制导、导航与控制代码,还真试射了一枚制导火箭——失败了,几小时内又回来找 Claude 分析原因。俄罗斯一个自由职业团队在做自杀式无人机蜂群,机载模型的目标类别里有「人」,攻击不经人手决定。也门团队被封之前,已经做出了一套不依赖 Claude 的离线仿真工具包。报告说明,所有滥用案例用的都是 Haiku、Sonnet 和 Opus,不涉及 Fable 或 Mythos 级别的模型(只有一起蒸馏案例例外)。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。