你有没有想过,一个价值几十亿的大模型,会被「翻几个比特」打成废铁?
不是黑客炫技的量子攻击,不是电影里按几下键盘就能瘫痪电网的神话。是一组精巧到令人发指的「土拨鼠攻击」——平均只动 4 个专家、翻转几个比特,就能让 MoE 大模型的输出暴涨 5912%。多数测试样本直接撞上 max tokens 的天花板。
更可怕的是,输出内容语义几乎不变。模型还在「好好说话」,但它说不完了。
这不是演习。EMNLP 2026 收录的论文 Groundhog Bit-Flip Attack 把这件事摆到了台面上。一个潜伏在 MoE 架构深处、从未被当作「攻击面」的角落,被人轻轻撬开了。
先说背景——为什么 MoE 是大模型的主流。
过去两年,几乎所有头部大模型都在走 Mixture-of-Experts(混合专家,简称 MoE)路线。GPT-4、Mixtral、DeepSeek-V3、Qwen3-MoE,全是这套架构。它的精髓在于「不把所有参数都激活」:一次推理只唤醒几个「专家子网络」,靠一个「路由层」决定哪几个专家出场。
这种设计带来两件事:算力效率和参数规模。你可以把模型做到 1.8 万亿参数,但每次推理只激活 200 亿——又大又省,全球大厂都在押注这条赛道。
但硬币的另一面是:架构越精巧,攻击面越隐蔽。
路由层像一个调度员,把 token 分发给不同的专家。研究人员发现一个惊人的事实——某些专家和某些 token 高度相关。比如「end-of-sequence」(结束符)这种关键 token,几乎被绑定在固定几个专家上。
换句话说,模型「什么时候闭嘴」,是被极少数专家「垄断」的。
这就是漏洞所在。
这篇论文的核心,用一个词概括:Groundhog(土拨鼠)。
为什么叫土拨鼠?因为攻击效果就是「无限循环生成」——像那只被堵在树洞里、每天撞一次地面的土拨鼠,一遍又一遍,永远停不下来。
攻击机制极其轻量:先识别路由层中和关键专家相关的比特位,然后翻转这些比特。比特翻转后,原本负责「终止生成」的专家被悄悄「关闭」或「错位」——模型仍然能正常输出语义,但失去了停止的能力。
论文的实验数据是恐怖的:
- 测试了 4 款主流 MoE 大模型;
- 平均只手动关闭不到 4 个专家;
- 平均输出膨胀 5912%;
- 多数测试样本直接撞上 max tokens 上限。
5912% 是什么概念?原本一个回答用 100 token,被攻击后平均要用掉 6000 多个 token。一次推理的算力成本暴涨 60 倍,而且这种增长是沉默的——账单上不会写「被攻击」三个字,只会写「token 用量异常」。
更值得注意的是,攻击覆盖了三种典型场景:对话、推理、智能体任务。也就是说,聊天机器人、数学推理、Agent 自动化——全场景沦陷。
论文给这种攻击起了个形象的名字:Denial-of-Wallet(钱包拒绝服务)。传统 DoS 攻击打瘫服务器,DoW 攻击打瘫你的信用卡。
第一,MoE 架构的安全假设被打破。
行业一直默认:只要模型权重加密、推理环境隔离、API 加签名,模型就是安全的。GBFA 直接把这个假设撕开——它不破密码、不偷数据,它只在你眼皮底下「微调」几个比特。这意味着任何有权访问模型权重的环节——从训练平台、推理服务器、到边缘部署设备——都是潜在的攻击入口。
第二,AI 时代的「物理破坏」门槛降到了前所未有的低点。
以往要瘫痪一个 AI 服务,需要 DDoS、挖漏洞、注入攻击。现在,一个懂比特位映射的内部人员,就能在 4 个专家上做手脚。这不是「黑客」行为,这是「运维失误」级别的操作。攻击面和运维面的界限,正在消失。
第三,这是 AGI 时代基础设施的「暗伤」预警。
我们正在用 MoE 搭建 AGI 的算力底座——DeepSeek、Qwen、Llama 全在走这条路。但「专家路由」这个设计本身,是为效率而生的,不是为韧性而生的。当整个行业的 AI 基础设施建立在这种「精巧但脆弱」的结构上,一次定向攻击就能让算力成本爆表。
第四,这是「AI 共生组织」的第一场安全压力测试。
未来每个企业都会和 AI 深度耦合,AI Agent 会直接调用 API、消耗 token。一个被「土拨鼠攻击」的 Agent,会在后台悄悄烧光公司整个云预算——而你甚至不知道它在做什么。AI 越智能,失控的成本就越高。
反直觉点在哪? 攻击没有让模型「胡说八道」,它让模型「正常工作但永不停止」。这比胡说八道更危险——因为现有的安全监控、输出审计、异常检测,全部失效。一个语义正常、长度异常的回答,不会触发任何告警。
5 年前,我们说「AI 模型是黑盒」。今天,模型权重可以被下载、被部署、被微调——整个 AI 行业的「物理形态」正在下沉到每一个机房、每一台边缘设备。但安全范式还停留在「加密 + 访问控制」的老路上。
土拨鼠攻击撕开的不是一扇窗,是整个 MoE 架构的承重墙。5912% 的算力账单,5912% 的沉默燃烧,5912% 的「一切都正常但账单不对」。
当 AI 学会一直说话,没人听见它停不下来。
参考链接- Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in Mixture-of-Experts LLMs through Bit Flips — arXiv:2608.25276v1, EMNLP 2026
📄 论文原文:arXiv:2608.25276v1
🔍 关键词 Tags#混合专家模型 #大语言模型 #位翻转攻击 #硬件故障注入 #拒绝服务攻击 #模型安全 #专家路由 #鲁棒性
宏天有鸣是创新的AI数字员工解决方案公司,核心团队来自中国科学技术大学。我们提供从咨询规划、方案落地到协助运营的一站式服务,协助企业把AI变成能干活、不休息的"数字员工",向AI共生组织演进,持续降本、提效、增收:
- 品牌推广数字员工:能自动写文章,做视频,运营自媒体账号矩阵;
- 全网拓客数字员工:24小时在抖音、小红书等平台自动找客户;
- 金牌销售数字员工:复制销冠经验,推动潜在客户签单。

