大模型越学越死板?这个新方法让知识真正"长进"模型里

大模型越学越死板?这个新方法让知识真正"长进"模型里

家的AI,今天又"金鱼记忆"了吗?

刚刚,arXiv上炸了一篇论文——直指所有大模型最怕的那个字:

你以为给它喂了新文档,它就学会了?它只是死记硬背了几个字!换个问法、换种说法,它立马翻车。更狠的是,它学不会"举一反三"。

今天这篇论文,要彻底解决这件事。

全世界的大模型都在被同一个问题折磨:怎么把新知识"真正"塞进脑子里

现在的标准做法,叫监督微调(SFT)。说白了,就是给模型一本教材,让它死记硬背。

听起来很合理对吧?

SFT 让模型背下了"爱因斯坦提出了相对论"这句话,但它真的"理解"相对论吗?你换个问法——"是谁提出了相对论?"它能答。但你再问"相对论的核心思想是什么?",它就懵了。

更糟的是,你把三篇文档里的知识混在一起问它,它直接"短路"。

这就是死记硬背的代价:知识进不去脑子,只是粘在了表面。

arXiv 2608.25243v1 这篇论文,来自 Zhibo Hou 团队,他们提了一个新方法,叫 GRIN(Golden-GRPO Injection)

论文直达

核心就一句话:让知识真正"长进"模型里,而不是贴在表面上。

三件事。

传统强化学习需要模型自己"摸黑探索",对了给糖,错了打屁股。但新知识往往是"从未见过"的,模型一开始啥都不会,探索一百次都是错的,信号全是噪声。

Golden-GRPO 的绝招是:在模型探索失败时,直接塞一个"标准答案"进去当拐杖。

这就像学骑自行车——你歪歪扭扭要倒的时候,有人在后面扶你一把。这个"扶",就是"golden answer"(黄金答案)。

有了这个"学习信号",模型才知道往哪使劲。

  • 先用"黄金答案"引导模型探索正确方向;
  • 再让模型脱离拐杖,自己滚一遍 rollout;
  • 最后用强化学习把"标准答案"和"自己摸索的答案"的差距压到最小。

整个过程,模型不是在"背课文",而是在"练内功"。

  • Blank:测"从没见过的知识能不能学会"(novel acquisition);
  • Counter:测"错误的老知识能不能被覆盖掉"(counterfactual overwrite)。

每个基准都考三档难度:单条事实回忆、多文档综合检索、推理性问答。

在"难问题"上(多源检索、推理问答),GRIN 远超 SFT 和传统强化学习基线;在"简单问题"上(单条事实回忆),它至少打平。

翻译成人话就是:SFT 能背的书,GRIN 也能背;SFT 背不下来的,GRIN 能拿下。

查看论文原文

但这件事真正让人后背发凉的,不是技术突破本身。

它们只是统计学意义上的"复读机"。

SFT 把这个复读机调得更像那么回事儿了,但内核没变。你问它"特朗普是哪国人",它答"美国"。你问"特朗普是哪个党的",它答"共和党"。但你问"特朗普的竞选主张有哪些",它就开始"一本正经地胡说八道"。

而 GRIN 做的事情,本质上是让模型从"死记硬背"升级到"融会贯通"

这意味着什么?

人怎么学知识?看一遍不够,做题不够,教别人一遍才算真的会。GRIN 的"强化学习+黄金答案"机制,某种程度上就是在模拟"教别人"这个过程——模型必须把知识"讲清楚"(推理正确),才算真的掌握了。

你想想,AGI 最大的障碍是什么?不是算力,不是数据,是持续学习能力。一个会"忘记"的智能体,永远不可能是通用智能。

GRIN 这类方法,正是通向那个"不会忘记的大脑"的钥匙。

但更深的意义在于:它改变了"人机协作"的范式。

当 AI 真正能"吸收"知识,而不是"背诵"知识时,我们给它的每一条指令、每一份文档,才不会成为"沉没成本"。

最后说一句大实话。

而那个时代的入口,可能就是今天这篇看起来"技术味儿十足"的论文。

⚠️ 二阶升维彩蛋:你以为 GRIN 只是解决了"忘记"?它真正解决的,是人与 AI 之间的信任成本。当 AI 终于能"举一反三",我们才敢把关键决策交给它。而这,正是 AGI 时代的第一块基石。

📄 论文原文arXiv:2608.25243v1

🔍 关键词 Tags

#持续知识注入 #大语言模型 #强化学习 #群体相对策略优化 #自我学习框架 #知识泛化 #持续学习 #微调

关于我们
宏天有鸣是创新的AI数字员工解决方案公司,核心团队来自中国科学技术大学。我们提供从咨询规划、方案落地到协助运营的一站式服务,协助企业把AI变成能干活、不休息的"数字员工",向AI共生组织演进,持续降本、提效、增收:
- 品牌推广数字员工:能自动写文章,做视频,运营自媒体账号矩阵;
- 全网拓客数字员工:24小时在抖音、小红书等平台自动找客户;
- 金牌销售数字员工:复制销冠经验,推动潜在客户签单。