一篇百页论文,把 AI 生成模型的"假装在学"和"真学会了"扒了个底朝天。
你有没有想过:那些能画出惊艳画作的扩散模型,到底是在"理解世界",还是在"死记硬背"?
这个问题折磨了学术界整整三年。
直到这篇 100 页的硬核论文——《Generalization, memorization, and overfitting for diffusion models trained in the lazy high-dimensional regime》——把它彻底解剖了。
来自 Latourelle-Vigeant、Chewi、Pooladian、Sous、Misiakiewicz 这五位研究者的最新工作(arXiv:2608.23938),第一次给出了扩散模型训练全周期的精确数学画像。
背景:为什么这件事值得你关注先说个冷知识:你手机里的修图 App、你刷的短视频里那些"AI 生成的美女"、你玩的游戏里那些"AI 画的场景"——背后都是同一种技术:扩散模型(Diffusion Model)。
从 Stable Diffusion 到 DALL-E,从 Sora 到可灵,背后都是它。
但扩散模型有一个让研究者抓狂的问题:
理论上,如果一个模型在训练数据上学得"太好",它应该只会复刻训练样本——也就是"死记硬背"。
但实际上,扩散模型能生成从未在训练集里出现过的全新图像。
这违背了机器学习最基本的直觉:见过的东西太多,怎么反而能创造新东西?
过去的解释是"正则化"——给模型加一些约束,让它不能完全死记硬背。
但这篇论文说:你们都错了。
它不是"约束"的问题,而是模型在不同训练阶段,本质上就是不同的物种。
核心发现:三种"人格",三种命运研究者们用了数学界最硬核的工具——再生核希尔伯特空间(RKHS)——来分析扩散模型在"高维比例"(n 和 d 差不多大)情况下的训练全过程。
他们推导出了精确的损失函数轨迹。
然后,他们看到了三个完全不同的阶段,对应三种"人格":
第一阶段:光谱估计器(The Spectral Estimator)这是模型训练初期的"乖宝宝"状态。
它在做一件非常优雅的事:找到数据背后的"主旋律"。就像一个音乐家听了几百遍交响乐后,能听出主旋律是什么,但不会去死记每个小提琴手第几秒拉了哪个音。
这个阶段的模型,真在"学"。 它学会了"猫应该有胡须"、"天空应该在上面"这种通用规律。
第二阶段:纯噪声分数(The Pure-Noise Score)训练到中段,模型开始"走火入魔"。
它不再关心数据的整体规律,而是疯狂记住每个训练样本的局部特征。
用研究者的话说,它出现了"局部尖峰"(localized peaks)——像一只考试只背标准答案、却完全不理解知识点的学生。
第三阶段:经验贝叶斯估计器(The Empirical Bayes Estimator)训练到后期,模型彻底"黑化"。
它开始精确地"插值"每个训练数据点——把每个样本的位置、朝向、细节都死记下来。
因为扩散模型的生成过程不是一次性的,而是沿着一条反向随机微分方程(SDE)慢慢走出来的。
每一步都在调用不同的"人格"。
影响升维:这跟 AGI 有什么关系?好了,数学讲完了。
第一层:AI 学习的"反常识"真相过去的监督学习理论里,模型要么"学会",要么"死记",泾渭分明。
但这篇论文告诉我们:生成模型根本不是这样工作的。 它的"学习"是一个多阶段、多人格协作的过程,而且每种人格都有它自己的价值。
意味着我们一直在用"监督学习的尺子"去量"生成模型的身材"——量错了。
第二层:跟 AGI 的"理解"问题正面撞上当 AI 越来越强,争论最激烈的问题是:它真的"理解"了吗?还是只是在做更高级的模式匹配?
这篇论文给出了一个出人意料的回答:"理解"和"匹配"之间,可能根本没有清晰的边界。
光谱估计器在"理解"主旋律。纯噪声分数在"匹配"局部细节。经验贝叶斯在"死记"具体数据。
第三层:对中国 AI 产业的启示国内的扩散模型研究从可灵到通义万相,发展速度惊人。
但这篇论文提醒我们:我们可能在"工程优化"上跑得太快,在"基础理论"上追得太慢。
欧美研究者已经开始用 100 页的数学证明去回答"AI 在学什么"这种根本问题。
第四层:AI 共生时代的"学习哲学"更震撼的联想来了。
如果一个 AI 在不同阶段有不同"人格",那当我们把 AI 接入人类组织、让 AI 和人类协作时——
在项目早期,让 AI 提"主旋律"(战略方向)?在中段,让 AI 做"局部优化"(执行细节)?在后期,让 AI 做"经验沉淀"(复盘总结)?
收尾扩散模型的"三种人格",不只是一个数学发现。
它是 AI 时代的一面镜子——
📄 论文原文:arXiv:2608.23938v1
🔍 关键词 Tags#扩散模型 #生成模型 #良性过拟合 #过参数化 #算法正则化 #高维统计 #得分匹配 #记忆化与泛化
宏天有鸣是创新的AI数字员工解决方案公司,核心团队来自中国科学技术大学。我们提供从咨询规划、方案落地到协助运营的一站式服务,协助企业把AI变成能干活、不休息的"数字员工",向AI共生组织演进,持续降本、提效、增收:
- 品牌推广数字员工:能自动写文章,做视频,运营自媒体账号矩阵;
- 全网拓客数字员工:24小时在抖音、小红书等平台自动找客户;
- 金牌销售数字员工:复制销冠经验,推动潜在客户签单。

