大语言模型的每个参数到底能储存多少信息

https://www.youtube.com/watch?v=_OTcigj2rwg

这期来自 最佳拍档 的视频解读了一篇发表于 ICML 2026 的重磅论文(由 Meta、DeepMind、康奈尔大学与 NVIDIA 联合完成)[[00:43]]。

视频核心解答了“大语言模型的每个参数到底能储存多少信息”,并从信息论的角度重新定义了 LLM 的“记忆”与“泛化”,主要内容包含以下几个核心重点:

核心要点总结

1. 记忆容量的精确量化:约 3.6 比特/参数

  • 实验结论:在常用的 BF16 格式下,GPT 类 Transformer 模型平均每个参数约能存储 3.6 比特(3.64 Bits)的信息 [[05:20]];若使用 FP32 单精度,该数值提升至 3.83 比特 [[05:25]]。
  • 测量方法:为了排除“泛化”干扰,研究人员使用完全无规律的随机比特串训练不同规模(50万~15亿参数)的模型 [[04:14]]。在此场景下模型无法学习规律,性能提升完全来自于对样本的“死记硬背” [[04:30]]。

2. 记忆与泛化的“相变”现象:“背不下去才开始学习”

  • 非预期记忆(Unintended Memory) vs 泛化(Generalization):论文将记忆拆解为“对具体训练样本的死记硬背”和“提炼出的通用规律/世界知识” [[03:32]]。
  • 相变过程
  • 数据集 < 模型容量:数据量很小、模型塞得下时,模型倾向于直接死记硬背,损失函数下降最快 [[07:08]]。
  • 数据集 > 模型容量:当训练数据量超过模型的存储上限时,模型“背不动了”,梯度下降迫使模型放弃硬背,转向寻找样本间的共享规律与模式 [[07:18]]。死记硬背的记忆量开始下降,而泛化能力开始快速上升 [[06:55]]。

3. 解释“双下降(Double Descent)”现象

  • 论文解释了深度学习中经典的“双下降”现象发生的位置:恰好发生在训练数据量与模型记忆容量接近 1:1 的临界点上 [[08:06]]。当跨过这个容量临界点后,随着数据继续增加,泛化能力增强,测试损失重新开始下降 [[08:14]]。

4. 数据安全与隐私启示(成员推断攻击)

  • 识别概率取决于比值:成员推断(判断某段文本是否在训练集中)的效果主要取决于“模型容量 / 训练集大小”的比值 [[08:40]]。在数万亿 Token 的大模型中,普通/平均样本的成员推断准确率接近随机猜想(F1 接近 0.5) [[09:05]]。
  • 稀有样本风险依然极高:虽然平均样本很安全,但 TF-IDF 值高、稀有罕见的内容(例如非英语语料、公司内部文档、敏感客户数据、专有代码等)被模型硬背并泄露的概率依然很高 [[09:42]]。

总结与延伸思考

视频指出,模型参数并不是简单的“硬盘”,而是一个混合体 [[11:22]]。这项研究不仅为理解大模型的 Scaling Law(标度律)和数据配比提供了量化起点 [[12:01]],也为未来大模型的机器无痕擦除(Machine Unlearning)与隐私保护指明了方向 [[13:13]]。

Total
0
Shares
Leave a Reply

Your email address will not be published. Required fields are marked *

Previous Post
openai-presence-sells-enterprise-ai-agents-with-engineers-attached

OpenAI Presence sells enterprise AI agents with engineers attached

Related Posts