80亿参数记性不如U盘:他算出了大模型记忆天花板 - 53AI
High confidence: full text extraction produced 5881 characters.
微信扫码
添加专属顾问
大模型参数越多记忆越好?80亿参数模型记忆量仅U盘水平,论文揭秘其记忆天花板。核心内容:1. 大模型记忆容量真相:每个参数仅3.6 bit,80亿参数仅记住约两千分之一训练数据2. 论文背后故事:曾被NeurIPS拒稿,完善后获ICML 2026杰出论文提名3. 研究意义与应用:提出“记忆-泛化”新视角,已落地用于训练数据筛选
新智元报道
大模型的记性,比你想象中可能差远了。
一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。
可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
7TB数据灌进去,整个模型记得住的大约只有两千分之一。你往里塞再多,它也只装下这么点。
捅开这一真相的,是7月5日ICML 2026的一篇获奖论文,题目就叫《How much do language models memorize?》(《语言模型能记住多少东西?》)。
这篇在Meta做出来的论文,第一次给「大模型的记忆」称出了重量。
如果把大模型想象成一块闪存,它的容量一出厂就焊死:每个参数大约3.6 bit,填满一格,就少一格。
这些参数并非通往无限知识的入口,更像一根填满就再也塞不进去的存储条。
数据喂得再多,各模型的记忆量都会撞上自己的容量天花板。模型越大,天花板越高。
这篇论文的特别之处,不止它的观点,更在它背后的故事。
两年前,它先被NeurIPS拒了。
Morris没放弃,把实验重新清理、补做了一遍,两年后转投ICML,最终拿下ICML 2026杰出论文荣誉提名(Outstanding Paper Honorable Mention)。
奖项一公布,Morris难言兴奋,在X上写道:
他一一感谢了合作者,但也没客气:
让他高兴的,是论文里「大模型就像一块闪存」的容量理念,正被越来越多人接受。
而且这套方法已经落了地——至少一家前沿实验室,把它实打实用在了中期训练的数据筛选上。
作为研究员,Morris长期盯着语言模型的表征,从嵌入(embedding)到权重,追问的始终是同一个问题:信息,到底存在模型的什么地方。
这篇论文,算是他这条主线的一次集中交卷。
这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达,一头扎在工业界,一头连着学术界。
ICML官方的评价是:这项工作提出了区分「记忆」与「泛化」的新视角,理论底子扎实,又配上实打实的实测,撑起了那个3.6 bit的大胆结论。
只是两年前,人们还没意识到他这篇论文的分量。
这篇论文,打破了这些年大家一个默认的认知:
其中,一件重要的事一直没人说透:
模型到底是真「学会」了,还是只是把训练数据「背」了下来?
过去,衡量记忆的办法很粗糙。
要么想尽办法让模型把训练数据原样吐出来,要么去判断某条数据在不在训练集里。
但这两种方式,都没分清这样一件事:模型说出某句话,是因为它记住了,还是因为它真的会推理。
比如,你让模型算两个数相加,它没见过这道题也能答对。
这显然不算「记忆」。
Meta的研究团队所做的,是第一次把「记忆」和「泛化」彻底区分开。
他们的思路,借鉴了信息论(information theory):一条数据,如果在有模型帮忙的情况下能被压缩得更短,就说明模型「记住」了它。
压缩得越狠,记得越牢。
在这个框架里,记忆被拆成两块。
一块叫非预期记忆(unintended memorization),是模型死记硬背的、关于某个具体数据集的信息。
另一块叫泛化(generalization),是模型真正学到的、关于数据背后规律的东西。
把泛化那部分减掉,剩下的就是模型硬记下来的总量。
拿这个总量去除以参数规模,就得到了那个关键的比值:每个参数装了多少bit。
团队训了数百个从50万到15亿参数不等的Transformer,反复测量。
最终,结论都指向这样一个数字:
这就是它记忆的天花板。
GPT类模型每参数约3.64 bit,容量随参数线性增长。
要说明的是,这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。
它是在一套特定的信息论定义下,估算出的记忆容量。是模型「死记硬背」的上限,而不是它硬盘意义上的存储量。
这个比喻,戳破了两个关于大模型的认知。
第一,你以为大模型把训练数据都记住了?其实根本装不下。
现在每个主流大模型都在几万亿token上训练,可它们的容量压根塞不进这么多,数据早就溢出了。
第二,当灌进去的数据超过容量,模型反而会「变聪明」。它不再一条条死记,而是被逼着去找通用的规律。
这时候就冒出了所谓的双下降(double descent):损失先降后升再降。
记忆填满的那一刻,恰恰是泛化开始的起点。
数据量撑爆容量的那一刻,双下降出现,模型被逼着转向泛化。
论文里把这个转折叫作「顿悟」(grokking)的开端:模型记不下了,这才真正开始开窍。
在纯随机的比特串上,模型只能硬记,容量一填满就到顶。可换成真实文本,情形就变了。
模型先拿容量去记,记到装不下,就掉头用泛化来顶替死记,转而学那些能反复复用的通用模式。
记忆和泛化,在同一个模型里此消彼长。
所以,先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论,这篇论文证明的恰恰相反:正因为记不住,它才不得不学会举一反三。
这套框架还顺手回答了一个隐私问题:记不住,某种程度上反倒成了一种保护。
数据越多,成员推断越接近随机猜测(F1趋近0.5)。
既然大模型的容量早被海量数据撑爆,那想靠成员推断(membership inference)去反推某条数据在不在训练集里,就变得越来越难。
对绝大多数在天量数据上训练的模型来说,这事儿几乎测不准。
奖项背后,更让人感兴趣的,是这个发现对整个行业意味着什么。
如果参数容量真有上限,那「无脑堆参数」的路就看得见尽头了。因为模型再大,能记的东西也是有数的。
竞争的重心,会从「喂更多数据」转向一个更刁钻的问题:哪些数据,才值得被模型记住?
这正好呼应了这两年最热的几个方向:数据筛选、合成数据(synthetic data),以及中期训练(midtraining)阶段的数据选择。
同样的参数预算,喂进去的是高信息密度的精料,还是重复冗余的「水货」,结果会差出一大截。
谁能挑出那些最值得被模型记住的数据,谁就能在容量的天花板下,多榨出一分能力。
这意味着,Scaling Law的玩法也得变了。
过去十年,规矩简单粗暴:模型更大、数据更多、算力更猛,能力就往上走。
可一旦容量见了底,光靠加参数就不灵了。下一程的胜负手,大概率不在「多」,而在「准」。
Morris透露,他们这套方法,已经被至少一家前沿实验室拿去做中期训练的数据筛选了。
一篇两年前被拒、差点被埋掉的论文,正在悄悄改写真实的训练流程。
大模型的能力上限,已经不只看参数量,还看每个参数到底被喂了什么。
Morris,2025年底离开博士项目,拉着几位研究者创办了一家叫Engram的公司。
Engram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman(CEO)、Scott Linderman、Jessy Lin
2026年6月,Engram正式走出隐身,13个人的公司,一出场就带着9800万美元融资、6亿美元估值。
Engram押注的,恰好就是论文测出的那个限制。
模型容量有限,他们就干脆换了个打法:
他们号称在不少任务上能少烧10到100倍的token,效果还追平甚至压过前沿实验室。
微软、Notion、法律AI公司Harvey已经接入了他们的模型,投资人名单里还包括刚加盟Anthropic的Karpathy。
上线那天,Karpathy还在X上公开道贺。
为一家主打省token的创业公司捧场,Karpathy这份表态背后是整个行业的焦虑:AI账单正在失控,token越烧越多,成本压不住。
Morris给出的答案是把算力掉头——不砸向公共互联网,而去啃透你自己的语料。
在他看来,真正卡住AI的是记性,不是算力。
参考资料:
编辑:元宇
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-08-02
突发!OpenAI下一代AI攻克10项菲尔兹奖级难题
2026-08-01
迷信多Agent,结果可能比单Agent更蠢
2026-08-01
Claude 新模型的上下文工程:从堆规则到设计上下文
2026-07-31
Agent 小知识|让 Agent 调对工具:输入输出契约的设计
2026-07-31
阿里云刚发布的 AgentLoop 是什么?
2026-07-31
把最强模型丢进真实生活一个月,没有一个及格
2026-07-31
突发!DeepSeek V4 Flash史诗级更新,跑分直逼 Opus 4.8,价格不变,原生接入Codex
2026-07-31
大多人低估了codex voice,这才是史诗级更新。
2026-05-19
2026-06-10
2026-05-16
2026-06-04
2026-05-14
2026-05-12
2026-05-21
2026-05-28
2026-05-16
2026-05-06
2026-07-31
2026-07-30
2026-07-28
2026-07-28
2026-07-28
2026-07-26
2026-07-26
2026-07-25
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。