{"id":51572,"topic":"ai","source":"53AI","title":"80亿参数记性不如U盘：他算出了大模型记忆天花板 - 53AI","url":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","url_hash":"783bf5b88a98b5f0f27129e8f9183d888b7d53ae","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMicEFVX3lxTE4yM09vZEdyWGNDTTIxNEVQLVpvTHhjS3pNRzJfSkd2dTlnQ2Z0VEZ5MVE1LTZ0dF9YbXlfVW95NXFwNmdzVXNsNkRob2pUT0hHQ0xIVTJLZWFTcXh2cTRWQXd3Y1VDNzduRExVQ0lzMlc?oc=5\" target=\"_blank\">80亿参数记性不如U盘：他算出了大模型记忆天花板</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">53AI</font>","content":"微信扫码\n添加专属顾问\n大模型参数越多记忆越好？80亿参数模型记忆量仅U盘水平，论文揭秘其记忆天花板。核心内容：1. 大模型记忆容量真相：每个参数仅3.6 bit，80亿参数仅记住约两千分之一训练数据2. 论文背后故事：曾被NeurIPS拒稿，完善后获ICML 2026杰出论文提名3. 研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","image_url":null,"lang":"zh","published_at":"2026-08-02T08:46:46+00:00","fetched_at":"2026-08-02T09:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5881 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5881,"summary_length":5737,"usable_text_length":5881,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5881,"summary_length":5737}},"news_item":{"id":51572,"canonical_url":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","source_url":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","title":"80亿参数记性不如U盘：他算出了大模型记忆天花板 - 53AI","source_name":"53AI","author":null,"published_at":"2026-08-02T08:46:46+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMicEFVX3lxTE4yM09vZEdyWGNDTTIxNEVQLVpvTHhjS3pNRzJfSkd2dTlnQ2Z0VEZ5MVE1LTZ0dF9YbXlfVW95NXFwNmdzVXNsNkRob2pUT0hHQ0xIVTJLZWFTcXh2cTRWQXd3Y1VDNzduRExVQ0lzMlc?oc=5\" target=\"_blank\">80亿参数记性不如U盘：他算出了大模型记忆天花板</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">53AI</font>","full_text":"微信扫码\n添加专属顾问\n大模型参数越多记忆越好？80亿参数模型记忆量仅U盘水平，论文揭秘其记忆天花板。核心内容：1. 大模型记忆容量真相：每个参数仅3.6 bit，80亿参数仅记住约两千分之一训练数据2. 论文背后故事：曾被NeurIPS拒稿，完善后获ICML 2026杰出论文提名3. 研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","excerpt":"研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5881 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.53ai.com/news/LargeLanguageModel/2026080274618.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5881 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5881,"summary_length":5737,"usable_text_length":5881,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5881,"summary_length":5737}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"80亿参数记性不如U盘：他算出了大模型记忆天花板 - 53AI","url":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","summary":"研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","source":"53AI","date":"2026-08-02T08:46:46+00:00","content":"微信扫码\n添加专属顾问\n大模型参数越多记忆越好？80亿参数模型记忆量仅U盘水平，论文揭秘其记忆天花板。核心内容：1. 大模型记忆容量真相：每个参数仅3.6 bit，80亿参数仅记住约两千分之一训练数据2. 论文背后故事：曾被NeurIPS拒稿，完善后获ICML 2026杰出论文提名3. 研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.53ai.com/news/LargeLanguageModel/2026080274618.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5881 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5881 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5881,"summary_length":5737,"usable_text_length":5881,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5881,"summary_length":5737}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/51572","export_markdown":"/api/items/51572/export?format=markdown","export_json":"/api/items/51572/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.53ai.com/news/LargeLanguageModel/2026080274618.html"},"formats":{"full":{"id":51572,"title":"80亿参数记性不如U盘：他算出了大模型记忆天花板 - 53AI","url":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","source":"53AI","author":null,"published_at":"2026-08-02T08:46:46+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","full_text":"微信扫码\n添加专属顾问\n大模型参数越多记忆越好？80亿参数模型记忆量仅U盘水平，论文揭秘其记忆天花板。核心内容：1. 大模型记忆容量真相：每个参数仅3.6 bit，80亿参数仅记住约两千分之一训练数据2. 论文背后故事：曾被NeurIPS拒稿，完善后获ICML 2026杰出论文提名3. 研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5881 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.53ai.com/news/LargeLanguageModel/2026080274618.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5881 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5881,"summary_length":5737,"usable_text_length":5881,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5881,"summary_length":5737}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5881 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5881,"summary_length":5737,"usable_text_length":5881,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5881,"summary_length":5737}},"actions":{"read":"/item/51572","export_markdown":"/api/items/51572/export?format=markdown","export_json":"/api/items/51572/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.53ai.com/news/LargeLanguageModel/2026080274618.html"}},"digest":{"id":51572,"title":"80亿参数记性不如U盘：他算出了大模型记忆天花板 - 53AI","url":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","source":"53AI","topic":"ai","published_at":"2026-08-02T08:46:46+00:00","excerpt":"研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选 新智元报道 大模型的记性，比你想象中可能差远了。 一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。 可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。 7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。 捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 5881 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"80亿参数记性不如U盘：他算出了大模型记忆天花板 - 53AI","subtitle":"53AI · 2026-08-02","summary":"研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选 新智元报道 大模型的记性，比你想象中可能差远了。 一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。 可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。 7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。 捅开这一真相的，是7月5日ICML…","badges":["quality:high"],"links":{"read":"/item/51572","original":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","diagnose":"/api/diagnose?url=https%3A//www.53ai.com/news/LargeLanguageModel/2026080274618.html"},"quality_warning":null},"export":{"title":"80亿参数记性不如U盘：他算出了大模型记忆天花板 - 53AI","url":"https://www.53ai.com/news/LargeLanguageModel/2026080274618.html","summary":"研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","source":"53AI","date":"2026-08-02T08:46:46+00:00","content":"微信扫码\n添加专属顾问\n大模型参数越多记忆越好？80亿参数模型记忆量仅U盘水平，论文揭秘其记忆天花板。核心内容：1. 大模型记忆容量真相：每个参数仅3.6 bit，80亿参数仅记住约两千分之一训练数据2. 论文背后故事：曾被NeurIPS拒稿，完善后获ICML 2026杰出论文提名3. 研究意义与应用：提出“记忆-泛化”新视角，已落地用于训练数据筛选\n新智元报道\n大模型的记性，比你想象中可能差远了。\n一个80亿参数的大模型，一口气吞下15万亿token的训练数据，堆到硬盘上差不多7TB。\n可它真正「背」得下来的，少得可怜：每个参数只装得下3.6 bit。一个英文字母8 bit，连半个都填不满。\n7TB数据灌进去，整个模型记得住的大约只有两千分之一。你往里塞再多，它也只装下这么点。\n捅开这一真相的，是7月5日ICML 2026的一篇获奖论文，题目就叫《How much do language models memorize?》（《语言模型能记住多少东西？》）。\n这篇在Meta做出来的论文，第一次给「大模型的记忆」称出了重量。\n如果把大模型想象成一块闪存，它的容量一出厂就焊死：每个参数大约3.6 bit，填满一格，就少一格。\n这些参数并非通往无限知识的入口，更像一根填满就再也塞不进去的存储条。\n数据喂得再多，各模型的记忆量都会撞上自己的容量天花板。模型越大，天花板越高。\n这篇论文的特别之处，不止它的观点，更在它背后的故事。\n两年前，它先被NeurIPS拒了。\nMorris没放弃，把实验重新清理、补做了一遍，两年后转投ICML，最终拿下ICML 2026杰出论文荣誉提名（Outstanding Paper Honorable Mention）。\n奖项一公布，Morris难言兴奋，在X上写道：\n他一一感谢了合作者，但也没客气：\n让他高兴的，是论文里「大模型就像一块闪存」的容量理念，正被越来越多人接受。\n而且这套方法已经落了地——至少一家前沿实验室，把它实打实用在了中期训练的数据筛选上。\n作为研究员，Morris长期盯着语言模型的表征，从嵌入（embedding）到权重，追问的始终是同一个问题：信息，到底存在模型的什么地方。\n这篇论文，算是他这条主线的一次集中交卷。\n这项研究的八位作者横跨Meta、Google DeepMind、康奈尔、英伟达，一头扎在工业界，一头连着学术界。\nICML官方的评价是：这项工作提出了区分「记忆」与「泛化」的新视角，理论底子扎实，又配上实打实的实测，撑起了那个3.6 bit的大胆结论。\n只是两年前，人们还没意识到他这篇论文的分量。\n这篇论文，打破了这些年大家一个默认的认知：\n其中，一件重要的事一直没人说透：\n模型到底是真「学会」了，还是只是把训练数据「背」了下来？\n过去，衡量记忆的办法很粗糙。\n要么想尽办法让模型把训练数据原样吐出来，要么去判断某条数据在不在训练集里。\n但这两种方式，都没分清这样一件事：模型说出某句话，是因为它记住了，还是因为它真的会推理。\n比如，你让模型算两个数相加，它没见过这道题也能答对。\n这显然不算「记忆」。\nMeta的研究团队所做的，是第一次把「记忆」和「泛化」彻底区分开。\n他们的思路，借鉴了信息论（information theory）：一条数据，如果在有模型帮忙的情况下能被压缩得更短，就说明模型「记住」了它。\n压缩得越狠，记得越牢。\n在这个框架里，记忆被拆成两块。\n一块叫非预期记忆（unintended memorization），是模型死记硬背的、关于某个具体数据集的信息。\n另一块叫泛化（generalization），是模型真正学到的、关于数据背后规律的东西。\n把泛化那部分减掉，剩下的就是模型硬记下来的总量。\n拿这个总量去除以参数规模，就得到了那个关键的比值：每个参数装了多少bit。\n团队训了数百个从50万到15亿参数不等的Transformer，反复测量。\n最终，结论都指向这样一个数字：\n这就是它记忆的天花板。\nGPT类模型每参数约3.64 bit，容量随参数线性增长。\n要说明的是，这3.6 bit并不是说「一个参数只能塞3.6 bit文本」。\n它是在一套特定的信息论定义下，估算出的记忆容量。是模型「死记硬背」的上限，而不是它硬盘意义上的存储量。\n这个比喻，戳破了两个关于大模型的认知。\n第一，你以为大模型把训练数据都记住了？其实根本装不下。\n现在每个主流大模型都在几万亿token上训练，可它们的容量压根塞不进这么多，数据早就溢出了。\n第二，当灌进去的数据超过容量，模型反而会「变聪明」。它不再一条条死记，而是被逼着去找通用的规律。\n这时候就冒出了所谓的双下降（double descent）：损失先降后升再降。\n记忆填满的那一刻，恰恰是泛化开始的起点。\n数据量撑爆容量的那一刻，双下降出现，模型被逼着转向泛化。\n论文里把这个转折叫作「顿悟」（grokking）的开端：模型记不下了，这才真正开始开窍。\n在纯随机的比特串上，模型只能硬记，容量一填满就到顶。可换成真实文本，情形就变了。\n模型先拿容量去记，记到装不下，就掉头用泛化来顶替死记，转而学那些能反复复用的通用模式。\n记忆和泛化，在同一个模型里此消彼长。\n所以，先不要着急得出「大模型就是个数据库」「AI只是在背答案」这样的结论，这篇论文证明的恰恰相反：正因为记不住，它才不得不学会举一反三。\n这套框架还顺手回答了一个隐私问题：记不住，某种程度上反倒成了一种保护。\n数据越多，成员推断越接近随机猜测（F1趋近0.5）。\n既然大模型的容量早被海量数据撑爆，那想靠成员推断（membership inference）去反推某条数据在不在训练集里，就变得越来越难。\n对绝大多数在天量数据上训练的模型来说，这事儿几乎测不准。\n奖项背后，更让人感兴趣的，是这个发现对整个行业意味着什么。\n如果参数容量真有上限，那「无脑堆参数」的路就看得见尽头了。因为模型再大，能记的东西也是有数的。\n竞争的重心，会从「喂更多数据」转向一个更刁钻的问题：哪些数据，才值得被模型记住？\n这正好呼应了这两年最热的几个方向：数据筛选、合成数据（synthetic data），以及中期训练（midtraining）阶段的数据选择。\n同样的参数预算，喂进去的是高信息密度的精料，还是重复冗余的「水货」，结果会差出一大截。\n谁能挑出那些最值得被模型记住的数据，谁就能在容量的天花板下，多榨出一分能力。\n这意味着，Scaling Law的玩法也得变了。\n过去十年，规矩简单粗暴：模型更大、数据更多、算力更猛，能力就往上走。\n可一旦容量见了底，光靠加参数就不灵了。下一程的胜负手，大概率不在「多」，而在「准」。\nMorris透露，他们这套方法，已经被至少一家前沿实验室拿去做中期训练的数据筛选了。\n一篇两年前被拒、差点被埋掉的论文，正在悄悄改写真实的训练流程。\n大模型的能力上限，已经不只看参数量，还看每个参数到底被喂了什么。\nMorris，2025年底离开博士项目，拉着几位研究者创办了一家叫Engram的公司。\nEngram创始团队合影。左起Jack Morris、Sabri Eyuboglu、Dan Biderman（CEO）、Scott Linderman、Jessy Lin\n2026年6月，Engram正式走出隐身，13个人的公司，一出场就带着9800万美元融资、6亿美元估值。\nEngram押注的，恰好就是论文测出的那个限制。\n模型容量有限，他们就干脆换了个打法：\n他们号称在不少任务上能少烧10到100倍的token，效果还追平甚至压过前沿实验室。\n微软、Notion、法律AI公司Harvey已经接入了他们的模型，投资人名单里还包括刚加盟Anthropic的Karpathy。\n上线那天，Karpathy还在X上公开道贺。\n为一家主打省token的创业公司捧场，Karpathy这份表态背后是整个行业的焦虑：AI账单正在失控，token越烧越多，成本压不住。\nMorris给出的答案是把算力掉头——不砸向公共互联网，而去啃透你自己的语料。\n在他看来，真正卡住AI的是记性，不是算力。\n参考资料：\n编辑：元宇\n53AI，企业落地大模型首选服务商\n产品：场景落地咨询+大模型应用平台+行业解决方案\n承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业\n2026-08-02\n突发！OpenAI下一代AI攻克10项菲尔兹奖级难题\n2026-08-01\n迷信多Agent，结果可能比单Agent更蠢\n2026-08-01\nClaude 新模型的上下文工程：从堆规则到设计上下文\n2026-07-31\nAgent 小知识｜让 Agent 调对工具：输入输出契约的设计\n2026-07-31\n阿里云刚发布的 AgentLoop 是什么？\n2026-07-31\n把最强模型丢进真实生活一个月，没有一个及格\n2026-07-31\n突发！DeepSeek V4 Flash史诗级更新，跑分直逼 Opus 4.8,价格不变，原生接入Codex\n2026-07-31\n大多人低估了codex voice，这才是史诗级更新。\n2026-05-19\n2026-06-10\n2026-05-16\n2026-06-04\n2026-05-14\n2026-05-12\n2026-05-21\n2026-05-28\n2026-05-16\n2026-05-06\n2026-07-31\n2026-07-30\n2026-07-28\n2026-07-28\n2026-07-28\n2026-07-26\n2026-07-26\n2026-07-25\n欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。\n在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。\n一、 定义\n本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。\n会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。\n知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。\n二、 账号注册与登录\n登录方式：本网站支持以下登录方式，您可根据实际情况选择：\n微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。\n手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。\n账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。\n实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。\n未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。\n三、 服务内容与规范\n知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。\n服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。\n禁止行为：您在使用服务时不得实施以下行为：\n利用技术手段批量爬取、下载、转存知识库内容；\n将知识库内容用于商业目的或未经授权地向第三方传播；\n干扰本网站正常运行或侵犯其他用户合法权益；\n发布违法违规信息或从事违反公序良俗的活动。\n四、 知识产权声明\n权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。\n有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。\n侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。\n五、 个人信息保护\n我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读 《隐私政策》。\n您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。\n您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。\n六、 免责声明\n内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。\n不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。\n第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。\n七、 违约责任\n如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。\n如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。\n八、 法律适用与争议解决\n本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。\n因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。\n九、 其他\n本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。\n本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。\n我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.53ai.com/news/LargeLanguageModel/2026080274618.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5881 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5881 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5881,"summary_length":5737,"usable_text_length":5881,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5881,"summary_length":5737}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}