- Published on
AI并非比数学家更聪明,而是比他们记得更多
- Authors
- Name
- rzk
- davidepiffer.com

AI的优势:记忆而非推理
当AI系统解决一个困难的数学问题时,通常的解释是它变得更聪明了。它可能吸收了数百万个数学例子,或者通过强化学习学会了更好的推理策略,甚至可能开始发展出某种类似数学直觉的能力。这些解释可能都包含一些真理,但它们忽略了一个更简单的可能性:AI拥有比人脑大得多的工作记忆。更准确地说,它拥有一个巨大的外部符号化工作空间,执行了许多人类工作记忆的功能。
一个人类数学家只能同时在脑海中记住少量不熟悉的元素。而一个AI模型可以在其上下文窗口中保留整个问题陈述、数百个中间方程、几种被放弃的方法、定义、约束和早期结论。我们通常将由此产生的表现解释为卓越推理能力的证据。但其中一部分可能仅仅反映了人类推理中最重要的生物限制之一被移除:我们极其有限的工作记忆容量。
数学受限于记忆
工作记忆是让我们在短时间内保持和操作信息的心理系统。在解方程时,你必须记住每个变量代表什么,已经执行了哪些操作,以及当前的目标是什么。在证明过程中,你可能需要跟踪假设、中间引理、例外情况和多种可能的情况。
人类的工作记忆非常有限。尝试在脑海中计算两个三位数的乘积。底层的运算很简单,困难主要来自于在执行额外计算的同时必须保留部分结果。把数字写下来就改变了问题。纸并没有让你更聪明,它扩展了你的有效工作记忆。同样的原理适用于更高层次的数学。数学家使用符号、草稿纸、图表和之前写下的引理,不仅仅是为了交流解决方案,更是为了使推理在认知上成为可能。
专家通过“组块化”来弥补。新手看到一长串符号,而专家识别出一个熟悉的结构并将其视为一个单一的概念对象。这使得更多信息能够被塞进相同的生物工作记忆限制内。但组块化并没有消除限制,它只是压缩了信息。
工作记忆预测数学表现,超越智商
工作记忆对数学的重要性不仅仅是理论上的。它在人与人之间的差异中可见一斑。工作记忆与一般智力密切相关,这引出一个问题:它是否独立预测数学表现,还是仅仅是智商的另一个不完美衡量标准?
多项研究表明,工作记忆贡献了超越传统智力测量的东西。例如,Alloway 和 Passolunghi(2011)研究了儿童的工作记忆、语言能力和数学技能。他们发现,工作记忆测量对数学表现做出了独特的贡献,而不仅仅是复制了数学与一般语言能力之间的关联。
在一项为期六年的纵向研究中,Alloway 和 Alloway(2010)测量了五岁儿童,并在六年后检查了他们的学业成就。即使在分析中包含了智商,早期的工作记忆表现也能预测后来的读写和计算能力。事实上,工作记忆比研究中使用的智商测量更能预测后来的学业成果。
Blankenship 及其同事(2015)也报告说,在统计上控制了智商和年龄后,工作记忆解释了数学流畅性和计算中的独特变异。Friso-van den Bos 及其同事(2013)的一项大型元分析也发现,在小学阶段的研究中,工作记忆与数学之间存在一致的关系,尽管关系的强度因所测量的工作记忆和数学任务类型而异。
这些发现不应被夸大。工作记忆和智力在很大程度上重叠,统计控制无法完美地将它们作为独立的心理机制分离出来。证据也不意味着商业性地训练工作记忆必然会在智力或数学上产生巨大改善。然而,更狭窄的结论仍然重要:在具有相似测量智力的儿童中,保持、更新和操作信息能力的差异仍然预测了数学表现的差异。
这为理解AI提供了一个关键线索。如果人类的数学表现部分受到工作记忆瓶颈的限制,那么给机器一个巨大的符号化工作空间就改变了竞争的性质。机器可能看起来在数学上更聪明,部分原因是它受制于一个抑制人类表现的认知限制要少得多。
上下文窗口是一个巨大的笔记本
一个现代语言模型可以一次处理大量的token序列。这个序列可能包括原始问题、定义、例子、中间计算以及模型自身的早期推理。上下文窗口与人类的工作记忆并不相同。它最好被理解为一个巨大的外部笔记本,结合了一个用于搜索和使用其中内容的、不完美的系统。
这个区别很重要。人类拥有一种主动的内部记忆形式。我们可以默默地选择一个数字,在脑海中保持它,转换它,并用一个新值替换它,而无需说出或写下任何东西。标准语言模型在维持这种私有的、持续更新的心理状态方面要弱得多。它们最稳定的记忆形式通常是已经生成的token序列。
如果模型写下:x=6,然后写下:x+3=9,这些语句仍然保留在上下文中。模型可以在生成下一步时再次关注它们。因此,它的推理通常是外部化的。文本不仅仅是已完成思维过程的报告,文本是推理发生机制的一部分。人类在使用草稿纸时也会做类似的事情。
主要区别在于规模。一个未经辅助的人类可能难以同时保持五个不熟悉的条件处于活跃状态。而AI可以以显式形式保留数十个或数百个条件。这并不意味着长上下文中的每个项目都能被完美检索。模型可能会忽略相关信息、分心或丢失细节。广告宣传的上下文长度并不等同于完美可用的记忆。尽管如此,潜在容量的差异是巨大的。
为何这对数学尤其重要
上下文窗口的优势并非在所有类型的推理中都同样有用。它对数学尤其重要,因为数学推理可以异常良好地转化为显式符号。数学问题的几乎所有相关元素都可以被写下来:假设、定义、已知方程、当前目标、已证明的结果、已被排除的情况、每一步仍然有效的条件。
一旦写下来,这些信息就保持稳定。如果x在证明开始时被定义为整数,那么除非证明明确改变定义,否则它仍然是整数。一个严格不等式不会因为情绪、上下文或解释的变化而逐渐变成非严格不等式。数学符号旨在减少歧义。这使得数学几乎完美地适用于通过大型文本工作空间运行的智能。
考虑一个需要求解器记住以下条件的问题:n是奇数;p是素数;x≠0;并且论证的一个分支已经产生了矛盾。一个人可能理解基本策略,但在确定x≠0之前就除以x。这个错误不一定是由缺乏智力引起的,它可能是一个记账失败。AI可以在每个阶段重述活动约束:我们正在假设n是奇数、p是素数且x≠0的条件下工作。上下文变成了推理状态的分类账。
许多困难的数学问题在开头附近包含深刻的洞察,但之后也包含大量不那么光鲜的工作:展开表达式、检查情况、通过变换携带条件,以及确保最终结论与每个早期假设兼容。机器不需要拥有比人类更深刻的洞察力就能在此获得优势。它可能只是更有能力在完成一长串操作时保留问题的整个状态。
长推理链可能超出人类能力
数学是高度组合的。一个证明通常可以表示为:A → B → C → D。如果每一步都有效并且链条被准确保留,那么结论就成立了。一个大的工作空间允许模型在失去线索之前构建更长的链条。这很重要,因为问题的难度不仅取决于每一步的难度,还取决于必须协调多少步。
一个人可能完全理解一个100步论证中的每一个局部推理,但仍然无法独立生成整个论证。问题超出了个人维持全局结构的能力。AI可以通过写下几乎所有内容来潜在地弥补这一点。这可能解释了为什么额外的“思考时间”通常会提高模型性能。更多的计算允许系统产生更多的中间状态,检查替代分支,并保留部分结论。看起来像是更深思熟虑的东西,有时可能是在一个更大的笔记本内进行的更广泛的搜索。
非形式化推理则不然
现在将一个数学问题与一个社会问题进行比较:为什么Maria突然不再回复我的消息?一个更大的上下文窗口可能允许AI检查多年的通信。它可以识别语气、时间和词汇的变化。但决定性的信息可能仍然缺失。也许Maria生气了,也许她很忙,也许她病了,也许她丢了手机,也许她在回避一个无关的问题。没有多少记忆能检索到从未被观察到的事实。
挑战不仅仅是保留一组已知的前提并推导出它们的后果。它是在关于隐藏原因的不确定性下进行推理。非形式化推理也严重依赖于含义不稳定的概念。诸如“公平”、“成功”、“负责”、“有害”或“聪明”之类的词并不具备数学变量的精确性。它们的含义取决于文化、目标和上下文。一个模型可以记住讨论中的每一句话,但仍然误解参与者的意思。这同样适用于政治分析、历史研究等领域。
原标题:AI isn’t outthinking mathematicians, it’s out-remembering them。 HN 原始发布时间:2026年8月16日星期日。当前记录为 589 分、485 条评论。