大模型的能力边界
我们之前发表过一个观点,认为大模型厂商的护城河没有我们想象的那么宽,然而没有人会否认AI本身是一个巨大的科技浪潮,所以我们觉得AI的机会在应用而不是模型本身。如果是在应用,那么了解大模型能力边界是有价值的。这个"边界"本身也是动态变化的,我们只能基于最新的研究和数据来总结。
首先是组合泛化能力弱。
组合泛化能力就是把已经学会的几个简单技能,像搭积木一样组合起来,解决一个从来没见过的新问题。这种能力人类天生就具备。现在,告诉幼儿园小朋友"红色"、"圆形"和"大"分别是什么意思,他们会很自然轻松想象一个"红色大圆形"的东西,即使他们从来没见过。然而,如果在训练数据里没见过足够的"红色大圆形"样本,大模型就会出错或胡编。
这方面最新的研究来自Chollet, F. et al. (2026). ARC-AGI-2 and ARC-AGI-3: Measuring Compositional Abstraction and Fluid Intelligence in AI Systems. ARC Prize Technical Report. arXiv:2601.10904.
他们交给大模型一个对人类极其简单的任务,比如给每个形状补一个像素,让它变成正方形,要求模型只能从极少数示例中自主发现抽象规则,并组合运用。他们故意设置任务,让大模型训练时见过的原语(primitives)在测试时必须以全新组合方式出现。结果是,最顶尖的大模型最佳成绩是0.51%,而人类的基本线是85%,也就是大模型对这种没有见过的模式基本一无所知。
很多人会以编程能力来证明模型的泛化能力。这不能说明问题。
编程世界有一个特点:代码数据量巨大,且模式高度重复。大模型在海量代码上训练后,相当于建立了一个巨大的代码模式库。如果你让它写一个"带验证、日志、异步"的函数时,它不需要从零推理,而是能快速匹配到训练数据中出现过的相似组合。如果这个组合在训练数据中常见,它就能写得很好。另外,大模型生成代码后,自己可以立即执行、运行测试用例。如果代码有 bug,运行会报错;如果输出不符合预期,测试不通过。于是它可以利用自我修正:生成一个版本 → 运行 → 看到错误 → 根据错误信息重新生成 → 再运行。这个循环相当于用外部反馈来弥补推理的不足,而且只要算力足够,它输出的一般都是正确的,只不过在后端自我修正过非常多遍。
这不能反映模型的能力,反映的是高质量的训练数据和充沛的算力资源。
模型完全不具备人类的因果性认知能力。
这是 2026 年行业共识中最根本的结构性短板。
大模型的训练逻辑是,给定前文,预测下一个词的概率分布。它读过的文本里可能有"吸烟导致肺癌"这句话 100 万次,"肺癌患者常吸烟"这句话 80 万次。模型内部形成的不是"吸烟→致癌机制"的因果图,而是"吸烟"和"肺癌"这两个词在统计上的强相关性。
用 Judea Pearl (图灵奖得主)的话说,大模型被训练来建模 P(肺癌|吸烟)——即条件概率。但因果推断需要的是 P(肺癌|do(吸烟))——即干预概率。这两者在数学上是根本不同的对象。模型像是一个读了全世界所有医学论文的图书管理员。它能告诉你"几乎所有论文都提到吸烟和肺癌同时出现",但它本身不知道烟雾如何物理性地损伤肺泡;也没有实验能力,无法设计一个"强制随机分组让人吸烟/不吸烟"的对照试验来验证因果。
最新的综述《Evaluating Causality in AI Models》文章也明确说了,大模型能流畅使用"因为""所以""导致"等因果词汇,但这只是语言模式的统计复现。模型学会了"当 A 和 B 共现频率高时,用'导致'连接它们"这一表面规则,而不是真正理解 A 如何引发 B 。这也是为什么经常有人说大模型擅长一本正经地瞎说的原因。
一个实证案例
我认为,这个研究结论对我们每个深度使用AI的人至关重要。
我以前段时间写过一篇关于资源税的文章为例。
一开始,我通过AI帮助我找到国内和非洲刚果金最新的资源税政策的内容,要求它给出具体来源。这个模型处理迅速且完美。然后,我让它对比一下资源税出台时间点与国际铜价的相关性,这个处理也非常完美。
然后我问它,资源税导致铜价上涨的原因是什么?
它给出的逻辑链条是:
资源税↑ → 企业现金流↓ → 削减勘探投资→ 长期供给↓→ 未来价格↑
然后我又问它,资源税导致铜价下跌的原因是什么?
它给出的逻辑链条是:
资源税↑ → 企业预期未来税率继续提升→ 加速开采↓ → 短期供给↑→ 铜价价格↓
大家可以对比下。
我的意思是:1、大模型本身是会受到输入的影响(这里提问就是一种输入,回答就是输出);2、大模型只会拆解输入元素然后从已有的数据中匹配类似的模式进行输出。从头到尾,它没有思考。它一直在语料库中做模式匹配,只是因为训练的知识库本身包含人类提供的因果关系,所以它输出包含大量的真实知识,并高效地组合在一起。大模型不会真正因果关系思考,它极其擅长做相关性匹配。
泛化能力弱,意味着模型本身没有模式识别能力;没有因果关系推理能力,意味着它只是在人类知识库中匹配相关性最高的内容作为输出。这两点,既是模型的能力边界,也构成了当前的能力范围。我个人是看好AI前景的,但正如我们自己一样,认识到自身能力边界是重要的。