大模型的护城河到底在哪?
不止一次看到很多严肃的投资者在不同场合讨论这个问题。
很早的时候李飞飞教授说:"算法往往是可商品化的……但真正要理解的是你的数据来源、如何创建数据飞轮、数据护城河在哪里。"
我个人觉得大模型的护城河在数据以及场景。当然,这里的数据包括专有领域数据和处理数据的工程能力。场景决定了你的大模型能为多大规模的用户创造多大的价值。如果我们的判断没有错,那么浩浩荡荡的AI技术革命下,更有潜力的可能是上游和下游,而不是模型本身。
先追溯下历史。
2018 年 6 月,OpenAI 发布了 GPT-1——1.17 亿参数的 Transformer 解码器,在当时的 NLP 领域引发震动,但并未被大众所知。八年后,2026 年 7 月的 LMSYS Arena 排行榜上,Claude Opus 4.6-thinking 以 1512 Elo 位居榜首,而开源阵营的 GLM-5.1 以 1475 Elo 紧随其后,差距仅 37 分。这 37 分的差距,放在 2023 年 12 月是 141 分。放在 2025 年 1 月是 0 分——DeepSeek R1 在那个月与闭源模型并驾齐驱。
所以这里主流模型之间互相交错进步的趋势非常明显。没有谁一直保持全面领先。
| 时间 | 模型 | 参数规模 | 训练数据规模 | 关键评测表现 | 意义 |
|---|---|---|---|---|---|
| 2018 | GPT-1 | 117M | ~5GB BooksCorpus | 预训练+微调刷新多项 NLP 纪录 | 验证 Transformer 预训练范式可行性 |
| 2018 | BERT | 340M | 16GB BooksCorpus + Wikipedia | GLUE 88.5 | 双向架构引发预训练热潮 |
| 2019 | GPT-2 | 1.5B | 40GB WebText | 零样本涌现能力 | 展示大模型零样本学习潜力 |
| 2019 | T5 | 11B | 750GB C4 | 统一文本到文本框架 | 数据规模开始成为关键变量 |
| 2020 | GPT-3 | 175B | ~300B tokens (570GB filtered CC) | MMLU 43.0 (5-shot) | 少样本学习确立 Scaling Law 地位 |
| 2021 | Codex | 12B | 159GB GitHub + 公开代码 | HumanEval 28.8% | 代码数据对编程能力的作用 |
| 2022 | InstructGPT | 1.3B/6B/175B | 人工指令数据 + RLHF | 人类偏好显著优于 GPT-3 | 后训练对齐数据成为关键 |
| 2022 | Chinchilla | 70B | 1.4T tokens | 同等算力下大幅超过 GPT-3 | 数据量与参数量应同步扩大(20:1) |
| 2022 | PaLM | 540B | 780B tokens | MMLU 69.3,GSM8K 58.0 | 大规模稀疏训练探索 |
| 2023 | GPT-4 | 未公开 | 未公开 | MMLU 86.4,HumanEval 67.0,GSM8K 92.0 | 多模态与推理能力全面提升 |
| 2023 | Llama 2 | 7B/13B/70B | 2T tokens | MMLU 68.9 (70B) | 开源权重可接近 ChatGPT |
| 2023 | Phi-1 | 1.3B | 7B 教科书级代码数据 | HumanEval 50.6% | 数据质量可超越 15B 模型 |
| 2023 | Mistral 7B | 7B | 未公开 | MMLU 60.1 | 小模型开源性能标杆 |
| 2024 | Llama 3 | 8B/70B/405B | 15T tokens | MMLU 87.3 (405B),HumanEval 89.0 | 开源模型逼近 GPT-4;数据/参数比 1875:1 |
| 2024 | Phi-3-mini | 3.8B | 高质量数据 | MMLU 69.4 | 数据质量进一步压缩模型体积 |
| 2024 | DeepSeek V3 | 671B MoE | 14.8T tokens | MMLU 88.5,HumanEval 82.6 | 开源对标 GPT-4o,成本大幅下降 |
| 2024 | Qwen2.5 | 0.5B–72B | 18T tokens | MMLU 86.1 (72B) | 开源生态全面覆盖尺寸 |
| 2025 | DeepSeek R1 | 671B MoE | 强化学习 + 高质量推理数据 | AIME 2024 79.8%,MATH-500 97.3%,GPQA 71.5% | 纯 RL 激发推理能力,对标 o1 |
| 2025 | Qwen3 | 0.6B–235B MoE | 强化学习后训练 | 推理与 Agent 能力大幅增强 | 后训练数据策略成为竞争焦点 |
| 2025 | Kimi K2 | ~1T MoE | 数据清洗 + 长上下文多模态 | MMLU 90.5,GPQA 71.9,HumanEval 93.0 | 开源对标 GPT-4.5、Claude 3.7 |
| 2025.06 | DeepSeek V4 | 671B MoE (37B active) | 14.8T tokens | GPQA Diamond 90.1%,SWE Verified 80.6%,HLE 37.7%,1M context,MIT license | 开源模型在代码和推理上全面对标闭源;成本为 GPT-5.5 的 1/30 |
| 2025.08 | GPT-5.0 | 未公开 | 未公开 | 统一标准 + 自动路由推理模型 | OpenAI 首次统一标准模型与推理模型 |
| 2025.11 | GPT-5.1 | 未公开 | 未公开 | 更温暖的响应,自适应推理 | 后训练个性化数据策略 |
| 2025.11 | Gemini 3 Pro | 未公开 | 未公开 | 2M context,多模态第 10 名 | Google 凭借独家长文本数据建立差异化 |
| 2025.11 | Claude Opus 4.5 | 未公开 | 未公开 | 价格降低 67%,输出 token 减少 76% | 效率优化成为闭源新战场 |
| 2025.12 | GPT-5.2 | 未公开 | 未公开 | ARC-AGI-1 >90%,GPQA Diamond 92.8% | 首次在抽象推理基准上突破 90% |
| 2026.02 | Claude Opus 4.6 | 未公开 | 未公开 | 1M context,Agent Teams | 多智能体协作数据飞轮 |
| 2026.02 | Claude Sonnet 4.6 | 未公开 | 未公开 | Opus-level coding,94% computer use | 中端模型首次追上代旗舰 |
| 2026.03 | GPT-5.4 | 未公开 | 未公开 | Native computer use,1M context | 原生计算机使用能力 |
| 2026.04 | Claude Opus 4.7 | 未公开 | 未公开 | GPQA Diamond 94.2%,3x vision,xhigh effort | 视觉数据质量提升 |
| 2026.04 | Claude Mythos Preview | 未公开 | 未公开 | 发现数千个零日漏洞,HLE 56.8%(最高记录) | 因过于强大仅向关键基础设施合作伙伴限制发布——专有安全数据壁垒 |
| 2026.04 | GPT-5.5 | 未公开 | 未公开 | Terminal-Bench 82.7%,ARC-AGI-2 85.0%,FrontierMath T4 35.4% | 全量基模型重训练,agentic 能力 SOTA |
| 2026.05 | Claude Opus 4.8 | 未公开 | 未公开 | 4x fewer code flaws,browser agent SoTA | 代码安全数据壁垒 |
| 2026.05 | OpenAI GPT-oss-120b/20b | 120B/20B MoE | 未公开 | o4-mini level performance,Apache 2.0 | OpenAI 首次发布开源权重模型 |
| 2026.06 | Claude Fable 5 / Mythos 5 | 未公开 | 未公开 | Fable 5: safeguarded;Mythos 5: safeguards lifted | 安全对齐数据的差异化 |
| 2026.06 | GPT-5.6 Sol | 未公开 | 未公开 | SWE-bench Verified 96.2%,FrontierMath T4 83%,ARC-AGI-2 92.5% | 当前最强综合性能 |
| 2026.07 | Kimi K3 | 2.8T MoE | 未公开 | GPQA Diamond 93.5%(开源最高),Terminal-Bench 88.3% | 开源模型在博士级推理上首次超越多数闭源模型 |
| 2026.07 | GLM 5.2 | 753B | 未公开 | Terminal-Bench 82.7%,HLE 54.7%,Vellum 开源榜 #1 | 终端代理数据壁垒 |
| 2026.07 | MiniMax M3 | 未公开 | 未公开 | GPQA Diamond 93%,SWE Verified 80.5% | 推理 specialist |
| 2026.07 | Gemma 4 31B | 31B dense | 未公开 | MMLU 85.2%,GPQA 84.3%,SWE 80.0% | 本地部署标杆,证明小模型+高质量数据可行 |
如果我们回到底层数学原理,用国外的测评数据(LMSYS Arena、MMLU、GPQA、SWE-bench、ARC-AGI、Humanity's Last Exam)做交叉验证,大概也会有这样一个印象,就是大模型的每一次技术跃迁都在削弱整体"技术壁垒",同时放大"数据资产"的权重。
自从2017 年 6 月Vaswani 等人发表《Attention Is All You Need》之后,所有主流大模型——从 GPT 到 Claude,从 Gemini 到 DeepSeek,从 Llama 到 Kimi都在采用基本相同的底层数学框架。实际上, DeepSeek-V4 的技术报告里面就明确说了:"所有语义计算、上下文联动,全程沿用原版缩放点积注意力公式,所有优化都是外围提速增效,底层语义匹配原理和标准 Transformer 一模一样。"
这意味着,当李飞飞说"大家都是一样的 Transformer"时,她是在陈述一个数学事实。
不过应该有人会说,虽然架构同质化,但训练方法的创新(如 GRPO、RLVR、test-time scaling)仍然能带来阶跃式提升。DeepSeek R1 就是这样的例子。很多人把 DeepSeek R1 的成功归因于 GRPO 和 RLVR,但仔细读 R1 的技术报告会发现,真正的关键突破在于强化学习数据的构造与选择。
R1 自己的论文《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》中明确提到几个核心点:
- 可验证奖励数据:数学题(AIME、MATH)、代码题(LeetCode、Codeforces)等具有明确正确答案的任务,是 RL 训练的核心数据来源。这些数据必须是高质量的、难度分层的、避免污染的。
- 冷启动数据:在纯 RL 之前,R1-Zero 先用数千条高质量推理样本(人工标注 + 合成)做 SFT,然后才进行 RL。这批冷启动数据的质量直接决定了后续 RL 的收敛速度和上限。
- 语言一致性处理:为了防止模型在 RL 过程中出现中英混杂,团队对数据进行了筛选和格式化,这本质是数据清洗。
- 拒绝采样与蒸馏:从 R1 中采样生成高质量 SFT 数据,用于蒸馏到小模型。这更是数据合成与再利用。
换句话说,R1 的阶跃提升,是"RL 算法创新 + 高质量推理数据构造"共同作用的结果。 其中算法部分(GRPO)很快就公开了,但数据构造的细节、数据配比、清洗标准,才是更难复制的部分。
实际上,《Attention Is All You Need》之后,OpenAI 在2020 年 1 月发布了《Scaling Laws for Neural Language Models》(Kaplan et al. 这篇论文通过系统性实验得出了一个对行业影响深远的结论:
在参数量相同时,模型的宽度、深度、注意力头数等架构细节对性能的影响微乎其微,差距大部分在 2% 以内。
这个结论的数学表达是 Scaling Laws 的幂律公式:
L(N,D) = A/Nα + B/Dβ + L∞
其中 L 是测试损失,N 是参数量,D 是数据量,L∞ 是不可约损失。性能与规模呈幂律关系——在对数坐标下是一条直线,但在普通坐标下是指数衰减。
这意味着,模型性能不是由架构的"聪明程度"决定的,而是由规模(参数、数据、算力)的"堆砌程度"决定的。既然所有人都在同一条幂律曲线上爬行,算法本身就不可能构成护城河。
2022 年 3 月,DeepMind 的 Hoffmann 等人发表《Training Compute-Optimal Large Language Models》。他们训练了 400 多个模型(从 7000 万到 160 亿参数),发现了一个反直觉的结论:
对于固定训练预算,模型大小和数据量应按相等比例扩展,最优的数据与参数比例约为 20:1(即每个参数约 20 个 token)。
Chinchilla 本身只有 700 亿参数(GPT-3 的 40%),但训练了 1.4 万亿 tokens(GPT-3 的 4.7 倍)。结果是:Chinchilla 在绝大多数基准上全面超越了参数大它 2.5 倍的 Gopher(280B 参数)。
这篇论文的杀伤力在于,它证明了"堆参数"是一条效率极低的路径。 同样的算力,如果分配给更多高质量数据,可以用更小的模型达到更好的效果。这也为后来 DeepSeek 的"低成本追赶"奠定了理论基础。
这篇文章也间接说明腾讯 HY团队"去掉不合格数据,只用一半数据就让性能大幅提升",以及Kimi K3"团队大部分时间都在数据清洗上"这些报道基本是属实的。
其实,我们从开源和闭源模型的追赶态势也能看出竞争的残酷。
LMArena是目前国际上最受信任的模型质量评估平台,它由加州大学伯克利分校的 Large Model Systems Organization 运营,通过数百万用户的盲测投票,用 Elo 评分系统排名模型。
Arena 的历史数据揭示了一个震撼的追赶曲线:
| 时间节点 | 闭源 Leader | 开源 Leader | 差距 |
|---|---|---|---|
| 2023.05 | Vicuna-13b (1075) | Vicuna-13b (1075) | 0(早期开源领先) |
| 2023.12 | GPT-4 (1200) | Mixtral-8x7b (1059) | 141 Elo |
| 2024.12 | o1 (1350) | DeepSeek V3 (1315) | 35 Elo |
| 2025.01 | GPT-4o-latest (1358) | DeepSeek R1 (1358) | 0 Elo |
| 2025.06 | Gemini 2.5 Pro (1450) | DeepSeek R1-0528 (1424) | 26 Elo |
| 2026.07 | Claude Opus 4.6 (1512) | GLM-5.1 (1475) | 37 Elo |
39 个月内,榜首易主 18 次,涉及 7 家不同的机构。到 2025 年 1 月,DeepSeek R1 已经在 Arena 上与闭源模型差距为 0。到 2026 年 7 月,差距仅剩 37 Elo,这其实就是在统计误差边缘。
如果,我是说如果,未来模型性能差距非常接近,比如收敛到 5% 以内,那么成本效率就会成为新的竞争维度。
| 模型 | 输入 $/M tokens | 输出 $/M tokens | SWE-bench Verified |
|---|---|---|---|
| GPT-5.5 / 5.6 | $5 | $30 | 96.2% |
| Claude Fable 5 | $10 | $50 | 95.0% |
| DeepSeek V4 Pro | $0.435 | $0.87 | 80.6% |
| DeepSeek V4 Flash | $0.14 | $0.28 | ~75% |
当DeepSeek V4 Pro 以 GPT-5.5 1/30 的价格,达到了其 84% 的代码能力(80.6% vs 96.2%),那么如何选择情况就会发生本质变化。
2026 年的竞争格局进一步证明,算法同质化后,竞争转向了数据和场景的差异化:
- 前端编程:Kimi K3 在 Frontend Code Arena 以 1679 分反超 Claude 的 1631 分,首次有开源模型在编程盲测中登顶全球
- 终端自主干活:GLM-5.2 在 Terminal-Bench 得分 81.0,超越 Claude
- 长上下文:Gemini 3.1 Pro 凭借 1M tokens 窗口和 94.3% 的长文本召回率独孤求败
- 博士级推理:GPT-5.2 在 GPQA Diamond 上 93.2%,而 Llama 4 Maverick 仅 69.8%——18 个百分点的差距在需要深度专业知识的领域依然真实存在
没有全能冠军,只有单项王者。 这恰恰是因为不同场景需要不同的专有数据——前端代码数据、终端操作日志、长文本法律合同、博士级科学文献——这些数据的获取和清洗能力,才是真正的差异化来源。
正如我开始所说,大模型的护城河在数据以及场景。更多用户产生更多交互数据,从而训练出更好模型,创造更好体验,由此带来更多用户。这是一个飞轮。本质上,每一次用户交互都在修正模型对真实世界分布的估计。竞争对手即便算法相同、算力相同,没有这些专有反馈数据就无法达到同等的分布逼近精度。
最后做一个总结。从最底层原理出发,我们大概可以给出结论:
1. 算法不是护城河。 Transformer 自 2017 年统一了架构,Scaling Laws 证明架构细节影响 <2%。所有顶尖模型都在同一条幂律曲线上爬行。
2. 算力不是护城河。 它是必要的入场券,但可购买、可优化、边际效益递减。DeepSeek 用 1/30 的成本达到了 84% 的性能,证明效率创新可以瓦解部分算力优势。当然,算力是另外一套完全不同的逻辑,我们今天并没有讨论。
3. 公开数据不是护城河。 互联网文本已被爬完,开源模型在 MMLU、Arena 等公开基准上已与闭源模型差距不到 3%。Epoch AI 的数据显示,开源追赶速度从 22 个月压缩到 0。
4. 专有数据 + 数据工程 + 数据飞轮,才是终极护城河。
- 专有数据:企业内部的代码库、用户行为日志、专业领域知识库——这些无法从公开渠道获取;
- 数据工程:清洗、去重、标注、配比、合成——这些"苦活脏活累活"决定了模型能否在极端数据比例下高效学习;
- 数据飞轮:用户交互产生的反馈数据,形成正反馈循环,使领先者的分布逼近优势指数级扩大。
这些,指向了大模型的上游和下游,而不是大模型本身。