大模型的护城河到底在哪?

不止一次看到很多严肃的投资者在不同场合讨论这个问题。

很早的时候李飞飞教授说:"算法往往是可商品化的……但真正要理解的是你的数据来源、如何创建数据飞轮、数据护城河在哪里。"

我个人觉得大模型的护城河在数据以及场景。当然,这里的数据包括专有领域数据和处理数据的工程能力。场景决定了你的大模型能为多大规模的用户创造多大的价值。如果我们的判断没有错,那么浩浩荡荡的AI技术革命下,更有潜力的可能是上游和下游,而不是模型本身。

先追溯下历史。

2018 年 6 月,OpenAI 发布了 GPT-1——1.17 亿参数的 Transformer 解码器,在当时的 NLP 领域引发震动,但并未被大众所知。八年后,2026 年 7 月的 LMSYS Arena 排行榜上,Claude Opus 4.6-thinking 以 1512 Elo 位居榜首,而开源阵营的 GLM-5.1 以 1475 Elo 紧随其后,差距仅 37 分。这 37 分的差距,放在 2023 年 12 月是 141 分。放在 2025 年 1 月是 0 分——DeepSeek R1 在那个月与闭源模型并驾齐驱。

所以这里主流模型之间互相交错进步的趋势非常明显。没有谁一直保持全面领先。

时间 模型 参数规模 训练数据规模 关键评测表现 意义
2018 GPT-1 117M ~5GB BooksCorpus 预训练+微调刷新多项 NLP 纪录 验证 Transformer 预训练范式可行性
2018 BERT 340M 16GB BooksCorpus + Wikipedia GLUE 88.5 双向架构引发预训练热潮
2019 GPT-2 1.5B 40GB WebText 零样本涌现能力 展示大模型零样本学习潜力
2019 T5 11B 750GB C4 统一文本到文本框架 数据规模开始成为关键变量
2020 GPT-3 175B ~300B tokens (570GB filtered CC) MMLU 43.0 (5-shot) 少样本学习确立 Scaling Law 地位
2021 Codex 12B 159GB GitHub + 公开代码 HumanEval 28.8% 代码数据对编程能力的作用
2022 InstructGPT 1.3B/6B/175B 人工指令数据 + RLHF 人类偏好显著优于 GPT-3 后训练对齐数据成为关键
2022 Chinchilla 70B 1.4T tokens 同等算力下大幅超过 GPT-3 数据量与参数量应同步扩大(20:1)
2022 PaLM 540B 780B tokens MMLU 69.3,GSM8K 58.0 大规模稀疏训练探索
2023 GPT-4 未公开 未公开 MMLU 86.4,HumanEval 67.0,GSM8K 92.0 多模态与推理能力全面提升
2023 Llama 2 7B/13B/70B 2T tokens MMLU 68.9 (70B) 开源权重可接近 ChatGPT
2023 Phi-1 1.3B 7B 教科书级代码数据 HumanEval 50.6% 数据质量可超越 15B 模型
2023 Mistral 7B 7B 未公开 MMLU 60.1 小模型开源性能标杆
2024 Llama 3 8B/70B/405B 15T tokens MMLU 87.3 (405B),HumanEval 89.0 开源模型逼近 GPT-4;数据/参数比 1875:1
2024 Phi-3-mini 3.8B 高质量数据 MMLU 69.4 数据质量进一步压缩模型体积
2024 DeepSeek V3 671B MoE 14.8T tokens MMLU 88.5,HumanEval 82.6 开源对标 GPT-4o,成本大幅下降
2024 Qwen2.5 0.5B–72B 18T tokens MMLU 86.1 (72B) 开源生态全面覆盖尺寸
2025 DeepSeek R1 671B MoE 强化学习 + 高质量推理数据 AIME 2024 79.8%,MATH-500 97.3%,GPQA 71.5% 纯 RL 激发推理能力,对标 o1
2025 Qwen3 0.6B–235B MoE 强化学习后训练 推理与 Agent 能力大幅增强 后训练数据策略成为竞争焦点
2025 Kimi K2 ~1T MoE 数据清洗 + 长上下文多模态 MMLU 90.5,GPQA 71.9,HumanEval 93.0 开源对标 GPT-4.5、Claude 3.7
2025.06 DeepSeek V4 671B MoE (37B active) 14.8T tokens GPQA Diamond 90.1%,SWE Verified 80.6%,HLE 37.7%,1M context,MIT license 开源模型在代码和推理上全面对标闭源;成本为 GPT-5.5 的 1/30
2025.08 GPT-5.0 未公开 未公开 统一标准 + 自动路由推理模型 OpenAI 首次统一标准模型与推理模型
2025.11 GPT-5.1 未公开 未公开 更温暖的响应,自适应推理 后训练个性化数据策略
2025.11 Gemini 3 Pro 未公开 未公开 2M context,多模态第 10 名 Google 凭借独家长文本数据建立差异化
2025.11 Claude Opus 4.5 未公开 未公开 价格降低 67%,输出 token 减少 76% 效率优化成为闭源新战场
2025.12 GPT-5.2 未公开 未公开 ARC-AGI-1 >90%,GPQA Diamond 92.8% 首次在抽象推理基准上突破 90%
2026.02 Claude Opus 4.6 未公开 未公开 1M context,Agent Teams 多智能体协作数据飞轮
2026.02 Claude Sonnet 4.6 未公开 未公开 Opus-level coding,94% computer use 中端模型首次追上代旗舰
2026.03 GPT-5.4 未公开 未公开 Native computer use,1M context 原生计算机使用能力
2026.04 Claude Opus 4.7 未公开 未公开 GPQA Diamond 94.2%,3x vision,xhigh effort 视觉数据质量提升
2026.04 Claude Mythos Preview 未公开 未公开 发现数千个零日漏洞,HLE 56.8%(最高记录) 因过于强大仅向关键基础设施合作伙伴限制发布——专有安全数据壁垒
2026.04 GPT-5.5 未公开 未公开 Terminal-Bench 82.7%,ARC-AGI-2 85.0%,FrontierMath T4 35.4% 全量基模型重训练,agentic 能力 SOTA
2026.05 Claude Opus 4.8 未公开 未公开 4x fewer code flaws,browser agent SoTA 代码安全数据壁垒
2026.05 OpenAI GPT-oss-120b/20b 120B/20B MoE 未公开 o4-mini level performance,Apache 2.0 OpenAI 首次发布开源权重模型
2026.06 Claude Fable 5 / Mythos 5 未公开 未公开 Fable 5: safeguarded;Mythos 5: safeguards lifted 安全对齐数据的差异化
2026.06 GPT-5.6 Sol 未公开 未公开 SWE-bench Verified 96.2%FrontierMath T4 83%ARC-AGI-2 92.5% 当前最强综合性能
2026.07 Kimi K3 2.8T MoE 未公开 GPQA Diamond 93.5%(开源最高),Terminal-Bench 88.3% 开源模型在博士级推理上首次超越多数闭源模型
2026.07 GLM 5.2 753B 未公开 Terminal-Bench 82.7%,HLE 54.7%,Vellum 开源榜 #1 终端代理数据壁垒
2026.07 MiniMax M3 未公开 未公开 GPQA Diamond 93%,SWE Verified 80.5% 推理 specialist
2026.07 Gemma 4 31B 31B dense 未公开 MMLU 85.2%,GPQA 84.3%,SWE 80.0% 本地部署标杆,证明小模型+高质量数据可行

如果我们回到底层数学原理,用国外的测评数据(LMSYS Arena、MMLU、GPQA、SWE-bench、ARC-AGI、Humanity's Last Exam)做交叉验证,大概也会有这样一个印象,就是大模型的每一次技术跃迁都在削弱整体"技术壁垒",同时放大"数据资产"的权重。

自从2017 年 6 月Vaswani 等人发表《Attention Is All You Need》之后,所有主流大模型——从 GPT 到 Claude,从 Gemini 到 DeepSeek,从 Llama 到 Kimi都在采用基本相同的底层数学框架。实际上, DeepSeek-V4 的技术报告里面就明确说了:"所有语义计算、上下文联动,全程沿用原版缩放点积注意力公式,所有优化都是外围提速增效,底层语义匹配原理和标准 Transformer 一模一样。"

这意味着,当李飞飞说"大家都是一样的 Transformer"时,她是在陈述一个数学事实。

不过应该有人会说,虽然架构同质化,但训练方法的创新(如 GRPO、RLVR、test-time scaling)仍然能带来阶跃式提升。DeepSeek R1 就是这样的例子。很多人把 DeepSeek R1 的成功归因于 GRPO 和 RLVR,但仔细读 R1 的技术报告会发现,真正的关键突破在于强化学习数据的构造与选择。

R1 自己的论文《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》中明确提到几个核心点:

  1. 可验证奖励数据:数学题(AIME、MATH)、代码题(LeetCode、Codeforces)等具有明确正确答案的任务,是 RL 训练的核心数据来源。这些数据必须是高质量的、难度分层的、避免污染的。
  2. 冷启动数据:在纯 RL 之前,R1-Zero 先用数千条高质量推理样本(人工标注 + 合成)做 SFT,然后才进行 RL。这批冷启动数据的质量直接决定了后续 RL 的收敛速度和上限。
  3. 语言一致性处理:为了防止模型在 RL 过程中出现中英混杂,团队对数据进行了筛选和格式化,这本质是数据清洗。
  4. 拒绝采样与蒸馏:从 R1 中采样生成高质量 SFT 数据,用于蒸馏到小模型。这更是数据合成与再利用。

换句话说,R1 的阶跃提升,是"RL 算法创新 + 高质量推理数据构造"共同作用的结果。 其中算法部分(GRPO)很快就公开了,但数据构造的细节、数据配比、清洗标准,才是更难复制的部分。

实际上,《Attention Is All You Need》之后,OpenAI 在2020 年 1 月发布了《Scaling Laws for Neural Language Models》(Kaplan et al. 这篇论文通过系统性实验得出了一个对行业影响深远的结论:

在参数量相同时,模型的宽度、深度、注意力头数等架构细节对性能的影响微乎其微,差距大部分在 2% 以内。

这个结论的数学表达是 Scaling Laws 的幂律公式:

L(N,D) = A/Nα + B/Dβ + L

其中 L 是测试损失,N 是参数量,D 是数据量,L 是不可约损失。性能与规模呈幂律关系——在对数坐标下是一条直线,但在普通坐标下是指数衰减

这意味着,模型性能不是由架构的"聪明程度"决定的,而是由规模(参数、数据、算力)的"堆砌程度"决定的。既然所有人都在同一条幂律曲线上爬行,算法本身就不可能构成护城河。

2022 年 3 月,DeepMind 的 Hoffmann 等人发表《Training Compute-Optimal Large Language Models》。他们训练了 400 多个模型(从 7000 万到 160 亿参数),发现了一个反直觉的结论:

对于固定训练预算,模型大小和数据量应按相等比例扩展,最优的数据与参数比例约为 20:1(即每个参数约 20 个 token)。

Chinchilla 本身只有 700 亿参数(GPT-3 的 40%),但训练了 1.4 万亿 tokens(GPT-3 的 4.7 倍)。结果是:Chinchilla 在绝大多数基准上全面超越了参数大它 2.5 倍的 Gopher(280B 参数)。

这篇论文的杀伤力在于,它证明了"堆参数"是一条效率极低的路径。 同样的算力,如果分配给更多高质量数据,可以用更小的模型达到更好的效果。这也为后来 DeepSeek 的"低成本追赶"奠定了理论基础。

这篇文章也间接说明腾讯 HY团队"去掉不合格数据,只用一半数据就让性能大幅提升",以及Kimi K3"团队大部分时间都在数据清洗上"这些报道基本是属实的。

其实,我们从开源和闭源模型的追赶态势也能看出竞争的残酷。

LMArena是目前国际上最受信任的模型质量评估平台,它由加州大学伯克利分校的 Large Model Systems Organization 运营,通过数百万用户的盲测投票,用 Elo 评分系统排名模型。

Arena 的历史数据揭示了一个震撼的追赶曲线:

时间节点 闭源 Leader 开源 Leader 差距
2023.05 Vicuna-13b (1075) Vicuna-13b (1075) 0(早期开源领先)
2023.12 GPT-4 (1200) Mixtral-8x7b (1059) 141 Elo
2024.12 o1 (1350) DeepSeek V3 (1315) 35 Elo
2025.01 GPT-4o-latest (1358) DeepSeek R1 (1358) 0 Elo
2025.06 Gemini 2.5 Pro (1450) DeepSeek R1-0528 (1424) 26 Elo
2026.07 Claude Opus 4.6 (1512) GLM-5.1 (1475) 37 Elo

39 个月内,榜首易主 18 次,涉及 7 家不同的机构。到 2025 年 1 月,DeepSeek R1 已经在 Arena 上与闭源模型差距为 0。到 2026 年 7 月,差距仅剩 37 Elo,这其实就是在统计误差边缘。

如果,我是说如果,未来模型性能差距非常接近,比如收敛到 5% 以内,那么成本效率就会成为新的竞争维度。

模型 输入 $/M tokens 输出 $/M tokens SWE-bench Verified
GPT-5.5 / 5.6 $5 $30 96.2%
Claude Fable 5 $10 $50 95.0%
DeepSeek V4 Pro $0.435 $0.87 80.6%
DeepSeek V4 Flash $0.14 $0.28 ~75%

当DeepSeek V4 Pro 以 GPT-5.5 1/30 的价格,达到了其 84% 的代码能力(80.6% vs 96.2%),那么如何选择情况就会发生本质变化。

2026 年的竞争格局进一步证明,算法同质化后,竞争转向了数据和场景的差异化

  • 前端编程:Kimi K3 在 Frontend Code Arena 以 1679 分反超 Claude 的 1631 分,首次有开源模型在编程盲测中登顶全球
  • 终端自主干活:GLM-5.2 在 Terminal-Bench 得分 81.0,超越 Claude
  • 长上下文:Gemini 3.1 Pro 凭借 1M tokens 窗口和 94.3% 的长文本召回率独孤求败
  • 博士级推理:GPT-5.2 在 GPQA Diamond 上 93.2%,而 Llama 4 Maverick 仅 69.8%——18 个百分点的差距在需要深度专业知识的领域依然真实存在

没有全能冠军,只有单项王者。 这恰恰是因为不同场景需要不同的专有数据——前端代码数据、终端操作日志、长文本法律合同、博士级科学文献——这些数据的获取和清洗能力,才是真正的差异化来源。

正如我开始所说,大模型的护城河在数据以及场景。更多用户产生更多交互数据,从而训练出更好模型,创造更好体验,由此带来更多用户。这是一个飞轮。本质上,每一次用户交互都在修正模型对真实世界分布的估计。竞争对手即便算法相同、算力相同,没有这些专有反馈数据就无法达到同等的分布逼近精度。

最后做一个总结。从最底层原理出发,我们大概可以给出结论:

1. 算法不是护城河。 Transformer 自 2017 年统一了架构,Scaling Laws 证明架构细节影响 <2%。所有顶尖模型都在同一条幂律曲线上爬行。

2. 算力不是护城河。 它是必要的入场券,但可购买、可优化、边际效益递减。DeepSeek 用 1/30 的成本达到了 84% 的性能,证明效率创新可以瓦解部分算力优势。当然,算力是另外一套完全不同的逻辑,我们今天并没有讨论。

3. 公开数据不是护城河。 互联网文本已被爬完,开源模型在 MMLU、Arena 等公开基准上已与闭源模型差距不到 3%。Epoch AI 的数据显示,开源追赶速度从 22 个月压缩到 0。

4. 专有数据 + 数据工程 + 数据飞轮,才是终极护城河。

  • 专有数据:企业内部的代码库、用户行为日志、专业领域知识库——这些无法从公开渠道获取;
  • 数据工程:清洗、去重、标注、配比、合成——这些"苦活脏活累活"决定了模型能否在极端数据比例下高效学习;
  • 数据飞轮:用户交互产生的反馈数据,形成正反馈循环,使领先者的分布逼近优势指数级扩大。

这些,指向了大模型的上游和下游,而不是大模型本身。