DeepSeek 技术论文揭示的中美AI竞赛真相

对 DeepSeek-V3.2 技术论文的分析,不只是架构上的创新,更是一份对在地缘政治约束下被迫承担的“算力税”的坦诚审视。

·姚迪·11 分钟
播客深读

用几分钟对谈拆解本文核心推演

00:00
00:00

DeepSeek 刚做了一件几乎没有 AI 公司会做的事。

他们在技术论文里,公开承认了自己的弱点。

不是那些模糊不清的企业公关话术。不是“未来有待改进的方向”这种空话。而是非常具体的、技术层面的承认:在哪些点上,他们落后于像 Gemini-3.0-Pro 这样的前沿模型。

更有意思的是:这些“弱点”,比任何基准测试都更能揭示当下全球 AI 竞争的真实格局。

我不会跟你说“DeepSeek 比 GPT-4 更强”(这不是重点)。我也不会跟你说“中国正在追赶”(那已经是既成事实)。我要做的是:带你读懂技术论文字里行间,看到美国制裁在无形中加上的那一层“算力税”,以及这种约束正在逼出的、出乎意料的创新路径。

下面是我从 DeepSeek-V3.2 结论部分读到的东西。这不只是一篇技术文档,而是一张“约束如何塑造创新路径”的路线图。

一、罕见的坦诚

先说说这篇论文哪里不一样。

大多数 AI 公司的论文,看起来都像精修过的营销文案:“业界最先进性能”“突破性成果”“前所未有的能力”。

DeepSeek 的结论部分不一样。

他们是这样写的(原意翻译):

尽管取得了这些成果,我们也坦诚地承认,与 Gemini-3.0-Pro 等前沿闭源模型相比,DeepSeek-V3.2 仍存在一定局限。首先,由于总训练 FLOPs 较少,DeepSeek-V3.2 在世界知识的广度上仍然落后于领先的专有模型。我们计划在后续版本中通过扩大全流程预训练算力来缩小这一知识差距。其次,在 token 效率上仍存在挑战;为了达到与 Gemini-3.0-Pro 类似的输出质量,DeepSeek-V3.2 通常需要更长的生成轨迹(即更多的 token)。未来我们将专注于优化模型推理链路的“智能密度”,以提升效率。第三,在解决复杂任务方面,我们依然不及前沿模型,这激励我们进一步打磨底层基础模型以及后训练配方。

再读一遍。

他们没有躲在企业官话后面,而是非常清楚地告诉你:自己差在哪里,原因是什么。

这种技术层面的坦诚,非常罕见,也极具信息量。

二、三个“差距”到底意味着什么

我们来拆解下,这三点承认背后真正说的是什么。

差距一:“世界知识”的问题

他们的诊断是:“总训练 FLOPs 较少”。

这是在直接承认:哪怕架构足够高效,真正的瓶颈依然是算力规模。

如果你想要“百科全书级”的世界知识覆盖,光靠聪明的结构不够,你必须砸下巨量算力去预训练。当你拿不到几乎无限的 H100 时,你就无法吞下同样规模和多样度的数据。

这就是可见的那部分“制裁税”。

“世界知识差距”,本质上就是算力稀缺所付出的代价。

他们给出的解决路径是:“在未来版本中扩大预训练算力规模”。

翻译成人话就是:我们已经证明架构是可行的,接下来需要的是更多芯片。

这透露出一个战略转向:在完成“效率验证”之后,准备从“极致效率”走向“规模扩张”。

差距二:“Token 效率”的挑战

他们的诊断是:“需要更长的生成轨迹才能匹配输出质量”。

这一点非常有意思。为了达到接近 Gemini 的质量,DeepSeek 需要“想得更久”,也就是生成更多 token,走更多推理步骤。

这是一次“延长思考时间,换取输出质量”的权衡。

代价很明确:延迟变高,推理成本也会上升。

对应的解决方案是:“优化智能密度”。

翻译一下:我们要训练模型,用更少的步数,走到同样甚至更正确的结论。

这是从“广度上的多想几步”(extensive reasoning),转向“单位步数更高价值的思考”(intensive efficiency)。

说白了,就是在不牺牲准确性的前提下,把推理链路压缩得更短、更密集。

差距三:“复杂任务”的问题

他们的诊断是:“复杂任务上的表现仍不如前沿模型”。

这暴露的是一个典型问题:书本型聪明 vs. 社会型聪明。

模型在纯逻辑推理上可能表现不错,但一旦面对真实世界里的复杂工作流——那些需要跨多个领域、串联多个步骤的任务——就容易失手。

给出的解决方向是:“进一步优化后训练能力”。

翻译成实际策略,就是:需要更好的人工反馈数据、更精细的对齐过程、更强的指令遵从能力。

这块,芯片数量反而没那么关键,数据质量和反馈结构才是决定性因素。

三、“制裁悖论”

现在我们把视角拉回到地缘政治。

显性的“税”

论文里那句直白提到“总训练 FLOPs 较少”,其实就是美国出口管制留下的技术脚印。

制裁在短期内确实起到了设想中的作用:它给中国开发者加上了一层“性能税”。

没有无限的 H100,你就没办法用同样的“暴力扩表”和“暴力扩模”方式,堆出同样级别的知识覆盖。

“知识差距”,就是算力稀缺的价格标签。

到这一步,一切还在“可预测”的故事线里。

非预期的后果

有趣的是,制裁带来了一个二阶效应:

被迫的“因缺思变”式创新。

当你拿不到“按规模规律生长”的那条路(更多算力 = 更好性能)时,你就不得不押注在“极致架构效率”上。

看 DeepSeek 实际做了什么:

  • DeepSeek Sparse Attention(DSA):通过稀疏注意力结构榨干每一点算力
  • 系统级优化:从硬件、系统、推理流程整体抠性能,而不是只往里堆 GPU
  • 面向中低端硬件的开放模型:让更弱的算力也能跑得动高质量模型

这说明,全球 AI 生态可能正在分化成两条演化路径。

路径一(美国):算力充沛 → 暴力扩展 → 模型更大 → 成本更高

路径二(中国):算力有限 → 架构极致高效 → 模型更精瘦 → 成本更低

于是,原本意在“遏制”的限制,反而可能在长期内孕育出一种更韧性、更具成本优势的技术路线。

一种正是因为“不得不在有限资源下做到可比性能”,才被逼出来的路线。

四、长期的走向

我们来想象一下,这条路往前推五到十年,会怎么样。

情景一:制裁“成功”

中国的 AI 开发长期被算力天花板压制,“世界知识”层面始终有缺口,在复杂任务上的表现也一直不够好。

美国通过硬件控制,持续维持 AI 领域的压倒性领先。

情景二:制裁“反噬”

在强制约束下,中国开发者绕过了硬件红利,逼自己走完一条极致优化之路:在 40% 成本水平上,做到“足够好”的性能。

然后,以极低推理成本的模型,向全球市场铺货、出海,压低整个行业的价格锚点。

美国公司在价格战和成本结构上,越来越难以竞争。

哪种更可能发生?

看看电动车、光伏、5G 基建的历史轨迹。

中国起步晚,受限制,起初落后。但正是这种落后和约束,逼出了极致的成本控制与工程优化。

最后的结果,是在这些行业里取得了成本端和规模端的主导权。

五、这跟你有什么关系?

你可能会想:“我又不造 AI 模型,这些跟我有什么关系?”

关系其实非常直接。

这个模式,会在几乎所有技术行业里不断重演:

第一:约束会逼出创新。当你不能简单地“砸钱砸资源”时,你就被迫想更聪明的解决方案。

第二:在趋于商品化的市场里,成本效率往往胜过极致性能。用 40% 成本做到“够用”的方案,通常会赢。

第三:地缘政治的限制,往往会在短期内制造优势,但在长期养出强劲对手。它延缓竞争,却不一定能阻止竞争。

第四:真正坦诚的技术披露极其罕见,也极其珍贵。当有人认真告诉你他们的弱点时,请认真听——那往往就是他们接下来几年要走的路线图。

策略上的启发

如果你正在一个资源受限的环境里做事,可以从 DeepSeek 抄几条“作业”:

第一:诚实面对自己的限制。你不正视的问题,根本无从优化。

第二:把约束变成优势。资源有限,反而会逼你在结构和流程上走向更优解。

第三:不只优化性能,更要优化效率。长期来看,单位成本的表现比单点极限性能更重要。

第四:分享成果,做生态,而不是做孤岛。开放出来、让更多人能在你之上构建,往往比单点闭源优势更有复利。

六、正在分叉的两条路

在我看来,正在发生的是这样一件事:

全球 AI 生态正被分成两条演化路径——不是因为有人有意设计,而是因为“约束”天然会雕刻出不同的演化方向。

美国路径:算力几乎无限 → 模型更大 → 成本更高 → 生态相对封闭

中国路径:算力受限 → 模型更高效 → 成本更低 → 更偏开放与下沉

五年后回头看,我们大概率会发现:制裁并没有“阻止”中国 AI 的发展。

它只是迫使这条路线长成了另一种形态。

而这种形态,可能在长期里更加可持续、更易规模化,也在价格战和普及速度上更有竞争力。

因为从长期来看,经济规律总是会接管一切。

七、应该关注什么信号?

如果你想判断 AI 接下来往哪儿走,下面这些指标,比单纯盯着“谁的模型参数更多”更关键:

第一:推理成本(Inference Cost)。谁能用最低成本服务最多用户,谁就会在应用层赢下大局。

第二:系统级优化能力。当你不能再“多加几块 GPU 解决问题”,就只能从架构、编译、调度、缓存、推理流程等全栈动手。

第三:开源生态的吸引力与渗透率。哪个平台能吸引更多开发者在上面构建应用,哪个生态就会形成正向飞轮。

第四:单位 token 成本(Cost per Token)。到 2030 年,这很可能才是决定行业格局的核心指标。

不是谁的基准测试分数最高,不是谁的模型最大,而是谁能用最低的 token 成本,提供足够好的智能服务。

八、真正的竞赛

现在所有人都在盯着:谁能造出最大的模型。

但真正的竞赛,其实是:谁能造出最划算的模型。

谁能用最低的成本,服务十亿级用户;谁能让开发者以极低门槛,用上足够强的智能能力;谁能把 AI 从“高价奢侈品”变成“基础设施级的日用品”。

这才是关键的赛道。

而 DeepSeek 在技术论文里的那一段坦诚,其实已经把他们的路线说得很清楚了:

不是靠拿到最多的算力,而是靠把手里有限的算力,发挥到极致。

那看似是一个“弱点”。

但在某种意义上,这也是一种更少被看见的实力——一种在资源约束下仍然持续进化的能力。

而在真正的长期博弈里,这种能力,往往更值钱。

认知地图延伸 · FURTHER READING

同主题深度文章推荐

查看全部文章 →

If you liked this:

My newsletter has more "signal → action" content.

Leave your email, and I'll send you new signals first.