2026-07-25

难而正确

这两天梁文锋的四小时讲话挺火的.
大致看了下有点挺有意思的.

一个是谈到对sota模型的理解.
按照讲话时间一个月前的话,应该指的是fable/mythos的激活参数量.
大概在800B左右.

这里比较有意思的是他关注的不是总参数量,而是激活量.

换个角度来说,目前scaling的方向即使还在参数量上的话,应该也是在激活参数部分.

用他的话来说,几百B的模型目前不是训练不出来.
而是可能是推理成本太高.
因为激活参数量带来的计算需求在当前的硬件水平不能很好地scale.

用这个视角看最近的gpt 5.6和fable/opus 5的话,也就能理解的.
各个尺寸和型号背后可能对应的就是不同激活参数的同一个基模了.

甚至可能本身就是某种动态裁剪MoE的结果.

对于国产模型来说的话,他的定位或者说最好预期可能也就是明年能出一个大概150B左右激活参数规模的模型.

也就是从纯参数量上来说,到时的国模sota总参数量跟国外SOTA可能还是会存在一个数量级的差距.

目前最近的GLM和Kimi激活参数量是大改在50B左右的.
相比DeepSeek V4 Pro的30B的规模大概是翻了一倍.

交叉一下,再用六个月的时间国产模型翻倍开始上100B也算是合理预期.

当然,这里可能还有点意外就是看Google会不会出一个新的模式.

毕竟按照当前Gemini 3.5的难产和Gemma的尝试非传统transformer模式来看的话.
Gemini直接4.0然后出新架构的可能性还是有的.

尤其考虑到相当一部分Transformer时代的人已经出走Google了.
往新架构迭代的思路上考虑的话,就很正常了.

不过即使有新架构,按照资本支出和全新架构推理芯片的研发消息来看,可能算力需求不一定会有下降.
或者至少计算推理模型可能会需要一种全新的方式,不然直接搞一个新芯片方案也不算合理.
毕竟TPU也迭代了几代了.

而说到芯片,就不得不说这篇讲话里另外一个有趣甚至于说是重点的部分了.

看得出来对某国产芯片厂商是有相当大的怨气的.

一方面可能是店大欺客的不被尊重感.

毕竟反复提到只给了DeepSeek一万多张卡,相比其他互联网公司20w的级别来说,可能确实有点侮辱人了.
尤其以DeepSeek当前的行业影响力来说.

而会被如此对待的原因可能也很简单.
可能纯粹就是从公司规模上来说,DeepSeek是家所谓的小公司.

因为没有明确的现金流和市场估值.
从纯粹资本角度来说,DeepSeek就像是诸多无名或者稍有名气的初创公司.

商务上可能不够成一个值得投入大量资源的公司.

所以某种程度上来说,梁文锋要公开市场化融资的一个直接原因就是这个.
通过市场化的估值去获得某种对等或者说应有的话语/谈判权.

而这里也某种程度上折射出他的某种解决问题的思路.

那就是他可能本人对这家公司也并不太喜欢.
但是他还是选择了这家公司作为某种vision的一部分.

就像他反复宣传的要用TileLang取代CUDA,用国产卡替换N卡.

非常符合鸡汤文化里的做难而正确的事这个人设.

当然,这个不妨碍他在这场面向投资人的会议里反复阴阳.

甚至当场说出虽然性能四换一,但是只要产能够,成本是N卡的两倍,预期卡寿命N看5年,该卡2年不到也是值得的皮里阳秋式发言.

结合之前坊间传闻的v4因为适配问题不断延期的说法.

算是实实在在的从精神到物理层面的做难而正确的事了.

不过从这个角度回头看v4 flash和v4 pro的话.
倒有可能v4 flash反而是用国产卡,而pro是用的N卡.

因为按照flash的参数量来看的话,倒是符合卡资源量.
以及推理速度上来说,符合专门优化的体现.

也符合pro没有量大管饱这一现象.
因为还需要N卡资源做其他的事.

尤其他在开始谈到的缺卡问题.
一方面是训练和面向终端用户的推理需求.

另一方面是可能更为关键的,用来做原型和实验的部分.

国产卡可能在生产场景是可替代了的.
但在更为复杂的迭代和探索过程,成熟的可能还是相对欠缺的.

所以实验卡更需要一些成熟稳定的硬件,去屏蔽解决非核心问题上花的时间.

而卡数量这方面,猜测可能20w卡的互联网大厂应该就是最近官宣国产集群的LongCat了.

当然,这个可能还是有一点信息滞后的.

毕竟讲话时间是在一个月前.

而且最近950超节点也官宣了.
按照之前的计划也是今年下半年开始量产.

所以这个20w卡的怨念应该也还是在产能爬坡前的有限范围内的供给问题.

不过按照他对SOTA模型需要5w张B卡的说法.
也就是DeepSeek可能需要大概20w张950.

这个能不能有,也确实有点未知数.

毕竟这个几乎就是之前全世界所有的卡数了.

最后一个比价有意思的就是他的成本和商业观念.

字面上看他对API的成本理解就是纯粹的卡成本投入.
所以有定价是10个月回本的说法.

而按照这个反推,也就是目前OpenAI/Anthropic的定价是一个月收回卡成本的.

这个和当前市场理解的AI Capx是有相当程度出入的.

假设双方的理解都是对的话.
那么这里imply的就是算力卡在整个AI算力支出上是一个可以忽略的部分.

大头可能是在数据中心本身和能源供给上面.
甚至还可能是意想不到的房地产和合规/ESG开支上面.

这样的话,中美的的AI成本和发展就存在着fundamental的不同了.
后期是如果考虑障碍在后者的话.

基于这点反观限制开源模型竞争的言论的话,倒是有自洽的地方的.
因为frontier的边际能力和卡限制不足以弥补其他方面的成本差距.

所以它关注的不再是模型能力差距本身,而是使用者/用户群的归属问题.

这就有点像夕阳行业里的存量竞争状态.
能活下来的是具有成本优势的.

而显然,在AI叙事的实际ROI存疑的前提下,成本的差距会更加放大这种用户选择.

当然,这个假设成立有一个隐含前提就是,DeepSeek口中的十个月收回成本对其他人也成立.

毕竟除了模型能力本身,DeepSeek的infra能力它的护城河之一.

而且梁文锋很明显地知道这个是他独有的商业模式之一.

没有其他人host的v4能跑出DeepSeek的性价比和效率.

而这点可能是其他国产模型需要思考的地方了.

尤其当你还是依赖N卡算力的时候,模型即使SOTA了,但是你自己不能够host.
或者没有足够资源host的时候,是无法变现的.

因为国外的云厂商有着更多的资源和更合规的使用手段.

最后就会演变成某种形式的中国制造叙事的反面.

国外有着更便宜的基建去host你的模型,使得你自己的产品在更广泛的市场上不具有任何竞争力.
从而活不下去.

这对于国产模型公司来说,可能是一个非常惨痛和可惜的结果.

因为这条全链路国产化本来是一条一荣俱荣一损俱损的道路.
虽然难,而正确.




没有评论:

发表评论

难而正确

这两天梁文锋的四小时讲话挺火的. 大致看了下有点挺有意思的. 一个是谈到对sota模型的理解. 按照讲话时间一个月前的话,应该指的是fable/mythos的激活参数量. 大概在800B左右. 这里比较有意思的是他关注的不是总参数量,而是激活量. 换个角度来说,目前scaling...