这两天梁文锋的四小时讲话挺火的.
大致看了下有点挺有意思的.
一个是谈到对sota模型的理解.
按照讲话时间一个月前的话,应该指的是fable/mythos的激活参数量.
大概在800B左右.
这里比较有意思的是他关注的不是总参数量,而是激活量.
换个角度来说,目前scaling的方向即使还在参数量上的话,应该也是在激活参数部分.
用他的话来说,几百B的模型目前不是训练不出来.
而是可能是推理成本太高.
因为激活参数量带来的计算需求在当前的硬件水平不能很好地scale.
用这个视角看最近的gpt 5.6和fable/opus 5的话,也就能理解的.
各个尺寸和型号背后可能对应的就是不同激活参数的同一个基模了.
甚至可能本身就是某种动态裁剪MoE的结果.
对于国产模型来说的话,他的定位或者说最好预期可能也就是明年能出一个大概150B左右激活参数规模的模型.
也就是从纯参数量上来说,到时的国模sota总参数量跟国外SOTA可能还是会存在一个数量级的差距.
目前最近的GLM和Kimi激活参数量是大改在50B左右的.
相比DeepSeek V4 Pro的30B的规模大概是翻了一倍.
交叉一下,再用六个月的时间国产模型翻倍开始上100B也算是合理预期.
当然,这里可能还有点意外就是看Google会不会出一个新的模式.
毕竟按照当前Gemini 3.5的难产和Gemma的尝试非传统transformer模式来看的话.
Gemini直接4.0然后出新架构的可能性还是有的.
尤其考虑到相当一部分Transformer时代的人已经出走Google了.
往新架构迭代的思路上考虑的话,就很正常了.
不过即使有新架构,按照资本支出和全新架构推理芯片的研发消息来看,可能算力需求不一定会有下降.
或者至少计算推理模型可能会需要一种全新的方式,不然直接搞一个新芯片方案也不算合理.
毕竟TPU也迭代了几代了.
而说到芯片,就不得不说这篇讲话里另外一个有趣甚至于说是重点的部分了.
看得出来对某国产芯片厂商是有相当大的怨气的.
一方面可能是店大欺客的不被尊重感.
毕竟反复提到只给了DeepSeek一万多张卡,相比其他互联网公司20w的级别来说,可能确实有点侮辱人了.
尤其以DeepSeek当前的行业影响力来说.
而会被如此对待的原因可能也很简单.
可能纯粹就是从公司规模上来说,DeepSeek是家所谓的小公司.
因为没有明确的现金流和市场估值.
从纯粹资本角度来说,DeepSeek就像是诸多无名或者稍有名气的初创公司.
商务上可能不够成一个值得投入大量资源的公司.
所以某种程度上来说,梁文锋要公开市场化融资的一个直接原因就是这个.
通过市场化的估值去获得某种对等或者说应有的话语/谈判权.
而这里也某种程度上折射出他的某种解决问题的思路.
那就是他可能本人对这家公司也并不太喜欢.
但是他还是选择了这家公司作为某种vision的一部分.
就像他反复宣传的要用TileLang取代CUDA,用国产卡替换N卡.
非常符合鸡汤文化里的做难而正确的事这个人设.
当然,这个不妨碍他在这场面向投资人的会议里反复阴阳.
甚至当场说出虽然性能四换一,但是只要产能够,成本是N卡的两倍,预期卡寿命N看5年,该卡2年不到也是值得的皮里阳秋式发言.
结合之前坊间传闻的v4因为适配问题不断延期的说法.
算是实实在在的从精神到物理层面的做难而正确的事了.
不过从这个角度回头看v4 flash和v4 pro的话.
倒有可能v4 flash反而是用国产卡,而pro是用的N卡.
因为按照flash的参数量来看的话,倒是符合卡资源量.
以及推理速度上来说,符合专门优化的体现.
也符合pro没有量大管饱这一现象.
因为还需要N卡资源做其他的事.
尤其他在开始谈到的缺卡问题.
一方面是训练和面向终端用户的推理需求.
另一方面是可能更为关键的,用来做原型和实验的部分.
国产卡可能在生产场景是可替代了的.
但在更为复杂的迭代和探索过程,成熟的可能还是相对欠缺的.
所以实验卡更需要一些成熟稳定的硬件,去屏蔽解决非核心问题上花的时间.
而卡数量这方面,猜测可能20w卡的互联网大厂应该就是最近官宣国产集群的LongCat了.
当然,这个可能还是有一点信息滞后的.
毕竟讲话时间是在一个月前.
而且最近950超节点也官宣了.
按照之前的计划也是今年下半年开始量产.
所以这个20w卡的怨念应该也还是在产能爬坡前的有限范围内的供给问题.
不过按照他对SOTA模型需要5w张B卡的说法.
也就是DeepSeek可能需要大概20w张950.
这个能不能有,也确实有点未知数.
毕竟这个几乎就是之前全世界所有的卡数了.
最后一个比价有意思的就是他的成本和商业观念.
字面上看他对API的成本理解就是纯粹的卡成本投入.
所以有定价是10个月回本的说法.
而按照这个反推,也就是目前OpenAI/Anthropic的定价是一个月收回卡成本的.
这个和当前市场理解的AI Capx是有相当程度出入的.
假设双方的理解都是对的话.
那么这里imply的就是算力卡在整个AI算力支出上是一个可以忽略的部分.
大头可能是在数据中心本身和能源供给上面.
甚至还可能是意想不到的房地产和合规/ESG开支上面.
这样的话,中美的的AI成本和发展就存在着fundamental的不同了.
后期是如果考虑障碍在后者的话.
基于这点反观限制开源模型竞争的言论的话,倒是有自洽的地方的.
因为frontier的边际能力和卡限制不足以弥补其他方面的成本差距.
所以它关注的不再是模型能力差距本身,而是使用者/用户群的归属问题.
这就有点像夕阳行业里的存量竞争状态.
能活下来的是具有成本优势的.
而显然,在AI叙事的实际ROI存疑的前提下,成本的差距会更加放大这种用户选择.
当然,这个假设成立有一个隐含前提就是,DeepSeek口中的十个月收回成本对其他人也成立.
毕竟除了模型能力本身,DeepSeek的infra能力它的护城河之一.
而且梁文锋很明显地知道这个是他独有的商业模式之一.
没有其他人host的v4能跑出DeepSeek的性价比和效率.
而这点可能是其他国产模型需要思考的地方了.
尤其当你还是依赖N卡算力的时候,模型即使SOTA了,但是你自己不能够host.
或者没有足够资源host的时候,是无法变现的.
因为国外的云厂商有着更多的资源和更合规的使用手段.
最后就会演变成某种形式的中国制造叙事的反面.
国外有着更便宜的基建去host你的模型,使得你自己的产品在更广泛的市场上不具有任何竞争力.
从而活不下去.
这对于国产模型公司来说,可能是一个非常惨痛和可惜的结果.
因为这条全链路国产化本来是一条一荣俱荣一损俱损的道路.
虽然难,而正确.
没有评论:
发表评论