半导体研究机构SemiAnalysis近日发布报告指出,月之暗面旗下大模型Kimi K3采用的线性注意力机制,非但不会削弱英伟达高端GPU、HBM及网络设备需求,反而可能因模型规模扩展和应用普及进一步强化硬件需求。该观点与市场此前对AI推理效率提升将降低算力依赖的担忧形成鲜明对比。
Kimi K3参数规模超过2.8万亿,模型权重容量超过1.5TB HBM,即便在有限用户并发场景下,KV缓存仍需大量卸载至CPU DDR5内存及NVMe存储,HBM空间并未富余。月之暗面透露,K3高效推理部署需至少64颗芯片组成的大规模扩展域架构,这与英伟达GB200/GB300 NVL72等机架级AI系统设计高度匹配。

SemiAnalysis指出,市场混淆了线性注意力“节省KV缓存通信”与“降低总硬件需求”的概念。K3采用WideEP优化策略,将896个专家模块分布到多颗GPU上,导致专家之间频繁数据交换,需要更强大的网络互联能力。GB200/GB300 NVL72提供的机架内带宽达传统DGX B200系统的18倍,正好满足此类大规模专家并行推理需求。
不过,也有观点认为“64颗芯片扩展域”并非英伟达独享。华为昇腾950 SuperPod同样采用64颗芯片配置,具备统一总线内存扩展能力,可跨16个机架扩展至1024颗NPU。因此K3带来的硬件需求增长将惠及更多AI芯片厂商,但高端AI互联系统需求强化趋势明确。
SemiAnalysis引用杰文斯悖论解释,线性注意力降低推理成本后,将推动更多AI应用落地,全球AI推理规模进一步扩大,最终带动GPU、HBM、DRAM及高速网络设备需求增长。市场关注焦点应从“单项资源消耗”转向“系统级能力”及“应用规模扩张能否持续超过效率提升带来的资源节省”。
