硅谷不再卷模型参数,GPU利用率革命榨干最后一滴算力
八月份的硅谷风向彻底变了,大家见面不再吹嘘自己的模型参数又突破了多少万亿,而是死盯着面板上的GPU利用率(GPU utilization)。这波效率革命的爆发,标志着大模型行业终于从狂热的盲目扩张,进入了抠门算计的存量博弈阶段。AI基础设施(AI Infrastructure)悄然成了现在最赚钱也最残酷的新战场。
前两年大家都在疯狂囤卡,恨不得把市面上的高端GPU全买空。但真到了大规模训练和推理的时候才发现,因为网络通信瓶颈和显存墙(Memory Wall)的限制,很多昂贵GPU的实际计算时间连一半都不到,剩下的时间全在等待数据搬运。这种暴殄天物的行为,在如今资本收紧的寒冬里是绝对无法容忍的。
现在的当务之急是榨干每一滴算力。大厂的基础设施团队开始疯狂重构底层的算力调度器(Cluster scheduler)。他们不再依赖开源的通用调度框架,而是针对自家集群的物理拓扑结构,手写极其复杂的亲和性调度算法。目的就是让需要频繁交换数据的计算任务,尽可能落在同一个机架甚至同一个交换机下,把网络延迟压榨到物理极限。
这种对底层基建的极致压榨,直接催生了一批专门做算子优化和编译器重构的独角兽公司。他们不碰模型算法,就专门帮大厂改写CUDA代码,把矩阵乘法的效率提升几个百分点。在这个阶段,谁能把硬件的性能边界摸透,谁就能在同样的算力预算下跑出更聪明的模型。那些还在盲目堆砌显卡却不懂底层优化的团队,很快就会被这波效率革命的浪潮彻底拍死在沙滩上。