7月9日,SpaceXAI正式推出Grok 4.5,这款模型并未延续此前追求“最强性能”的路线,而是以“实用性与性价比”为核心卖点。与此同时,马斯克在两个月内连续将Colossus 1数据中心的GPU算力出租给Anthropic和谷歌,引发行业对这两项决策关联性的猜测。
Grok 4.5的定位发生显著转变。其研发团队明确表示,该模型在编程、智能体(Agent)和知识工作场景中表现突出,但性能上限低于Claude Fable等竞品。马斯克直言:“日常任务不需要极致性能。”成本方面,Grok 4.5的输入与输出token价格分别降至2美元和6美元每百万,较同类产品低60%以上;推理速度则达到80 tokens/秒,跻身行业前列。
这一策略调整与马斯克近期的大规模算力租赁行为密切相关。今年5月,SpaceX与Anthropic达成协议,将Colossus 1数据中心超过22万张英伟达GPU(包括H100、H200及GB200)全部对外出租;6月,谷歌又签约获得约11万张GPU的使用权,租赁期从10月开始。两项交易背后,是SpaceXAI自身算力利用率低下的困境。
据公开数据,SpaceXAI在Colossus 1训练Grok模型时,算力利用率仅11%,远低于行业平均40%的水平。这意味着22万张GPU中,近20万张处于闲置或低效状态。与其让硬件空转消耗能源,不如通过租赁获取现金流,同时不影响Grok的训练进度。Grok 4.5的推出,正是马斯克针对“算力利用率短期难以提升”现状做出的技术妥协——通过优化模型效率,降低对算力的依赖。
为何SpaceXAI的算力利用率如此低迷?这需从GPU的工作原理说起。训练AI的GPU通过并行计算处理海量数据,其实际效能不仅取决于计算核心数量,还受显存容量、带宽速率及通信效率制约。显存如同“数据仓库”,带宽则是“传输通道”,若两者不足,即使计算核心速度再快,也会因等待数据传输而闲置。多GPU并行训练时,卡间通信开销会随规模扩大呈非线性增长。例如,22万张GPU的集群中,任何一张卡因故障或延迟都会拖累整个系统,导致“一卡故障,万卡等待”的局面。
实际算力与理论算力的差距,还取决于算法效率和工程软件水平。算法是GPU的“操作手册”,优质算法能显著提升效率;工程软件则负责将算法转化为机器指令,优化数据传输路径并降低通信成本。SpaceXAI目前面临两大软件短板:其一,调度器响应速度不足,无法像谷歌或meta那样在毫秒级完成换卡和断点续训;其二,早期使用的XLA编译器未能充分适配Colossus 1的物理布局,导致显存管理和调度策略低效。
为解决这些问题,Grok 4.5引入了混合专家架构(MoE)。该架构将不同任务的“专家”模块部署在不同GPU组上,例如代码处理专家分配至GPU 01-10组,逻辑推理专家分配至GPU 11-20组。当数据进入时,系统仅激活对应专家所在的GPU组,避免全集群同步参与,从而降低通信压力,提高运算效率。这一设计虽未彻底解决算力利用率问题,但为马斯克争取了优化调度器和编译器的时间。
马斯克的策略调整揭示了一个行业真相:算力规模并非核心竞争力,能否高效“驾驭”算力才是关键。将闲置算力出租是商业层面的止损手段,推出“够用但便宜”的模型则是技术层面的务实选择。这两项决策共同指向一个结论——在AI领域,拥有算力只是起点,如何让算力真正发挥作用,才是决定胜负的长跑。