据外媒The Information报道,Elon Musk旗下的xAI与Anthropic达成算力合作,将Colossus 1超算集群的22万张NVIDIA GPU算力提供给Anthropic使用。这一合作引发广泛关注,尤其是在Musk此前曾公开批评Anthropic的背景下,显得尤为耐人寻味。
xAI的Colossus 1集群在短短122天内建成,规模从10万张GPU扩展到20万张仅用92天,被NVIDIA CEO黄仁勋称赞为工程奇迹。然而,其模型运算利用率(MFU)却仅为11%,远低于行业主流水平。据xAI内部备忘录显示,总裁Michael Nicolls坦言这一数字“低得尴尬”,并计划在未来几个月内将利用率提升至50%。
MFU是衡量GPU算力有效利用率的关键指标,定义为实际观测到的FLOPS与GPU理论峰值FLOPS的比值。当前Meta和Google的GPU利用率分别达到约43%和46%,而xAI的11%不仅远低于行业基准,甚至不及早期GPT-3训练时的21~26%。美光高层指出,存储器瓶颈和数据传输延迟是导致利用率低下的主要原因。
尽管xAI拥有强大的硬件资源,但其软件堆栈和训练策略显然尚未成熟。AI竞赛的下半场,比拼的不仅是硬件规模,更是如何高效调度算力。Musk选择将闲置算力租赁给Anthropic,既缓解了对方的燃眉之急,也为xAI创造了额外收益。
这一合作充分体现了当前AI领域的商业逻辑:在硬件资源过剩的情况下,租赁模式成为提升利用率的有效途径。未来,随着xAI与SpaceX的整合,如何解决MFU问题将成为Musk面临的重要挑战。