旧机房看起来快被时代甩开了,但我越看越觉得,它真正的出路未必是硬扛最顶尖的训练,而是老老实实把推理需求接住。
很多人一提算力中心,脑子里全是“能不能训出下一代大模型”。按现在的迭代节奏,2028 年前后建成、却按前两年标准规划的机房,供电、散热和网络互联,几乎都很难直接顶住前沿训练。传统通用机柜功率密度大概在 10 kW 上下,而高密度 AI 机柜已经到 60 kW 甚至 100 kW 以上;芯片热功耗也在往上千瓦冲,冷却架构如果还停在风冷或简易液冷,后面会很被动。更别提大规模集群对光纤、交换机时延和拓扑的要求——这些短板叠在一起,旧机房去抢训练,基本是开业即落后。
可推理是另一回事。推理、企业侧微调、边缘计算、通用云服务,并不一定要 GW 级电力和十万卡级互联。旧机房只要电力批复、场地和基础管线还在,完全可以降维承接这部分持续扩散的需求。硬件卡可能三四年就过时,但建筑、电力和冷却设施的折旧期往往更长,真正值钱的是这些“重资产”。芯片可以换代,场地和供电却不容易复制。
我自己的判断很简单:别把旧机房当失败的训练中心,要把它当成性价比更高的推理池。打折出租、长尾现金流、服务中小模型和业务侧调用,反而更现实。前沿训练留给那些从一开始就按超高密度液冷、超大电力接入规划的新项目;旧机房认清定位,活得反而更稳。
当然,这不等于躺平不管。供电余量、散热改造空间、机柜密度上限,还是得提前摸清楚。能局部升级就升级,升级不动就别硬上训练集群,把机时、带宽和运维成本压到适合推理的区间。旧设施不是废铁,只是不该再拿它去赌最前沿的那一仗。
参与讨论
推理池这个定位确实更务实
旧机房改造液冷的成本高吗?
先把电力和场地利用起来更划算
中小企业可能更需要这种平价算力
机柜密度上不去就别硬扛训练了
希望再聊聊推理业务的回本周期