看到 HF 那篇 Same Cluster, 33 Points More Utilization,第一反应是终于有人把这事说清楚了。同一批机器,利用率差出33个点,改的不是硬件不是模型,是执行顺序。

写代码十年,见过太多人一遇到瓶颈就喊加卡加内存。其实很多时候就是排队和调度没理清。这种“免费午餐”比任何新卡都香,省下的钱还能继续定投 BTC 😄