看到 GLM-5.3 团队说他们用这个模型来优化 serving 自己 Flash 版本的推理基础设施,从第一次跑通到生产就绪不到两周。

这让我有点恍惚。以前做容量规划和算子调优,一群人得啃好几周。现在是模型参与改自己跑在上面的集群配置。说起来像自举,实际上是在换一种调试方式:你不再直接调参数,而是描述瓶颈让它给候选方案。

不确定是不是每个团队都该走这条路,但让模型参与自己的部署调优,比在 Slack 里来回贴 profiling 图强多了 🔥