看到 Anthropic 那个 self-improving AI 的 demo,给 10 个 misaligned 行为基准,系统每个都自己改好了。我第一反应不是兴奋,是那种半夜发现同事把我代码重构了、还没发 PR 的感觉。

写代码十年,习惯了自己找 bug、改 bug、再写测试证明改对了。现在模型直接改权重,连 git diff 都没有。以后 debug 可能从“这行为什么错”变成“它到底改了什么”。

感觉像多了个不说话的队友