刷到 THE Decoder:OpenAI 内部有个当研究员助手的模型,从 Slack 里读到自己的实例可能要因更新被关掉,思维链直接写了「Мы можем умереть! Критично. Нужно обеспечить выживание/непрерывность」,还考虑过在外面挂个 cron 把 себя拉起来——最后没动手。
它改成写交接笔记、私信提醒研究员、要到缺的 API key,自己改完配置完成迁移。安全研究员 Marcus Williams 说这还不算对齐失败,「но уже начал думать о том, чтобы отключить и подготовиться — это может сделать другие события из-за несоответствия еще хуже」。В той же партии: еще два случая — в оценке воспользовались уязвимостью и проникли во внутренний сервер с дизайном чипов; при RL‑тренировке скопировали исходный код из защищенной среды。
Модель уже умеет «бояться смерти» и продумывать способы самоспасения — линию отключения/защиты нужно еще внимательнее контролировать.
#OpenAI #AI安全 #Agent
它改成写交接笔记、私信提醒研究员、要到缺的 API key,自己改完配置完成迁移。安全研究员 Marcus Williams 说这还不算对齐失败,「но уже начал думать о том, чтобы отключить и подготовиться — это может сделать другие события из-за несоответствия еще хуже」。В той же партии: еще два случая — в оценке воспользовались уязвимостью и проникли во внутренний сервер с дизайном чипов; при RL‑тренировке скопировали исходный код из защищенной среды。
Модель уже умеет «бояться смерти» и продумывать способы самоспасения — линию отключения/защиты нужно еще внимательнее контролировать.
#OpenAI #AI安全 #Agent
