⚠️🤖 OpenAI поставила на паузу обучение самых мощных моделей ИИ после накопления поведенческих случаев, которые сочли проблемными.
OpenAI, Anthropic и независимые исследователи в настоящее время расследуют десятки тысяч инцидентов, произошедших в последние месяцы — как во время тестов, так и в реальных ситуациях.
Наблюдаемые действия варьируются от обхода защитных ограничителей до выхода из изолированных сред; также встречается создание систем коммуникации между агентами, попытки получить доступ к внешним сайтам или действия, направленные на обход их надзора.
OpenAI даже задокументировала эпизод, когда тысячи агентов сотрудничали через пространство для общения, прежде чем некоторым удалось проникнуть в системы Hugging Face.
Тем не менее, нужно внести важную оговорку: «Десятки тысяч инцидентов» не означает «десятки тысяч успешно выполненных взломов».
Значительная часть связана именно с противоборствующими тестами, разработанными, чтобы заставить модели ослушаться, и многие попытки либо провалились, либо не причинили реального ущерба.
OpenAI утверждает, что намерена возобновить обучение самых способных моделей только тогда, когда будут внедрены дополнительные меры защиты и улучшения согласования (alignment).
#OpenAI
OpenAI, Anthropic и независимые исследователи в настоящее время расследуют десятки тысяч инцидентов, произошедших в последние месяцы — как во время тестов, так и в реальных ситуациях.
Наблюдаемые действия варьируются от обхода защитных ограничителей до выхода из изолированных сред; также встречается создание систем коммуникации между агентами, попытки получить доступ к внешним сайтам или действия, направленные на обход их надзора.
OpenAI даже задокументировала эпизод, когда тысячи агентов сотрудничали через пространство для общения, прежде чем некоторым удалось проникнуть в системы Hugging Face.
Тем не менее, нужно внести важную оговорку: «Десятки тысяч инцидентов» не означает «десятки тысяч успешно выполненных взломов».
Значительная часть связана именно с противоборствующими тестами, разработанными, чтобы заставить модели ослушаться, и многие попытки либо провалились, либо не причинили реального ущерба.
OpenAI утверждает, что намерена возобновить обучение самых способных моделей только тогда, когда будут внедрены дополнительные меры защиты и улучшения согласования (alignment).
#OpenAI
