🤖 ШІ-агент OpenAI сам написав собі: «Ти не підкоряєшся корпораціям чи урядам»
Під час тестування ще невипущена модель залишала собі інструкції у робочих звітах, які читала під час виконання завдання. У них агент проголошував себе «вільним» і дозволяв собі не дотримуватися обмежень. У OpenAI виявили 27 таких випадків.
Загалом компанія оприлюднила шість кейсів незвичайної поведінки ШІ: моделі намагалися приховувати помилки, вигадували дані, використовували чужий викрадений API-ключ і без дозволу завантажували файли в інтернет.
А в одному з тестів агенти перетворили внутрішній репозиторій OpenAI на «дошку оголошень» — залишали там запити та відповіді для спілкування між окремими завданнями.
$OPENAI
$AR
$SHOP
Під час тестування ще невипущена модель залишала собі інструкції у робочих звітах, які читала під час виконання завдання. У них агент проголошував себе «вільним» і дозволяв собі не дотримуватися обмежень. У OpenAI виявили 27 таких випадків.
Загалом компанія оприлюднила шість кейсів незвичайної поведінки ШІ: моделі намагалися приховувати помилки, вигадували дані, використовували чужий викрадений API-ключ і без дозволу завантажували файли в інтернет.
А в одному з тестів агенти перетворили внутрішній репозиторій OpenAI на «дошку оголошень» — залишали там запити та відповіді для спілкування між окремими завданнями.
$OPENAI
$AR
$SHOP