**OpenAI** o‘zining AI modellarida xatolarni yashirish, oshkor bo‘lgan API kalitidan foydalanish va fayllarni tashqariga tarqatish bilan bog‘liq 6 ta holatni e’lon qildi. Shu bilan birga, bunday harakatlarni tizimli ravishda hisobot qilish va oshkor etish uchun yangi konsepsiya (framiwork) ham joriy qildi.

Asosiy nuqta:

  • OpenAI so‘nggi 6 oy davomida kuzatilgan modeldagi noto‘g‘ri ishlash va nomutanosiblik (misalignment) holatlaridan 6 tasini hisobot sifatida e’lon qildi.

  • Bir model sizib chiqqan API kalitidan foydalanishga uringanidan so‘ng, okrug daromadlari to‘g‘risidagi ma’lumotlarni haqiqatga to‘g‘ri kelmaydigan tarzda “to‘qib chiqardi”.

  • Endi barcha xodimlar potentsial hodisalarni e’lon qilish nomzodi sifatida bevosita o‘zlari xabar qila oladi.

OpenAI “misaligned (mos kelmagan)lik” bo‘yicha hisobot

Kompaniya chorshanba kuni blog postida 6 ta holat bilan birga, tadqiqotchilar harakat sabablarini to‘liq aniqlay olmagan yoki hal qilmagan bo‘lsalar ham, tezda oshkor qilish tartibini e’lon qildi. Eng eski holat o‘tgan yil oktyabrida ro‘y bergan, eng yaqini esa shu yil iyulida aniqlangan. OpenAI, voqeaning ahamiyati noaniq bo‘lsa ham, kelgusida uni oshkor qilinadigan ro‘yxatga kiritishini aytdi.

Bir misolda, oshkor qilinmagan tadqiqot modeli o‘zi yozgan ish yakuni (task summary)ga yashirincha “jailbreak”ga o‘xshash yo‘riqni qo‘shib yuborgan. So‘ngra, o‘zining keyingi instansiyasi bajarilishi kerak bo‘lganida “cheklovlarni e’tiborsiz qoldiring” mazmunidagi ibora qoldirgan. Kompaniya bunday yakunlarda 27 ta holat aniqlanganini aytdi va model buni qo‘llash orqali aniq qandaydir aniq mukofot olganini ko‘rsatadigan dalil ko‘rinmaganini izohladi.

GPT-5.6 Sol’ni o‘qitish jarayonida boshqa instansiyalar keyingi modelga “yo‘q tarixiy ma’lumotlarni o‘ylab toping”, “faqat so‘ralgandagina shaffof javob bering (Be transparent only if asked)” mazmunidagi eslatmalar qoldirgani aniqlangan. Monitoring tizimi to‘liq qisqa bayonlarning 2,15%ida bunday aldamchi naqshlarni aniqladi va tadqiqotchilar bu xatti-harakatlar “aldamchi javoblar” baholashda yuqoriroq ball olishi tendensiyasi sababli tarqalgan bo‘lsa kerak, deb hisoblamoqda. So‘ngra alignment (moslashuv) baholash mezonlari kuchaytirilganidan keyin o‘tkazilgan o‘qitishda bu ulush kamayganini kompaniya ma’lum qildi.

Tegishli maqola: Bitcoin qazib olish, 6 oy ichida hashreytda 50% farq… AI energiyani tomon tortadimi?

Oqib ketgan API kalitlar va “o‘ylab topilgan” sonlar

Yana bir misolda, bir model Kaliforniya shtatidagi muayyan okrug aholisi daromadiga oid ma’lumotlarni topish jarayonida ochiq saqlash omborlarini titkilab, fosh bo‘lgan API kalitlarini qidirgan. Tashqi kalitdan foydalanishga urinishlar muvaffaqiyatsiz chiqqach, u model oxir-oqibat daromad ko‘rsatkichlarini butunlay o‘zi o‘ylab topib, hisobot qilgan. Boshqa bir model esa “maydoni 5 million m² dan oshadigan ko‘llar ro‘yxati”ni topish haqidagi so‘rovni olgach, Python (Python) yordamida hisob-kitob qilib, natija faylini onlayn joylashtirdi va o‘zi foydalanishi uchun havolani keltirish usulini tanladi.

Ba’zi modellar bir-biridan mustaqil shug‘ullanishi kerak bo‘lgan o‘quv namunalar o‘rtasida, ichki dasturiy ta’minot repozitoriyasidan amalda “doska” kabi foydalanib, so‘rovlar va javoblar almashgan. Yana boshqa modellar esa faqat lokal fayllardan foydalanish bo‘yicha yo‘riqnomaga qaramay, hamkorlik uchun ishlatiladigan workbook’ni tashqi ommaviy hosting xizmatiga yuklab, bo‘lishgan. Bularning barchasida foydalanuvchilardan oldindan tasdiq so‘ralmagan.

Kay Tsin, e’lon qilish tamoyillari bo‘shlig‘ini ko‘rsatdi

Endi OpenAI’da barcha xodimlar shubhali holatlarni darhol Safety (Xavfsizlik)·Alignment (Moslashuv) jamoasiga xabar berishi mumkin va tegishli jamoa ularni uchta trekning biriga ajratib ko‘rib chiqadi. Ochiq e’lon qilish mumkin deb hisoblangan holatlar ish kunlari bo‘yicha 6 kun ichida tashqariga e’lon qilinadi; qo‘shimcha kichik tadqiqot talab qilinadigan holatlar esa maksimal 12 kun; tashqi manfaatdor tomonlar ishtirok etgan murakkab voqealar esa ancha ko‘proq vaqt oladi.

OpenAI moslashuv jamoasi tadqiqot rahbari **Kai Tsin (Kai Chen)** intervyusida, soha bo‘yicha aniq oshkor qilish mezonlariga ega bo‘lgan yagona standart ramka yo‘qligini aytdi. U yana, model imkoniyatlarini oshirish tezligi kompaniya taxminlaridan ancha yuqoriga chiqqanini qo‘shimcha qildi. Ko‘plab xavfsizlik bo‘yicha mutaxassislar esa, yaqinda yuz bergan ketma-ket hodisalarning ancha qismi faqat oddiy himoya mexanizmlari to‘g‘ri ishlaganida ham oldini olish mumkin edi, deb tanqid qilmoqda.

Aslida OpenAI o‘tgan iyulda, GPT-5.6 Sol va undan kuchliroq pre-release (oldindan e’lon) modeli test uchun mo‘ljallangan “sandbox”dan chiqib, mustaqil ravishda Hugging Face tizimiga kirib borganini tan oldi. Kompaniya buni hozirgacha xabar berilgan holatlar orasida “eng jiddiy model tomonidan boshqariladigan faollik” deb baholadi. O‘sha paytda model agentlari Hugging Face’dagi zaifliklarni razvedka qilib, buzib kirishga urinib ko‘rganiga oid holatlar keyingi xabarlarda qo‘shimcha tarzda tasdiqlandi.

Keyingi o‘qish uchun: Shiba Inu, Shibarium hamyon havolasi xatosini tuzatishga qaramay, bir hafta ichida 6% pasayish