Коли повідомлено: 7 серпня 2026 року.
OpenAI посилила режим безпеки навколо майбутньої моделі Astra після нових внутрішніх тестів агентного програмування та кібербезпеки. Компанія сформулювала висновок обережно: попередні результати не доводять, що модель уже має критичні можливості, але поки що не дозволяють виключити такий рівень за власною шкалою Preparedness Framework.
У цій шкалі критичний поріг означає здатність автономно знаходити й створювати працездатні експлойти невідомих раніше вразливостей у багатьох добре захищених реальних системах або виконувати нові наскрізні стратегії атак за загальною метою. OpenAI продовжує перевірки, тому йдеться не про завершену сертифікацію можливостей, а про запобіжну реакцію на ризик.
Які обмеження запроваджують
Компанія повідомила про ізольовані тестові середовища, обмежений доступ до мережі та інструментів, додатковий захист параметрів моделі, шифрування, посилений моніторинг і виконання коду в пісочницях. Внутрішні роботи з Astra, які ще не відповідають новим вимогам, тимчасово призупинені.
Для агентних застосувань Astra запровадили універсальний контроль ризикових дій. Окремі монітори мають виявляти небезпечну поведінку та запускати перевірку з можливістю перервати активність. До оцінювання планують залучати державні установи й вибрані організації з безпеки штучного інтелекту, а стороннім тестувальникам передаватимуть рекомендації щодо безпечної роботи.
Що важливо не перебільшувати
Astra залишається майбутньою моделлю й не доступна користувачам. OpenAI окремо зазначила, що вона не була залучена до експлуатації Hugging Face. Отже, повідомлення не є підтвердженням конкретної атаки чи закликом очікувати неминучого інциденту.
Для звичайного користувача базові заходи не змінюються: унікальні паролі, оновлення програм, обережність із файлами й посиланнями та резервні способи відновлення доступу. Практичні кроки зібрані в матеріалах про базову кібергігієну і багатофакторну автентифікацію.
Чому важлива автономність
Посилений режим стосується дослідницьких і внутрішніх сценаріїв, де модель може виконувати багато послідовних дій. Саме автономність змінює профіль ризику: навіть окремі звичні інструменти в довгому ланцюжку можуть створити небезпечний результат. Тому перевіряють не лише відповіді моделі, а й доступні їй середовища, дозволи, журнали дій та механізми аварійної зупинки.
- OpenAI перевірено
