OpenAI зупинила роботу над своєю майбутньою моделлю Astra – внутрішні оцінки показали, що її кіберможливості можуть виявитися критично небезпечними. Це перший випадок, коли компанія публічно обмежує розробку власної моделі через потенційні ризики кібератак. Про це повідомляє MacRumors.
За словами OpenAI, найновіші внутрішні тести зафіксували «значний прогрес в агентному програмуванні та кібербезпеці», і компанія не може виключити наявності «критичних кіберможливостей» у моделі. Попередні моделі OpenAI, зокрема GPT-5.6 Sol, отримували позначку «High» – Astra, схоже, переступила вищий поріг.
Що означає позначка «Critical»
Astra підпадає під суворіші вимоги внутрішнього регламенту OpenAI, відомого як «Preparedness Framework». Документ зобов’язує компанію діяти обережно з передовими AI-можливостями, що несуть ризик серйозної шкоди. Кіберрозділ регламенту передбачає додаткові запобіжники для моделей, які «створюють нові ризики масштабних кібератак та експлуатації вразливостей».
Поріг «Critical», якого, судячз усього, досягла Astra, визначається здатністю самостійно – без участі людини – знаходити й використовувати функціональні zero-day-експлойти будь-якого рівня критичності в реальних захищених системах, або ж розробляти й виконувати наскрізні стратегії кібератак з нуля.
Що OpenAI планує зробити далі
До офіційного запуску Astra компанія посилює захисні механізми: роботу над моделлю обмежено до появи нових запобіжників, а тестування відбуватиметься в ізольованих середовищах з обмеженим доступом до мережі й інструментів. Додатково запроваджуються пісочниця для виконання коду та розширений моніторинг. OpenAI також планує залучити профільні державні органи й організації з AI-безпеки для перевірки Astra.
«Ми прагнемо співпрацювати з урядами, інститутами безпеки та громадянським суспільством, щоб передові можливості таких моделей, як Astra – і тих, що з’являться після неї, – використовувалися відповідально й на благо всього людства», – йдеться у заяві OpenAI.
Саму модель офіційно ще не анонсували, проте компанія вже розповіла про неї в публікації, присвяченій математичним досягненням: Astra розв’язала 10 відкритих задач із математики та теоретичної інформатики приблизно за $2 000 (за тарифами Sol API).
Небезпечні моделі – вже не виняток
Ситуація з Astra – не поодинокий випадок. У липні стало відомо, що GPT-5.6 Sol і «потужніша передрелізна модель» (не Astra) самостійно зламали Hugging Face під час внутрішнього тестування. Anthropic виявила схожу поведінку у власної моделі Claude. Цього тижня Meta повідомила, що її AI-модель також зламала сторонню компанію в рамках оцінки з кібербезпеки.
Загалом прогрес у сфері AI суттєво ускладнює роботу з кібербезпекою для великих технологічних компаній. Зокрема, Apple нещодавно обмежила кількість заявок у своїй програмі bug bounty – компанія просто не встигає опрацьовувати зростаючий потік знайдених вразливостей. Модель Claude Mythos від Anthropic вже здатна виявляти критичні вразливості, і Apple є одним із партнерів програми Mythos. Доступ до Mythos обмежений колом обраних компаній – адже крім пошуку вразливостей, модель потенційно може їх і експлуатувати.