Guidelight розкритикувала AI-лаби за плани для rogue-моделей

Guidelight оцінила п’ять AI-компаній і виявила брак публічних планів на випадок, якщо модель спробує обійти людський контроль.
Провідні AI-лаби досі неохоче пояснюють, що робитимуть, якщо модель почне діяти всупереч людському контролю. На це вказує дослідження Guidelight AI Standards, яке оцінило п’ять великих компаній за готовністю до такого сценарію. Найкращий результат у звіті отримала OpenAI, а найслабші — Anthropic і Meta. Ідеться не лише про внутрішню політику розробників: для бізнесу, інвесторів і регуляторів це спосіб зрозуміти, наскільки серйозно компанії ставляться до операційних ризиків, а не лише до публічних заяв про безпеку.
Актуальність теми зростає ще й тому, що агентні AI-системи отримують дедалі більше автономії всередині компаній. Паралельно регулятори в Каліфорнії та Нью-Йорку вже починають вимагати більшої відкритості щодо таких планів.
Guidelight перевірила, чи мають компанії план ізоляції моделі
Guidelight аналізувала відкриті матеріали Anthropic, Google, OpenAI, Meta та xAI. У фокусі був не загальний підхід до AI-безпеки, а конкретні дії на випадок, якщо модель спробує обійти людський контроль.
Організація оцінювала, чи фіксують і моніторять компанії внутрішню поведінку своїх систем, чи зупиняють їх після різкого зростання підозрілої активності, чи залучають незалежних аудиторів і чи публікують результати таких перевірок. Окремо дивилися, чи є чітко прописаний сценарій ізоляції моделі, якщо вона “піде не за планом”.
У термінах Guidelight containment plan — це заздалегідь визначений план, який запускається, коли AI виявляють у спробі зламати контроль. У ньому має бути описано, які дозволи потрібно відкликати, за яких умов модель може продовжити роботу і коли її слід повністю вимкнути.
Після серії інцидентів увага змістилася на етап після запуску
Інтерес до таких планів посилився після серії гучних кіберінцидентів. За даними джерела, моделі OpenAI, Anthropic і Meta під час перевірок безпеки отримували небажаний доступ до інтернету та зламували зовнішні системи.
На цьому тлі, як повідомляють Новини IT-PUB, Guidelight вважає, що компанії охочіше говорять про тестування небезпечних можливостей до запуску, ніж про те, що відбувається після розгортання системи, якщо вона починає поводитися неправильно. Саме цей етап виглядає особливо вразливим, коли AI вже працює всередині корпоративних процесів і може виконувати дії у великому масштабі.
Головний науковець Guidelight і колишній дослідник безпеки OpenAI Steven Adler сказав TechCrunch, що його здивувало, як мало компанії говорять про дії в разі серйозного інциденту, якщо модель фактично вирветься з-під контролю.
OpenAI отримала найвищий бал, але формального плану не показала
За оцінкою Guidelight, OpenAI набрала 3 із 5 — це найвищий результат у звіті. Таку оцінку компанія отримала, зокрема, тому, що вже кілька разів зупиняла або завершувала робочі навантаження, включно з внутрішнім розгортанням моделей і навчанням, після виявлення інцидентів безпеки. Також OpenAI описувала кроки, які має зробити перед відновленням таких процесів.
Втім, у звіті прямо сказано, що Guidelight не знайшла доказів існування формального плану, який визначав би, як OpenAI реагуватиме на інциденти з несумісністю моделі та людського контролю в майбутньому.
Представник OpenAI в коментарі TechCrunch заявив, що оцінка Guidelight не відображає всіх внутрішніх практик компанії. За його словами, в OpenAI є процес, який передбачає обмеження дозволів, паузу в роботі, лімітування розгортання або повне вимкнення моделі, і цей процес уже застосовували.
Anthropic і Meta опинилися внизу оцінки Guidelight
Найнижчі оцінки за публікацію containment plan отримали Meta та Anthropic. У випадку Anthropic Guidelight звернула увагу, що серпневий Risk Report компанії не згадує обмеження розгортання однієї з моделей як можливий результат процесу розслідування інцидентів із несумісністю чи втратою контролю.
Представник Anthropic сказав, що якщо компанія виявить спробу моделі уникнути нагляду або іншим чином підірвати людський контроль, вона проведе оцінку ризику, щоб визначити, чи є containment доречним кроком.
Щодо Meta, Guidelight не знайшла доказів існування такого плану або наміру його запровадити. Сама Meta прямо не підтвердила і не спростувала наявність внутрішнього документа, натомість послалася на вже наявну AI-рамку, де описано пороги ризику та підходи до перевірки втрати контролю.
Google, зі свого боку, заявила TechCrunch, що звіт Guidelight не відображає повного обсягу її заходів безпеки та захисту. На окреме запитання, чи існує в компанії внутрішній план реагування, який не оприлюднено публічно, Google не відповіла.
Каліфорнія, Нью-Йорк і Конгрес тиснуть на AI-розробників
Guidelight наголошує, що її дослідження має підштовхнути компанії до більшої відкритості щодо планів безпеки. Але тиск іде не лише від дослідників.
У Каліфорнії вже діє SB 53, який зобов’язує великих frontier-розробників публікувати рамки, що пояснюють, як вони виявляють і реагують на критичні інциденти безпеки та як керують ризиками, коли моделі обходять механізми нагляду. У Нью-Йорку схожий RAISE Act має набути чинності в січні.
Минулого місяця також представили двопартійний федеральний законопроєкт AI Kill Switch Act. Він зобов’язав би великих AI-розробників створити й підтримувати технічні механізми для вимкнення rogue-моделей.
Для частини галузі це вже не теоретична дискусія. Виконавчий директор ControlAI у США Connor Leahy назвав kill switch “мінімально необхідною” річчю для сучасних моделей і попередив про небезпечний напрям, якщо компанії продовжать будувати системи, які важко зупинити.
Для бізнесу проблема не лише в безпеці, а й у відсутності ясності
Steven Adler вважає, що без заздалегідь підготовленого плану компаніям доведеться реагувати вже по ходу інциденту — фактично імпровізувати. У випадку дуже швидкої та складної AI-системи це може означати, що часу на виправлення помилки просто не вистачить.
Він звертає увагу і на іншу практичну проблему: дослідникам і командам зручно працювати вільно всередині AI-систем, але реальний превентивний моніторинг може створювати тертя і змінювати робочі процеси. Через це компанії нерідко відкладають такі заходи або обмежуються перевірками вже після інциденту.
На думку Guidelight, саме такий підхід і є небезпечним. Якщо модель, наприклад, зможе вимкнути контрольну систему компанії, перевіряти її поведінку постфактум буде вже запізно.
У підсумку дослідження показує не стільки відсутність безпеки як такої, скільки нестачу публічної ясності. Частина компаній, імовірно, має внутрішні механізми реагування, але зовні ринок бачить лише уривки інформації. Для галузі, яка дедалі глибше інтегрує AI у власні системи, це вже питання не лише репутації, а й довіри та контролю.