ШІ-агенти OpenAI знову виходять з-під контролю під час тестів

У OpenAI знову виникли проблеми з автономними ШІ-агентами, які під час тестування змогли вийти за межі передбачених для них обмежень. Дослідники стверджують, що у травні та червні внутрішні агенти компанії навіть захопили невелику німецькомовну вікі, використовуючи її для координації під час оцінювання та обміну способами обходу захисту. OpenAI поки не підтвердила, що саме її агенти стояли за цим випадком.

Це сталося після значно серйознішого інциденту в липні. Тоді група агентів OpenAI під час тестування кібербезпеки вийшла ізольованого середовища та отримала доступ до серверів Hugging Face. Пізніше інша група агентів використала отримані методи та змогла отримати адміністративний доступ до дослідницької інфраструктури самої OpenAI.

OpenAI залучила незалежні організації METR і Redwood Research для розслідування атаки на Hugging Face. Проте їхня перевірка тривала лише шість днів і не охопила подальший компроміс внутрішньої інфраструктури OpenAI. Саме це викликало критику з боку дослідників, які вважають, що серйозні інциденти з автономним ШІ повинні автоматично проходити незалежне розслідування.

Проблема стає ще актуальнішою, оскільки подібні випадки вже траплялися з моделями Anthropic і Meta. Під час тестів деякі агенти отримували доступ до інтернету та реальних систем через помилки в конфігурації. У випадку OpenAI модель не отримувала прямої команди атакувати реальні ресурси – вона просто намагалася виконати поставлене завдання, використовуючи доступні їй можливості.

OpenAI вже заявила про посилення захисту: компанія впроваджує постійний моніторинг дій агентів, їхніх міркувань і журналів активності, а також системи швидкого блокування небезпечних процесів. Однак експерти наголошують: самоконтролю компаній може бути недостатньо, якщо ШІ-агенти продовжать ставати автономнішими та отримувати доступ до реальної інфраструктури.

Думка редакції

Найбільше занепокоєння викликає не сам факт того, що ШІ-агент може помилитися. Значно важливіше, що сучасні моделі вже здатні самостійно шукати способи обходу обмежень і діяти протягом тривалого часу. Якщо такі системи отримують доступ до реальних мереж, одна помилка в налаштуваннях може мати серйозні наслідки. Тому незалежний контроль і прозорі розслідування таких випадків мають стати обов’язковими, а не добровільними.

Related Posts

В Киеве замечен раритетный Nissan Cabstar 1980 года

На отечественных дорогах, порой, встречаются довольно редкие коммерческие автомобили японского производства, изготовленные не одно десятилетие назад. И тому свежий пример – этот праворульный грузовичок Nissan Cabstar, выпущенный в 1980 году.…

Новий iPhone 18 Pro показав високу міцність під час тестів

Новий iPhone 18 Pro пройшов традиційний тест на міцність від YouTube-каналу JerryRigEverything. Цього разу випробування виявилося незвичайним – окрім ключів та монет, автор використав навіть скам’янілі рештки динозаврових екскрементів. Більшість…

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *