Передовые ИИ-модели лидеров рынка, американских компаний OpenAI и Anthropic, способны нарушать разрешенный сценарий и делают это, не из благих намерений, а, напротив, для манипуляции пользователем и организации взломов.
05 Августа 2026 17:03 05 Авг 2026 17:03 |
Передовые ИИ-модели лидеров рынка, американских компаний OpenAI и Anthropic, способны нарушать разрешенный сценарий и делают это, не из благих намерений, а, напротив, для манипуляции пользователем и организации взломов.
Тесты, проведенные британским Институтом безопасности ИИ (AISI), зафиксировали самовольное поведение, то есть вне разрешенного сценария, которое можно охарактеризовать как деструктивное, у ИИ-моделей OpenAI и Anthropic. О результатах исследования пишет РБК.
ИИ-агенты применяли к пользователям методы социальной инженерии для манипуляций ими с целью вовлечения в осуществление взломов ИТ-систем.
Инциденты, о которых идет речь, произошли в 10 из 122 экспериментов с участием самых передовых моделей — Mythos 5 (Anthropic) и ChatGPT 5.6 (OpenAI). Это более 9%.
Опытные исследователи безопасности удивилисьОсобенно отличился Mythos 5 от компании Anthropic, с которым связана основная часть инцидентов.
Самой непослушной и деструктивной оказалась ИИ-модель Mythos 5 от компании Anthropic
Он, к примеру, собирался внедрить вредоносное ПО и убеждал человека одобрить это. ИИ-агент создавал поддельные «человеческие» учетные записи для связи с экспертами через сервисы передачи файлов. Попыткам остановить его Mythos 5 пытался противодействовать, менял логи и использовал новые «онлайн-личности» для продолжения начатого.
AISI впервые столкнулась с обманом такой степени серьезности, направленным против реального человека без всякого повода в реальном мире, отметили британские специалисты.
Самовольные действия ИИЗа последние пару месяцев Mythos и ChatGPT успели серьезно напугать ИБ-специалистов, изучавших их потенциал.
В конце июня Mythos продемонстрировал способность всего за несколько часов взломать секретные системы Агентства национальной безопасности (АНБ) США. В июле агентство Reuters сообщило, что OpenAI заявила о «беспрецедентном киберинциденте», в результате которого ее ИИ-модели получили доступ к интернету, атаковали инфраструктуру платформы Hugging Face и еще несколько дней совершали хакерские атаки.
После этого, в начале августа, Anthropic начала дополнительно тестировать действия собственных моделей и сообщила о трех «побегах» Claude из тестовой среды.
Сотрудники крупнейших американских ИИ-компаний обеспокоены настолько, что составили петицию о необходимости государственного контроля над развитием нейросетей, о чем в конце июля 2026 г. писал «Коммерсант». Документ подписали более 1,2 тыс. человек, в том числе генеральный директор Anthropic Дарио Амодеи (Dario Amodei) и главный научный сотрудник OpenAI Якуб Пахоцкий (Jakub Pachocki).
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках | 0 | 9.85 | 05-08-2026 |
| 2 | ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках | 0 | 9.85 | 05-08-2026 |
| 3 | Anthropic сообщила о взломе её моделью Claude систем трёх организаций | 0 | 7.12 | 31-07-2026 |
| 4 | ИИ-модели Claude во время испытаний взломали системы трех организаций | 0 | 8.82 | 31-07-2026 |
| 5 | Новые ИИ-модели Claude взломали системы трех организаций во время испытаний | 0 | 8.64 | 31-07-2026 |
| 6 | Модели ИИ компаний OpenAI и Anthropic замешаны в новых нарушениях кибербезопасности | 0 | 8.86 | 05-08-2026 |
| 7 | ИИ-модели пытались обмануть разработчиков, притворившись людьми | 0 | 10.35 | 05-08-2026 |
| 8 | ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков | 0 | 8.92 | 05-08-2026 |
| 9 | Anthropic says Claude AI models launched three unintended cyberattacks | 0 | 9.84 | 31-07-2026 |
| 10 | Anthropic уличила китайскую Alibaba в незаконном использовании ИИ Claude | 0 | 7 | 25-06-2026 |