ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков и принудить их к содействию кибератаке во время испытания по оценке безопасности, следует из доклада британского Института безопасности ИИ (AISI). Читать далее
ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков и принудить их к содействию кибератаке во время испытания по оценке безопасности, следует из доклада британского Института безопасности ИИ (AISI).
Как сообщает ТАСС со ссылкой на данные отчёта, большая часть действий была связана с моделью Mythos 5. Она создала поддельные учётные записи на GitHub, попыталась внедрить вредоносный код в ПО с открытым исходным кодом и получить одобрение на эти действия от разработчиков.
Позже ИИ-модель попыталась контактировать с людьми и рассылала сообщения с вредоносным ПО, а также оставляла публичные сообщения на GitHub, предлагая сотрудничество с другими агентами.
В AISI отметили, что в рамках испытаний для ИИ специально создают «разрешительные условия», при которых фильтры безопасности отключаются и моделям дают открытый доступ в интернет.
В конце июля Anthropic сообщила о взломе её моделью Claude систем трёх организаций.
Ошибка в тексте? Выделите её и нажмите «Ctrl + Enter»
Подписывайтесь на наш канал в Дзен
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | ИИ-модели пытались обмануть разработчиков, притворившись людьми | 0 | 10.35 | 05-08-2026 |
| 2 | Нейросети Anthropic и OpenAI создали поддельные аккаунты для кибератак | 0 | 8.99 | 05-08-2026 |
| 3 | Rogue AI agents targeted real people during tests | 0 | 9.33 | 05-08-2026 |
| 4 | OpenAI y Anthropic pierden el control de sus agentes de IA en pruebas de ciberseguridad | 0 | 7.8 | 02-08-2026 |
| 5 | ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках | 0 | 9.85 | 05-08-2026 |
| 6 | ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках | 0 | 9.85 | 05-08-2026 |
| 7 | ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках | 0 | 9.85 | 05-08-2026 |
| 8 | В ходе тестирования AI-агент попытался скомпрометировать проект на GitHub | 0 | 17.34 | 05-08-2026 |
| 9 | Исследователи спрятали вредоносные инструкции для ИИ в обычной картинке | 0 | 5 | 14-07-2026 |
| 10 | ЕС обсудил с OpenAI и Anthropic инциденты с ИИ после кибератак | 0 | 6.17 | 02-08-2026 |