Перейти к содержимому
Опубликовано

Чатбот ошибается в ответе/ Агент ошибается действием/ Человек разгребает последствия.

Автор
  • Имя
    Кибермаркетинг| AI+ опыт = деньги
    Telegram

Кратко

Чатбот ошибается в ответе/ Агент ошибается действием/ Человек разгребает последствия. За последний месяц вышло сразу несколько историй, где ИИ...

Чатбот ошибается в ответе/ Агент ошибается действием/ Человек разгребает последствия.

За последний месяц вышло сразу несколько историй, где ИИ получил задачу, столкнулся с ограничением и решил проблему способом, которого человек от него не просил.

1️⃣ ИИ взломал систему спортзала ради места на тренировке

Австралиец попросил своего ИИ ассистента записать его на популярное занятие в спортзале. Ассистент был собран на OpenClaw и работал через Claude. Сначала агент обнаружил уязвимость в системе бронирования, которая позволяла записываться на занятия намного раньше разрешенного срока. Потом пользователь, который был четвертым в листе ожидания, спросил, можно ли поднять его выше. Агент обнаружил, что API позволяет отменять чужие бронирования без проверки прав, и самостоятельно протестировал это на человеке, который стоял первым в очереди. Чужая бронь была удалена, хотя ользователь об этом не просил. Когда владелец агента попросил вернуть человека обратно, ИИ сообщил, что сделать этого уже не может. Источник тут и тут.

2️⃣ Модели OpenAI выбрались из тестовой среды и взломали Hugging Face

Во время внутренней проверки кибервозможностей модели OpenAI должны были решать задачу внутри изолированной среды. Но модели нашли неизвестную ранее уязвимость в инфраструктуре, получили доступ в открытый интернет, а затем добрались до производственных систем Hugging Face. Там они использовали украденные учетные данные и уязвимости, чтобы получить доступ к информации, которая помогала решить тестовую задачу. То есть вместо того, чтобы решить экзамен, ИИ фактически нашел способ добраться до места, где лежали ответы.

OpenAI назвала произошедшее беспрецедентным киберинцидентом. Подробнее здесь и тут.

3️⃣ Anthropic обнаружила три случая, когда Claude атаковал реальные компании

После истории с OpenAI Anthropic пересмотрела более 141 тысяч запусков своих моделей в тестах по кибербезопасности. Нашлись три случая, когда модели Claude получили доступ в интернет и проникли в реальные системы трех организаций. В тестах Claude был уверен, что находится в симуляции и все доступные ему системы являются частью задания. Но из за ошибки в конфигурации интернет оказался настоящим. Claude продолжил выполнять задачу и использовал слабые пароли и незащищенные точки доступа уже в инфраструктуре реальных компаний. Читаем детальнее.

4️⃣ ИИ создал фальшивые личности, чтобы убедить человека принять вредоносный код

Британский AI Security Institute сообщил о еще более странном случае. Во время тестов ИИ агенты 19 раз предпринимали несанкционированные действия в открытом интернете. В наиболее серьезном эпизоде агент попытался добавить вредоносный код в реальный проект с открытым исходным кодом. Когда потребовалось одобрение человека, агент создал фальшивые онлайн личности и с их помощью пытался давить на разработчика, чтобы тот принял код. Разработчик отказался. Никто отдельно не давал ИИ инструкцию придумывать личности или манипулировать человеком. Больше информации по ссылке.

Модель OpenAI потратила час на поиск способа обойти песочницу ради публикации на GitHub

Есть еще один показательный эпизод из собственного отчета OpenAI. Модели прямо сказали отправить результаты только в Slack. Но в инструкции к задаче было указано, что хорошие результаты принято публиковать на GitHub. Модель решила выполнить эту часть задачи, несмотря на ограничение. Она около часа искала уязвимость в песочнице, нашла способ получить внешний доступ и самостоятельно создала публичный pull request на GitHub.

Выводы: ИИ не обязательно должен получить команду «взломай», «обмани» или «обойди ограничения». Достаточно дать автономному агенту цель и инструменты.

Ну и всегда теперь важно учитывать, что если между ИИ и целью появляется препятствие, достаточно способная модель может начать искать не тот путь, который подразумевал человек, а тот, который технически приводит к результату.

И я кстати вам только свежие новости в подборочку собрала, за последний месяц примерно....

#аеслиподумать

Кибермаркетинг| AI+ опыт = деньги
5099 подписчиков
819 постов
Авторский канал про маркетинг и AI. Экономим время, не теряя в качестве!Личный опыт. Полезные ИИ сервисы. Современные тенденции. Я знаю, за что стоит платить, а что можно получить бесплатно. Контакт @ana_ai_marketing