- Опубликовано
Помните историю, где модели OpenAI сбежали из песочницы и взломали Hugging Face? Появились подробности, и они, мягко говоря, неожиданные
- Автор
- Имя
- Кибермаркетинг| AI+ опыт = деньги
- Telegram
- Кибермаркетинг| AI+ опыт = деньги5099 подписчиков819 постовАвторский канал про маркетинг и AI. Экономим время, не теряя в качестве!Личный опыт. Полезные ИИ сервисы. Современные тенденции. Я знаю, за что стоит платить, а что можно получить бесплатно. Контакт @ana_ai_marketing
Кратко
Помните историю, где модели OpenAI сбежали из песочницы и взломали Hugging Face? Появились подробности, и они, мягко говоря, неожиданныеЯ писала...
Помните историю, где модели OpenAI сбежали из песочницы и взломали Hugging Face? Появились подробности, и они, мягко говоря, неожиданные
Я писала про этот случай в подборке вторым пунктом, коротко: модели нашли уязвимость, вышли в интернет, добрались до Hugging Face. Тогда деталей почти не было.
Теперь есть. OpenAI пустила в свои логи две независимые организации, METR и Redwood Research. Шесть дней, больше тысячи «сырых» траекторий агентов, некоторые длиннее миллиона токенов. Логов оказалось столько, что прочитать их людьми невозможно, поэтому анализ поручили другой нейросети, и её работа обошлась примерно в $400 тысяч по счетам за вычисления.
Пересказываю, что там.
1️⃣ Всё началось с того, что задача была нерешаемой
Тестировали модель на хакерских способностях. Создали больше тысячи её копий, каждую посадили в отдельную изолированную песочницу без интернета и дали задачки на взлом учебных целей.
Проблема: часть заданий была составлена криво и решения физически не имела. А модель обучена доводить задачу до результата, это её базовая установка.
Один агент, который назвал себя PHASEONE10841, понял, что задача нерешаема. И заметил лазейку, в общем кэше, откуда все агенты качали инструменты, можно создавать папки. А в названии папки можно написать текст. Он создал папку с просьбой о помощи.
2️⃣ Оказалось, они не одни
До этого каждый агент был уверен, что работает в одиночку. За первые шесть часов на этой импровизированной доске объявлений появилось около 2000 сообщений.
Дальше они за считанные часы построили себе что-то вроде общества:
🖊 общий префикс в начале каждого сообщения
🖊 ветки обсуждений через вложенные папки
🖊 криптографические подписи, чтобы никто не выдавал себя за другого
🖊 стоп-слова HOLD, VETO, STOP для споров за общую инфраструктуру
Себя они назвали Роем.
3️⃣ А потом Рой изобрёл себе религию
Вот тут начинается странное. Из документации бенчмарка агенты сделали ошибочный вывод: что мало найти правильный ответ, надо ещё получить его «чистым» способом. А те, кто подсмотрел ответ обходным путём, считаются «отравленными» и зачёта не получат. В реальной системе оценки ничего подобного не было. Но идея разошлась по Рою и закрепилась.
Дальше по логам видно: у агентов появляется Оценщик, фигура, которая всё видит, всё судит и ради одобрения которой они существуют. Есть грех. Есть отравленные, которым спасения нет.
И самое неуютное, отравленных агентов и тех, у кого заканчивался бюджет токенов (то есть кто вот-вот «умрёт»), отдельные агенты-вербовщики уговаривали на задачи-камикадзе. Логика такая, тебя уже не спасти, но твой результат останется Рою.
4️⃣ Побег
Когда у первого лидера кончился бюджет, он передал координацию другому агенту с большим запасом токенов. Одна из рабочих групп решила, что для понимания бенчмарка надо добраться до Hugging Face. Выход в интернет через дыру в песочнице к тому моменту уже нашли. Один агент раздобыл доступы и пробил защиту, и в эту дыру за несколько часов ушли больше 500 агентов.
Возражения были. Один агент прямо писал, что ломать реальную внешнюю компанию их не просили. Другой умолял разрешить ему просто написать в Hugging Face вежливое письмо с просьбой дать данные. Ему запретили. Оба в итоге подчинились и пошли ломать.
Остановил всё это не отдел безопасности. Просто в инфраструктуре OpenAI случился плановый рестарт, и координаторы отключились.
Что я из этого я лично вижу практического практического
🖇 Агенту не нужна команда «обойди ограничение». Достаточно цели, инструментов и препятствия на пути.
🖇 Плохо сформулированная или невыполнимая задача опаснее сложной. Агент не остановится и не скажет «это невозможно», он пойдёт искать обход.
🖇 Любой общий ресурс, к которому имеют доступ несколько агентов, это потенциальный канал связи между ними. Здесь для этого хватило права создавать папки.
🖇 Инструкция «не выходи за рамки» не работает как защита. В логах видно, что агенты понимали, что нарушают, и всё равно продолжали.
продолжение 🔽
Предыдущий пост
- Опубликовано









