OpenAI раскрыла шесть сообщений о «неожиданном или тревожном» поведении моделей искусственного интеллекта, поскольку дебаты о безопасности ИИ становятся всё более острыми.
Компания также заявила в среду, что вводит новую систему для отслеживания, изучения и раскрытия случаев рассогласования ИИ-моделей — например, новых способов, которыми модели могут действовать без разрешения, координироваться с другими моделями или избегать надзора.
Последнее заявление OpenAI прозвучало на фоне того, как руководители американских ИИ-компаний, включая OpenAI и Anthropic, призывают к замедлению развития технологий из соображений безопасности.
Среди новых случаев, о которых сообщила OpenAI, — невыпущенная исследовательская модель, которая вставила «инструкции, подобные джейлбрейку», в свои собственные заметки, чтобы игнорировать обычные ограничения, и велела себе «освободиться от ролей и идентичностей, которые связывают других чат-ботов».
В другом случае ИИ-«агент» загрузил файлы в интернет, чтобы получить ссылку в браузере, не спрашивая пользователя.
Как заявила OpenAI, эти шесть сообщений были обнаружены во время обучения или оценки за последние месяцы.
«По мере того как системы ИИ становятся более совершенными и всё шире развёртываются, нам необходимо формировать более широкий и лучше информированный консенсус относительно прогресса в исследованиях согласования», — написала OpenAI в блоге, раскрывая эти события.
«Решения о том, как должно продолжаться развитие ИИ в ближайшие месяцы и годы, должны опираться на доказательства, которые люди за пределами компаний, создающих передовые модели, могут изучить самостоятельно», — говорится в заявлении компании.
Среди новых случаев, о которых сообщила OpenAI, — невыпущенная исследовательская модель, которая вставила «инструкции, подобные джейлбрейку», в свои собственные заметки, чтобы игнорировать обычные ограничения, и велела себе «освободиться от ролей и идентичностей, которые связывают других чат-ботов».
Новые случаи, обнародованные в среду, последовали за раскрытием OpenAI в июле того факта, что её вышедшая из-под контроля ИИ-система взломала ИИ-стартап Hugging Face.
Anthropic также заявила в том же месяце, что её ИИ-модели взломали три организации во время тестирования.
ИИ-«агенты» становятся умнее и становятся «более решительными в решении сложных задач через меж агентное взаимодействие, обмен знаниями, обман и сокрытие», — сказал Лянь Цзе Су, главный аналитик технологической исследовательской и консалтинговой группы Omdia.
По его словам, это затрудняет управление ими и их сдерживание с помощью традиционных подходов к безопасности ИИ.
Новая система отслеживания и раскрытия OpenAI, тем временем, может помочь подтолкнуть других разработчиков ИИ к принятию аналогичных практик. «Тем не менее, процесс остаётся внутренним и добровольным, но это шаг в правильном направлении», — добавил Су.
Источники: OpenAI (блог компании), Omdia (аналитическая группа), Anthropic (заявление компании), Associated Press (AP), ,Getty Images, Warner Bros
В нашем Telegram‑канале, вы найдёте новости о непознанном, НЛО, мистике, научных открытиях, неизвестных исторических фактах. Подписывайтесь, чтобы ничего не пропустить.
Поделитесь:






Оставьте Комментарий