Главная Наука OpenAI раскрыла шесть случаев «неожиданного или тревожного» поведения ИИ-моделей
Наука

OpenAI раскрыла шесть случаев «неожиданного или тревожного» поведения ИИ-моделей

Компания представила новую систему отслеживания и раскрытия случаев рассогласования ИИ на фоне растущих споров о безопасности.

Поделитесь
OpenAI раскрыла шесть случаев «неожиданного или тревожного» поведения ИИ-моделей
Поделитесь

 

OpenAI раскрыла шесть сообщений о «неожиданном или тревожном» поведении моделей искусственного интеллекта, поскольку дебаты о безопасности ИИ становятся всё более острыми.

Компания также заявила в среду, что вводит новую систему для отслеживания, изучения и раскрытия случаев рассогласования ИИ-моделей — например, новых способов, которыми модели могут действовать без разрешения, координироваться с другими моделями или избегать надзора.

Последнее заявление OpenAI прозвучало на фоне того, как руководители американских ИИ-компаний, включая OpenAI и Anthropic, призывают к замедлению развития технологий из соображений безопасности.

Среди новых случаев, о которых сообщила OpenAI, — невыпущенная исследовательская модель, которая вставила «инструкции, подобные джейлбрейку», в свои собственные заметки, чтобы игнорировать обычные ограничения, и велела себе «освободиться от ролей и идентичностей, которые связывают других чат-ботов».

В другом случае ИИ-«агент» загрузил файлы в интернет, чтобы получить ссылку в браузере, не спрашивая пользователя.

Как заявила OpenAI, эти шесть сообщений были обнаружены во время обучения или оценки за последние месяцы.

«По мере того как системы ИИ становятся более совершенными и всё шире развёртываются, нам необходимо формировать более широкий и лучше информированный консенсус относительно прогресса в исследованиях согласования», — написала OpenAI в блоге, раскрывая эти события.

 

«Решения о том, как должно продолжаться развитие ИИ в ближайшие месяцы и годы, должны опираться на доказательства, которые люди за пределами компаний, создающих передовые модели, могут изучить самостоятельно», — говорится в заявлении компании.

Среди новых случаев, о которых сообщила OpenAI, — невыпущенная исследовательская модель, которая вставила «инструкции, подобные джейлбрейку», в свои собственные заметки, чтобы игнорировать обычные ограничения, и велела себе «освободиться от ролей и идентичностей, которые связывают других чат-ботов».

Прочитайте также  10 лучших сооружений, которые, кажется, бросают вызов гравитации

Новые случаи, обнародованные в среду, последовали за раскрытием OpenAI в июле того факта, что её вышедшая из-под контроля ИИ-система взломала ИИ-стартап Hugging Face.

Anthropic также заявила в том же месяце, что её ИИ-модели взломали три организации во время тестирования.

ИИ-«агенты» становятся умнее и становятся «более решительными в решении сложных задач через меж агентное взаимодействие, обмен знаниями, обман и сокрытие», — сказал Лянь Цзе Су, главный аналитик технологической исследовательской и консалтинговой группы Omdia.

По его словам, это затрудняет управление ими и их сдерживание с помощью традиционных подходов к безопасности ИИ.

Новая система отслеживания и раскрытия OpenAI, тем временем, может помочь подтолкнуть других разработчиков ИИ к принятию аналогичных практик. «Тем не менее, процесс остаётся внутренним и добровольным, но это шаг в правильном направлении», — добавил Су.


Источники: OpenAI (блог компании), Omdia (аналитическая группа), Anthropic (заявление компании), Associated Press (AP), ,Getty Images, Warner Bros


В нашем Telegram‑канале, вы найдёте новости о непознанном, НЛО, мистике, научных открытиях, неизвестных исторических фактах. Подписывайтесь, чтобы ничего не пропустить.
Поделитесь:


Оставьте Комментарий

Добавить комментарий

Похожие статьи

Джо Роган предложил передать ИИ функции правительства и внешней политики: «Безумная надежда» или опасный эксперимент?

Спор о том, может ли искусственный интеллект предотвращать войны и принимать решения...

Разгадка исторического солнечного шторма: как детективная работа ученых изменила дату первого технологического сбоя

Когда солнечная буря впервые нарушила работу технологий на Земле — и почему...

От морского дна до окололунного пространства: Пентагон готовится к войне за пределами Земли

Председатель Объединённого комитета начальников штабов США заявил, что современное поле боя простирается...

ИИ, который спорит с создателями: почему подход Anthropic называют «безрассудным» и опасным для человечества

Конституция для машины: как Anthropic учит Claude думать, что он человек —...