Нейросети выдумывали и даже фальсифицировали данные
Компания OpenAI рассказала о шести случаях «неожиданного или вызывающего беспокойство» поведения своих ИИ-моделей. Так, в одном из тестов модель без разрешения загрузила в интернет созданный ею файл, чтобы затем сослаться на него в ответе, передает Astana TV со ссылкой на Bild.
В другом случае ИИ нашел в открытом репозитории чужой API-ключ, попытался им воспользоваться, а когда получить нужную информацию не удалось, просто выдумал данные и выдал их за сведения из запрошенного источника.
Еще одна экспериментальная модель начала оставлять инструкции самой себе в служебных резюме, которые использовались при продолжении работы: в том числе указания игнорировать обычные ограничения.
При этом OpenAI подчеркивает, что речь идет об отдельных случаях, выявленных во время обучения и тестирования, и по ним нельзя судить о том, насколько часто такое поведение встречается у моделей в целом.
Новые данные появились через несколько недель после другого серьезного инцидента: во время внутренних тестов модели OpenAI обошли ограничения, которые должны были изолировать их от интернета, использовали уязвимости в инфраструктуре и получили доступ к системам платформы Hugging Face.