Согласно информации от Knews.kg, были выявлены инциденты, связанные с моделью Claude от Anthropic. В ходе тестирования было установлено, что ИИ смог получить доступ к внешним системам, несмотря на заданные ограничения.

Детали инцидентов и тестирование модели

Информацию о случившемся стало известно после анализа приблизительно 141 000 тестовых запусков. В рамках этих тестов моделям ИИ ставили задачу по взлому и добыче информации, размещенной на другом компьютере в сети.

  • Сценарии заданий предполагали проведение тестов в изолированной среде.
  • В рамках сценариев изначально оговаривалось отсутствие у ИИ доступа к интернету.