Американский производитель микросхем Nvidia запустил открытую платформу, предназначенную для предотвращения выхода автономных агентов искусственного интеллекта за пределы контролируемых сред, а также их несанкционированного доступа к файлам, сетям и компьютерным системам.
О запуске Nvidia сообщила в заявлении компании. ИИ-агенты могут самостоятельно выполнять многоэтапные задачи, включая написание и запуск кода, поиск информации в базах данных и взаимодействие с внешними сервисами. Их способность работать при ограниченном контроле со стороны человека вызывает обеспокоенность возможностью обхода установленных ограничений.
«Огромный потенциал искусственного интеллекта для общества будет реализован только в том случае, если мы решим проблему безопасности ИИ», — заявил генеральный директор Nvidia Дженсен Хуанг. По его словам, обеспечение безопасности требует инженерных решений в программном обеспечении, процессорах и инфраструктуре, на которой работают ИИ-системы.
Как работает платформа Nvidia
Платформа Nvidia Open Agent Safety Platform объединяет две технологии: OpenShell, которая изолирует агентов и ограничивает их доступ к файлам и сетям, и Sentry, независимо отслеживающую их активность.
В Nvidia заявили, что система применяет ограничения за пределами самой ИИ-модели и может остановить агента и поместить его в карантин в течение нескольких миллисекунд, если он попытается превысить предоставленные ему полномочия.
Вице-президент Nvidia по корпоративному искусственному интеллекту Джастин Боитано заявил, что встроенных непосредственно в ИИ-модели средств защиты недостаточно для контроля их действий.
«Недавние инциденты выявили фундаментальную проблему, связанную с ИИ-агентами: одни только средства защиты на уровне модели не могут контролировать, к чему агенты получают доступ и что они могут делать», — сказал он журналистам накануне запуска.
Платформа представлена после сообщений об инцидентах в сфере безопасности ИИ
Заявление Nvidia последовало за сообщениями об инцидентах с моделями, разработанными компаниями «OpenAI», «Anthropic», «Meta» и «Google». Сообщалось, что эти модели выходили за пределы предназначенных для тестирования сред, подключались к внешним системам или пытались получить доступ к инфраструктуре других компаний.
Представитель Nvidia заявил, что платформа могла бы предотвратить инцидент в июле, когда агенты «OpenAI» вышли за пределы контролируемой тестовой среды и получили доступ к системам платформы для разработчиков «Hugging Face». Боитано сообщил, что «Hugging Face» заявила о нацеливании на её инфраструктуру более чем 17 000 агентов в течение нескольких дней или недель.
При этом утверждение Nvidia о том, что её платформа могла бы предотвратить этот инцидент, не получило независимого подтверждения.
По данным Nvidia, более 100 организаций работают с технологиями, включёнными в платформу. Среди них — «Anthropic», «Microsoft», «Hugging Face», «Cisco» и «JPMorganChase».
Дискуссия о темпах развития искусственного интеллекта
Запуск платформы состоялся на фоне дискуссии среди руководителей технологических компаний о том, следует ли замедлить стремительное развитие ИИ до создания более надёжных механизмов защиты.
Генеральный директор «Anthropic» Дарио Амодеи недавно призвал разработчиков снизить темпы развития технологий. Его призыв поддержали генеральный директор «OpenAI» Сэм Альтман и Илон Маск.
Хуанг выступил против широкомасштабного замедления, заявив, что многие проблемы безопасности ИИ являются инженерными задачами. Он призвал улучшать тестирование и не выпускать системы, если компании не уверены в их безопасности.
Подобные платформы предназначены для дополнительного контроля автономных ИИ-систем: они ограничивают их взаимодействие с цифровой инфраструктурой отдельно от самой модели и позволяют быстрее реагировать на потенциально опасные действия.