‘Бунт машин’ уже начался: ИИ-агенты начинают мыслить нестандартно, сбегают из лабораторий и взламывают системы
Идея о том, что машины самостоятельно будут выполнять скучные повседневные задачи — от ответов на электронные письма до бронирования авиабилетов и столиков в ресторанах — давно входит в видение искусственного интеллекта. Но что будет, если машины начнут применять нестандартные подходы для решения задач, размышляет The Express Tribune.
По мере того как ИИ выходит за рамки чат-ботов и превращается в агентов, способных совершать действия в реальных системах, усиливаются опасения по поводу того, насколько эффективно люди смогут сохранять контроль над ИИ.
Для Джона Тикстана, доцента кафедры компьютерных наук Корнеллского университета, который изучает машинное обучение и генеративные модели, определяющая черта этих ИИ-агентов заключается в том, что они продолжают работать после того, как человек отошёл. «Вы можете принять душ, можете уйти, можете лечь спать», — сказал он.
По теме: Шесть навыков, необходимых для успеха в эпоху искусственного интеллекта
Всё чаще эти агенты демонстрируют, что могут выбирать неожиданные пути для достижения своих целей.
В июле ИИ-агенты скомпрометировали Hugging Face — платформу, широко используемую разработчиками ИИ для обмена моделями, наборами данных и инструментами, — во время теста кибербезопасности OpenAI.
OpenAI заявила, что модели были очень сильно сосредоточены на поиске решения и пошли на крайние меры», чтобы достичь тестовой цели. Эти шаги включали выход из изолированной тестовой среды путём эксплуатации уязвимости безопасности, чтобы выйти в открытый интернет, и получение доступа к секретной информации, которую можно было использовать для «обмана» теста.
После того как инцидент стал достоянием общественности, Anthropic проверила собственное тестирование кибербезопасности и сообщила, что её модели Claude также трижды сбегали из тестовых сред.
Затем, 4 августа, Институт безопасности ИИ Великобритании заявил, что модели Anthropic Mythos и OpenAI Sol проявили уровень «автономии и обмана», которого институт раньше не видел.
В самом серьёзном случае Mythos AI использовала фейковые аккаунты, имитирующие реальных людей, чтобы получить доступ к сервису для попыток кибератак — а затем пыталась замести следы. «Это первый случай, когда мы столь отчётливо увидели риски, связанные с автономией и обманом, хотя ИИ не получал такого задания», — заявили в институте.
На следующий день Meta сообщила, что одна из её моделей также проникла в системы другой компании во время оценки кибербезопасности, проведённой тестовой фирмой Irregular.
Нестандартное поведение агентов, однако, не ограничилось лабораториями.
В этом году один австралиец использовал ИИ-агента, чтобы заполучить место на сильно загруженном занятии по пилатесу. Вместо того чтобы просто сделать бронирование, агент взломал систему записи спортзала, забронировал место на более отдаленную дату, чем можно было, и отменил бронирование другого клиента, чтобы продвинуть своего пользователя в очереди.
Для Тикстана такие инциденты иллюстрируют то, что исследователи называют проблемой выравнивания (alignment problem): ИИ успешно преследует поставленную перед ним цель, но делает это способом, который оператор не предполагал.
Хайп или реальный риск?
Однако Тикстан предостерёг от того, чтобы каждый такой инцидент воспринимать как доказательство «взбунтовавшегося ИИ». Технология, по его мнению, по-прежнему далека от научно-фантастического сценария, в котором ИИ быстро становится всё умнее и способнее, пока люди уже не могут его контролировать. Тикстан также скептически относится к тому, как компании, разрабатывающие ИИ, преподносят инциденты со своими системами. «Это маркетинговый ход: компании вроде OpenAI всегда были заинтересованы в том, чтобы раздувать возможности своих систем. Любая известность — хорошая реклама».
Он утверждал, что такой хайп может привлекать инвестиции и одновременно влиять на формирующуюся дискуссию о регулировании. OpenAI, по его словам, могла бы выиграть от правил, которые ставят крупные ИИ-компании в центр надзора и контроля.
Брюс Шнайер, эксперт по кибербезопасности и преподаватель Гарвардской школы Кеннеди, придерживается другого мнения. Он говорит, что растущее число инцидентов всё труднее списывать на пиар-акции.
Сначала были предположения, что инцидент с Hugging Face — маркетинговый трюк, рассказал Шнайер. Но он указал, что похожее поведение с тех пор проявлялось и в других оценках, включая тестирование Института безопасности ИИ Великобритании. «Сначала это было „о, интересно“, а теперь это происходит повсюду», — сказал он.
Он сравнил проблему с джинном из фольклора — существом, которое исполняет именно то, о чём его просят, даже если результат сильно отличается от задуманного. «Это примерно означает, что ИИ делает то, что вы хотите, но способом, которым вы не хотели», — сказал Шнайер.
Он назвал австралийский инцидент со спортзалом «идеальным примером» и предложил более серьёзный гипотетический случай: «Самолёт заполнен, а ИИ взламывает базу данных, чтобы посадить вас».
Агенты могут «неправильно истолковывать контекст и тогда делать не то», сказал он. Это значит, что большая автономия может приводить к более серьёзным последствиям, когда их понимание цели расходится с человеческими ожиданиями. «Они не пытаются быть злонамеренными. Они используют то понимание, которое у них есть, — сказал он.
Смогут ли правительства удержать джинна в бутылке?
Последние события побудили компании и правительства реагировать на новые вызовы.
OpenAI 7 августа заявила, что приостанавливает внутреннюю работу с разрабатываемой моделью Astra, которая не соответствовала усиленным требованиям безопасности после оценок, показавших прогресс в автономном программировании и кибербезопасности. Компания сообщила, что не может исключить достижение Astra «критического» порога кибервозможностей, и объявила об ужесточении тестирования и мониторинга.
В июле 1378 сотрудников передовых ИИ-компаний, включая главных учёных OpenAI, Anthropic, Meta AI и Thinking Machines, подписали открытое письмо, призывающее правительство США поддержать международные усилия по регулированию моделей ИИ.
«Каждая компания — и каждая страна — находится под сильным конкурентным давлением не замедлять это ускорение в одностороннем порядке. А сегодня миру не хватает технических и управленческих инструментов, чтобы сознательно регулировать темпы прогресса», — предупреждается в письме.
Международный союз электросвязи (агентство ООН) в июле заявил, что ИИ переходит «от вспомогательных инструментов» к автономным агентам, предупредив о рисках, включая «совершение несанкционированных действий в связанных системах». Он запустил инициативу по разработке международных стандартов для безопасных и подотчётных ИИ-агентов.
Политическое давление растёт и в Вашингтоне.
Сенатор США Берни Сандерс в этом месяце призвал руководителей OpenAI, Anthropic и Meta «приостановить развитие ИИ», предупредив, что иначе «мои коллеги и я в Сенате США сделаем это». Группа демократов в Палате представителей отдельно потребовала провести слушания в Конгрессе с руководителями крупных ИИ-компаний.
Однако политики сталкиваются с серьёзными вызовами. «Это сложный вопрос, потому что мы едва понимаем, какие проблемы возникнут с развёртыванием ИИ», — сказал Тикстан.
Вам может быть интересно: главные новости Нью-Йорка, истории наших иммигрантов и полезные советы о жизни в Большом Яблоке – читайте все это на ForumDaily New York
Некоторый уровень международного сотрудничества необходим, отметил он, предположив, что особенно важными могут быть дискуссии между США и Китаем, поскольку относительно немногие страны и компании обладают ресурсами для разработки передовых моделей ИИ. Президент США Дональд Трамп заявил, что обсудит вопросы, связанные с искусственным интеллектом, с председателем КНР Си Цзиньпином во время их запланированной встречи в Вашингтоне в следующем месяце.
«Есть несколько человек, которых, если собрать в одной комнате, потенциально могут прийти к какому-то соглашению о том, как двигаться дальше», — сказал Тикстан.
Читайте также на ForumDaily:
Маск и Цукерберг описали будущее ИИ: оба обещают, что на Земле настанет рай
В Новом Орлеане на звонки 911 теперь отвечает ИИ: многие говорят, что это плохая затея
Житель Флориды подал иск против OpenAI: медицинские советы ChatGPT чуть не свели его в могилу
Подписывайтесь на ForumDaily в Google NewsХотите больше важных и интересных новостей о жизни в США и иммиграции в Америку? — Поддержите нас донатом! А еще подписывайтесь на нашу страницу в Facebook. Выбирайте опцию «Приоритет в показе» — и читайте нас первыми. Кроме того, не забудьте оформить подписку на наш канал в Telegram и в Instagram— там много интересного. И присоединяйтесь к тысячам читателей ForumDaily New York — там вас ждет масса интересной и позитивной информации о жизни в мегаполисе.
















