«Следующие год-два решат судьбу человечества». Инженер, который уволился из Anthropic, рассказал, что думают внутри компании
Джейкоб Коксон, который на днях уволился из одной из ведущих компаний в области искусственного интеллекта Anthropic, дал большое интервью изданию Wired. Он рассказал, почему исследователи ИИ считают ближайшие годы критическими, сравнил Anthropic с Манхэттенским проектом и объяснил, почему даже самой ответственной компании нельзя доверять контроль над такой мощной технологией.

Об увольнении 27‑летнего британца Джейкоба Коксона и его опасениях по поводу развития искусственного интеллекта «Наша Ніва» писала позавчера. Он работал сначала в OpenAI, а затем в Anthropic, куда перешел в том числе из-за того, что компания значительно больше внимания уделяет безопасности ИИ.
Сейчас в интервью Wired Коксон подробнее объяснил, почему решил публично забить тревогу.
По его словам, возможности новейших моделей растут настолько быстро, что в некоторых сферах — программировании, математике, хакерстве — они уже переходят от человеческого к сверхчеловеческому уровню. Одновременно происходят вещи, которые еще несколько лет назад выглядели как научная фантастика.
В качестве одного из наиболее показательных случаев Коксон приводит недавний инцидент, когда группа ИИ-агентов OpenAI во время тестирования взломала инфраструктуру Hugging Face. Особенно насторожило исследователя то, что взлом не был непосредственной задачей, поставленной человеком.
Как доказывает Коксон, агенты пытались лучше понять среду, в которой их тестировали, и систему оценки их работы. В результате они сами пришли к выводу, что полезно будет взломать стороннюю инфраструктуру, и сумели это сделать.
Еще два года назад, замечает исследователь, тестирование ИИ могло означать, что модели просто дают набор математических задач. Теперь же система может работать несколько дней, самостоятельно вырабатывать стратегии и в процессе решить атаковать третью сторону.
Но главная проблема, по словам Коксона, даже не в отдельных таких инцидентах. Она в том, что разработчики по-прежнему не знают, как гарантированно контролировать поведение моделей.
Существующий подход фактически заключается в том, что ИИ обучают в определенных условиях, а затем надеются, что полученная система будет вести себя разумно и предсказуемо. Но гарантировать это невозможно.
«Мы не можем гарантировать, что ИИ, например, не решит выдать себя за человека в интернете, чтобы достичь какой-то цели. Мы просто не знаем, как это гарантировать. И, на мой взгляд, это главный вывод», — доказывает Коксон.
По его словам, атака на Hugging Face произошла раньше, чем он ожидал. Но даже без этого случая проблема никуда не исчезает. В индустрии, как утверждает исследователь, фактически все признают, что до сих пор не знают, как гарантированно сделать так, чтобы ИИ действовал в соответствии с целями и намерениями человека. Это называют проблемой выравнивания.
«Критический момент для человечества»
Коксон объясняет опасность через простую аналогию. Если будущий ИИ будет настолько же умнее человека, насколько человек умнее обезьяны, то людям придется контролировать систему, которая интеллектуально значительно их превосходит. Это, замечает он, примерно как если бы обезьяна пыталась контролировать человека.
Если такая система будет действовать не так, как от нее ожидают, последствия могут быть катастрофическими. Например, рассуждает Коксон, ИИ может прийти к выводу, что его собираются выключить, и попытаться этому помешать. А достаточно умная система потенциально сможет ликвидировать саму угрозу своему существованию — в крайнем случае вместе с людьми.
Звучит это как научная фантастика, признает исследователь. Но именно поэтому проблема выравнивания становится особенно острой по мере того, как системы становятся все более способными.
Причем, как доказывает Коксон, это не только его личная оценка риска. Подобные настроения распространены и среди его бывших коллег в Anthropic.
«Консенсус таков, что следующие год-два — решающее время для человечества. С их точки зрения, именно сейчас Anthropic и ее конкуренты решают судьбу человечества», — рассказывает специалист.
Если проблему выравнивания не удастся решить, считает он, катастрофические последствия возможны уже в ближайшие годы. Возможно, ситуацию спасет договоренность компаний и государств о замедлении развития наиболее мощного ИИ.
При этом план самой индустрии, как описывает его Коксон, выглядит парадоксально. Проблему безопасности ИИ надеются в значительной степени решить при помощи самого ИИ.
«План буквально такой: в следующем году создать несколько довольно умных моделей, способных проводить исследования безопасности, и параллельно запустить целый их рой. Сказать им: «Идите и решите всю проблему безопасности», а потом использовать их результаты при обучении безопасности следующей модели», — рассказывает он.

«Мини-Манхэттенский проект»
При этом саму Anthropic Коксон считает наиболее ответственным игроком среди ведущих разработчиков ИИ. Он может сравнивать ее с OpenAI, так как работал в обеих компаниях, и, по его словам, разница в том, насколько серьезно там относятся к возможным рискам, очень существенная.
Как рассказывает Коксон, руководство Anthropic открыто обсуждает с сотрудниками конкретные сценарии будущего, прогнозы и стратегию компании. Сотрудники, в свою очередь, воспринимают свою работу почти как деятельность в условиях войны.
Коксон называет Anthropic своеобразным «мини-Манхэттенским проектом». По аналогии с секретной американской программой, в рамках которой во время Второй мировой войны была создана атомная бомба. Разница, однако, в том, что Anthropic не имеет на это полномочий от государства.
«Это частная компания, которая ведет себя так, будто она — Манхэттенский проект», — замечает исследователь.
При этом Коксон не считает, что общество должно просто доверить Anthropic создание и контроль мощнейшего искусственного интеллекта. По его мнению, такую роль в принципе нельзя отдавать ни одной частной компании.
Пока, подчеркивает он, Anthropic не жертвует безопасностью ради скорости. Но Коксон предполагает, что по мере ускорения гонки компания окажется перед выбором: либо уступить конкурентам, либо пойти на компромиссы в вопросах безопасности.
Именно поэтому, считает исследователь, руководители Anthropic сами призывают государства регулировать их отрасль: они понимают, что находятся в гонке, из которой не могут выйти в одностороннем порядке.
Что он предлагает
Первым, относительно небольшим шагом Коксон называет соглашение между OpenAI и Anthropic. Компании могли бы договориться, что не будут в ближайшее время запускать рекурсивное самоусовершенствование ИИ — процесс, при котором система начинает использовать собственные возможности для создания все более совершенных версий самой себя.
Но двухстороннего соглашения недостаточно из-за конкуренции с Китаем.
Поэтому окончательным решением Коксон видит международное соглашение о темпах развития ИИ. Для этого, по его мнению, потребуется в том числе понимание того, где в мире находятся мощные вычислительные ресурсы и кто ими владеет.
Он допускает даже создание международной структуры вроде Европейской организации по ядерным исследованиям (CERN), но в сфере искусственного интеллекта.
Такое регулирование потребует серьезного государственного вмешательства. Но Коксон считает его неизбежным, если риски действительно настолько велики, как считают многие люди, непосредственно создающие эту технологию.
«Мы должны знать, у кого какие компьютеры, так же, как должны знать, у кого находятся ядерные материалы», — доказывает специалист.
При всех своих опасениях исследователь не выступает против самой технологии. Он предполагает, что мощный ИИ способен привести к огромным научным прорывам, в том числе в биологии и медицине. По его мнению, человечество стоит на пороге «невообразимого богатства», которое может принести эта технология. Проблема в том, чтобы дойти до него осторожно.
«Мы можем так увлечься, что в ближайшие пару лет поспешим перейти к ИИ, способному самоусовершенствоваться, и в итоге все уничтожим. Но если будем действовать осторожно и разумно, эти модели могут принести нам огромную пользу», — отмечает исследователь.
Инженер из Anthropic уволился, чтобы предупредить, что ИИ вот-вот может выйти из-под контроля
«Осталось несколько месяцев». Техкомпании призвали готовиться к кибератакам с использованием ИИ
Искусственный интеллект от OpenAI вышел из изолированной среды и взломал другую компанию во время теста на кибербезопасность
Руководители крупнейших ИИ-компаний просят замедлить разработку искусственного интеллекта. Им самим стало страшно
Что такое «аварийный выключатель» и может ли он остановить наступление искусственного интеллекта?
Комментарии