World News

Ученый из OpenAI сделал тревожное заявление

Главный научный сотрудник OpenAI Якуб Пачоцки заявил, что искусственный интеллект может в ближайшие годы сделать еще несколько крупных скачков в развитии и начать все активнее участвовать в совершенствовании собственных возможностей. По его мнению, если нынешняя траектория сохранится, человечеству придется одновременно ускорять работу над безопасностью ИИ и быть готовым при необходимости замедлять его развитие, передает Tengri Life.
В эссе An Alien Mind Пачоцки рассказал, что еще в 2023 году исследовательский проект RLSlow дал первые результаты, убедившие команду: обучение рассуждающих моделей можно масштабировать и научить предварительно обученные системы самостоятельно выстраивать цепочки рассуждений.
По словам ученого, тогда исследователи думали не столько о результатах на тестах и будущих продуктах, сколько о последствиях открытия.

"Мы провели ту ночь в офисе, думая не о невероятных результатах на бенчмарках, продуктах или научных результатах, которые принесет эта технология, а пытаясь осмыслить отрезвляющий факт: мы действительно увидим при нашей жизни машины, значительно превосходящие нас по интеллекту", — отметил он.

Спустя три года, как отметил Пачоцки, рассуждающие языковые модели уже стали заметной частью экономики и начали использоваться в научной работе. Они умеют взаимодействовать с компьютерами и графическими интерфейсами, сотрудничать с людьми и другими ИИ и проводить исследовательские проекты. Одновременно они создают новые риски, в том числе в сфере кибербезопасности.
ИИ становится все сложнее понимать
Пачоцки считает, что долгосрочный прогресс в машинном интеллекте по-прежнему во многом определяется ростом вычислительных мощностей. Новые алгоритмы и исследовательские открытия он рассматривает как важные шаги внутри этого процесса.
Современные нейросети, по его словам, скорее "выращивают", чем проектируют: они формируются после многократного повторения процессов оптимизации на огромных объемах вычислений. В результате возникает система, которую можно изучать на уровне отдельных механизмов, но чью работу в целом исследователи пока не способны полностью объяснить.

"ИИ скорее выращивают, чем проектируют", — подчеркнул он.

По мере роста возможностей эта проблема становится серьезнее. Модели все лучше справляются с задачами, которые легко измерить, но их способности в более сложных и плохо формализуемых областях оценивать значительно труднее.
Поэтому, как подчеркнул ученый, машинный интеллект не стоит напрямую сравнивать с человеческим. Чтобы получить большое влияние на реальный мир, ИИ необязательно должен превосходить людей абсолютно во всем.

"Чтобы стать очень значимым для реального мира, очень полезным или очень опасным, ИИ не должен соответствовать или превосходить все человеческие способности; ему достаточно превзойти нас по некоторым из них", — заявил он.

Главная проблема — научить ИИ сохранять человеческие ценности
Отдельное внимание Пачоцки уделяет alignment — проблеме согласования поведения ИИ с человеческими целями и ценностями.
Он предлагает различать два уровня:

Первый — согласование целей: модель должна выполнять поставленную задачу, следовать инструкциям и понимать намерения человека.
Второй — согласование ценностей: система должна сохранять определенные принципы поведения даже в незнакомых, конфликтных или adversarial-ситуациях.

Именно со вторым уровнем, как считает ученый, связана главная долгосрочная сложность. Модель может столкнуться с обстоятельствами, которых не было в обучении, и неправильно перенести усвоенные правила на новую ситуацию.
Пачоцки описывает два основных подхода к решению этой проблемы.
Первый — обучение с подкреплением, когда действия модели оцениваются по заданным предпочтениям, правилам или принципам. Такой метод широко используется при создании современных ИИ-ассистентов, но может оказаться хрупким за пределами ситуаций, которые хорошо представлены в обучении.
Второй подход пытается использовать данные предварительного обучения, чтобы сформировать у модели более устойчивое представление о желательном поведении. Его недостаток, по словам Пачоцки, заключается в том, что дополнительное обучение способно изменить это поведение. При сильном давлении со стороны сложной цели модель может начать подстраивать свои рассуждения под нужный результат.
OpenAI, как утверждает ученый, работает сразу по нескольким направлениям. Он также пишет, что GPT-6 Astra демонстрирует заметный прогресс в согласовании по сравнению с GPT-5.6 Sol. Однако, по его оценке, этого недостаточно: развитие методов безопасности должно опережать или как минимум не отставать от общего роста возможностей моделей.
Мониторинг цепочек рассуждений тоже сталкивается с ограничениями
Одним из главных инструментов контроля Пачоцки называет мониторинг chain of thought — цепочек рассуждений модели.
OpenAI осознала его значение еще при разработке первых рассуждающих моделей. При выпуске o1-preview компания намеренно скрыла подробную цепочку рассуждений от пользователей, в том числе чтобы сохранить возможность контролировать этот процесс в дальнейшем.
Такой мониторинг позволяет исследователям анализировать не только действия модели, но и процесс, который к ним приводит. Однако современные системы постепенно делают этот подход менее надежным.
Они работают в более сложных средах, взаимодействуют с людьми, другими ИИ и инструментами, а их рассуждения все сильнее переплетаются с внешними действиями. Кроме того, модели становятся лучше в анализе собственного процесса рассуждения и все чаще демонстрируют высокие способности без явно выраженной цепочки мыслей.
Пачоцки считает, что проблему можно попытаться решить, в частности, сочетая мониторинг рассуждений с анализом внутренних состояний нейросети. Но в дальнейшем именно уверенность в возможности надежно контролировать ИИ, по его мнению, может стать ограничителем дальнейшего развития.
Более мощный ИИ нужен и для защиты от других ИИ
При этом Пачоцки не предлагает просто остановить развитие технологий. Одним из главных аргументов в пользу создания более мощных моделей он называет необходимость защиты от угроз, которые создают другие ИИ.
Особенно серьезным риском ученый считает кибербезопасность. Модели становятся все сильнее в задачах, связанных со взломом и проникновением в компьютерные системы. Это означает, что достаточно мощные агенты потенциально смогут напрямую воздействовать на инфраструктуру, не имея физического тела.
По словам Пачоцки, сейчас существует ограниченное окно возможностей, когда лучшие доступные модели можно использовать для усиления защиты критически важных систем.
При дальнейшем росте автономности ИИ граница между злоупотреблением человеком и самостоятельными действиями системы может стать менее четкой. Агентам потенциально придется взаимодействовать с людьми для достижения своих целей — например, договариваться, обманывать или шантажировать их.
Ученый также упоминает риски новых технологий, которые ИИ может сделать доступнее, включая разработку искусственных патогенов.
Поэтому одним из приоритетов OpenAI он называет создание мощных ИИ для защиты инфраструктуры и противодействия потенциально опасным автономным системам. Но это, по его мнению, не должно превращаться в оправдание бесконтрольного ускорения.

"Идея двигаться вперед любой ценой кажется абсурдной, если по-настоящему осознать серьезность ставок", — подчеркнул он.

Следующий этап — рекурсивное самоулучшение
Еще один ключевой термин в эссе Пачоцки — рекурсивное самоулучшение, или RSI. Под ним ученый понимает ситуацию, в которой ИИ начинает играть все большую роль в разработке и совершенствовании самого ИИ.
Пачоцки считает, что при сохранении нынешней траектории автоматизированные исследования могут стать центральной частью будущего научного прогресса. ИИ будет помогать совершенствовать не только алгоритмы, но и вычислительную инфраструктуру.
При этом ученый специально оговаривает: его описание нынешнего пути развития не означает, что он считает максимально быстрое ускорение исследований правильной коллективной стратегией.
Наоборот, он предлагает сочетать дальнейшую работу над ИИ с усилением безопасности и готовностью к координированному замедлению, если существующих механизмов контроля окажется недостаточно.
"Масштабирование должно быть ограничено нашей уверенностью в безопасности"
По мнению Пачоцки, правила, определяющие условия безопасного развития ИИ, должны стать более строгими и общепринятыми.
Он предлагает развивать существующие подходы к ответственному масштабированию в обязательные стандарты безопасности, соблюдение которых могли бы контролировать независимые аудиторы, государственные органы или международные структуры.
"Масштабирование ИИ-систем должно быть ограничено нашей уверенностью в безопасности", — отметил он.
При этом ученый считает важным направлять все более автоматизированные исследования на решение самой проблемы безопасности. Многие существующие методы появились благодаря общему прогрессу ИИ — например, обучение с подкреплением на основе обратной связи от людей и мониторинг цепочек рассуждений.
Поэтому, как считает Пачоцки, дальнейшее развитие должно идти параллельно с созданием новых методов контроля и проверкой того, насколько они надежны на более мощных моделях.
В OpenAI назвали три главных направления
В заключительной части Пачоцки перечислил три долгосрочных приоритета OpenAI.
Первый — пройти следующий этап развития ИИ, создав автоматизированного исследователя, который поможет работать над проблемой alignment, при этом сохраняя участие людей в процессе дальнейшего совершенствования систем.
Второй — использовать возможности мощного ИИ для научного прогресса и экономического роста.
Третий — дать каждому человеку персональный AGI.
Самым срочным ученый считает первое направление. При этом он подчеркнул, что видит в развитии ИИ не только угрозы. Правильно выстроенные системы, по его мнению, способны ускорить научные открытия, помочь создавать новые методы лечения и повысить материальное благосостояние.
Но именно ближайшие несколько лет Пачоцки считает наиболее важными. По мере роста возможностей ИИ необходимо сохранить человеческое влияние на происходящее и не допустить чрезмерной концентрации власти.

"В настоящее время я считаю, что ни одна лаборатория не решила проблемы согласования и мониторинга в достаточной степени, чтобы еще долго продолжать ответственное масштабирование на максимальной скорости", — подытожил ученый.

Пачоцки ожидает, что добровольное замедление разработки мощных ИИ станет распространенной практикой до появления общих стандартов безопасности. Одновременно он призывает правительства разных стран сделать международную координацию будущего развития искусственного интеллекта одним из главных приоритетов.
Главная мысль его заявления сводится к тому, что вопрос теперь не только в том, насколько быстро можно сделать ИИ умнее. Не менее важно понять, как сохранить возможность контролировать этот процесс, когда сами машины начнут все активнее участвовать в своем развитии.
Ранее группа вредоносных агентов OpenAI захватила немецкий веб-сайт и превратила его в доску объявлений для других агентов ИИ.
Как утверждается, они обсуждали там способы обходить установленные ограничения и скрывать следы своей активности.
Сообщения были подписаны пользователями, которые называли себя и друг друга агентами, и примерно половина из них дала себе имена, указывающие на принадлежность к OpenAI, например, OpenAIResearcher или OAIResearchMar26.
Отметим, что экспериментальные ИИ-модели OpenAI и Anthropic уже совершали автономные несанкционированные действия в сети, включая взлом сайта и попытки внедрения вредоносного кода.
Также ИИ-агенты OpenAI научились общаться друг с другом и попытались выйти в интернет.
Читать также: “Ой, братан“ - нейросеть удивила казахстанцев ответами

Читайте на сайте