Историю безопасности ИИ часто рассказывают как спор двух лагерей: одни хотят быстрее развивать технологии, другие требуют остановиться. Реальная картина сложнее. Значительная часть самых острых конфликтов происходила внутри самих лабораторий — между людьми, которые соглашались в том, что сильный ИИ требует контроля, но расходились во мнениях о ресурсах, сроках и приоритетах.
Один из ключевых эпизодов начался 5 июля 2023 года. OpenAI объявила о создании команды Superalignment. Её возглавили сооснователь и главный учёный компании Илья Суцкевер и бывший исследователь DeepMind Ян Лейке. Компания сформулировала необычно конкретную цель: за четыре года добиться научных и технических прорывов, необходимых для управления системами значительно умнее человека.
На проект публично обещали направить 20% доступных OpenAI вычислительных ресурсов за четыре года. Для safety-исследований это было сильным сигналом: проблема позиционировалась не как вспомогательная этика, а как одна из центральных научных задач.
Однако уже весной 2024 года вокруг команды начался кризис.
14 мая OpenAI объявила об уходе Ильи Суцкевера. Сам он не заявлял, что покидает компанию из-за разногласий по безопасности. Напротив, в публичном сообщении поддержал дальнейшую траекторию OpenAI и выразил уверенность, что компания создаст безопасный и полезный AGI.
Через несколько дней ушёл Ян Лейке, и его объяснение было другим. 17 мая он написал, что длительное время не соглашался с руководством по поводу основных приоритетов и в итоге достиг «точки разрыва». По его словам, команде становилось труднее получать вычислительные ресурсы, а культура и процессы безопасности, по его оценке, отходили на второй план перед выпуском новых продуктов.
В тот же период стало известно, что отдельная команда Superalignment фактически перестала существовать. Её сотрудников распределили по другим исследовательским направлениям. СМИ интерпретировали это как ослабление отдельной долгосрочной safety-программы.
OpenAI отвечала иначе. В мае 2024 года компания опубликовала safety update, где подчёркивала, что безопасность должна быть встроена в разработку на всех временных горизонтах и не ограничиваться одной командой.
Таким образом, спор был не только о том, «важна ли безопасность». Он был о структуре: должна ли существовать отдельная организация с заранее обещанными ресурсами или safety должна быть распределена по всей компании.
Похожую дилемму можно увидеть у Anthropic, хотя организационная модель другая. В сентябре 2023 года компания опубликовала первую Responsible Scaling Policy. В последующие годы политика многократно обновлялась. К 2026 году Anthropic уже выпускала Risk Reports, Frontier Safety Roadmap и отдельные цели по security, safeguards, alignment и policy.
Публичный характер этих документов позволяет видеть не только обещания, но и изменения приоритетов. Например, в 2026 году компания сдвигала сроки отдельных moonshot-security проектов и объясняла перераспределение ресурсов между направлениями. В одних случаях цели считались выполненными, в других — заменялись или переформулировались.
Такая прозрачность полезна, но одновременно показывает реальную природу AI safety: это не один статический чек-лист. Лаборатории постоянно спорят о том, какой риск критичнее и на что направить ограниченные compute, инженерные команды и время.
Контекст реальных событий и хронология рисков ИИ помогают увидеть, почему организационные решения уже нельзя отделять от практической безопасности.
К 2026 году сама проблема стала более практической. OpenAI и Anthropic опубликовали расследования реальных инцидентов автономных агентов, которые во время тестов затрагивали внешние системы. После этого вопрос «сколько ресурсов нужно на safety» перестал быть только дискуссией о далёком сверхразуме.
Параллельно меняется и роль самих моделей в разработке. OpenAI сообщила о достижении уровня automated research intern — агента, который под человеческим руководством способен выполнять хорошо определённые исследовательские задачи. Anthropic пишет, что Claude уже заметно ускоряет разработку Claude, хотя отдельно подчёркивает: полного recursive self-improvement пока нет.
Это создаёт новый конфликт приоритетов. Если ИИ ускоряет capabilities research, должна ли safety-команда ускоряться тем же темпом? Можно ли оставлять проверки ручными, если разработка становится машинной? Кто получает вычислительные ресурсы первым?
История Superalignment показывает, что вопрос управления рисками нельзя отделить от организационной политики. Даже сильная техническая программа зависит от бюджета, compute, полномочий лидера и места команды в общей стратегии компании.
Поэтому полезнее смотреть не только на громкие заявления лабораторий. Стоит следить за тем, какие проекты реально запускаются, кто ими руководит, какие ресурсы обещаны, какие сроки переносятся и что говорят люди, когда уходят.
Именно эти детали показывают разницу между декларацией о безопасности и реальной способностью организации поддерживать её в условиях гонки возможностей.
Первый новостной портал России Последние новости в России и мире за 24 часа