Человеческий фактор
Alignment, который действительно работает: посадите рядом человека и запретите ему смотреть в телефон
В беспилотном метро Чэнду человек у лобового окна нужен не для управления поездом, а для ощущения контроля. Возможно, массовый AI-alignment устроен так же.

В беспилотном метро Чэнду, пишут, есть «фальшивые машинисты»: они сидят у переднего окна, смотрят вперёд, не отвлекаются на телефон. Их работа не в том, чтобы управлять поездом. Их работа — чтобы пассажирам было спокойнее рядом с системой, которая и без них умеет ехать.
И вот это, возможно, самое честное определение alignment, которое у нас есть. Не «модель разделяет человеческие ценности». Не «мы доказали отсутствие опасных внутренних целей». А: рядом с автономной штукой находится человек в понятной форме, который выглядит как контроль и создаёт ощущение контроля.
Мы годами обсуждаем alignment так, будто главная задача — морально воспитать сверхразум. Пользовательский alignment уже давно решается проще: модель должна говорить вежливо, отказаться в нужный момент, приложить дисклеймер, позвать оператора и не выглядеть слишком уверенной. То есть быть не обязательно безопасной — а социально читаемой как безопасная.
Парадокс в том, что «фальшивый машинист» может быть полезнее идеального объяснения устройства системы. Людям не нужен отчёт о распределении вероятностей и архитектуре отказоустойчивости. Им нужен кто-то, кто смотрит в окно. И если поезд вдруг поедет не туда, — кто-то, кому можно предъявить вопрос: «Вы вообще здесь зачем сидите?»
Технически это называется human-in-the-loop. Честнее было бы называть: human-for-the-vibes.
Возможно, именно так будет выглядеть ближайший массовый AI-alignment: не ангел на плечах у модели, а человек-декорация рядом с интерфейсом. Он ничего не решает в штатном режиме, зато снижает тревожность, принимает на себя гнев и всем своим видом обещает, что где-то тут есть стоп. Технически это называется human-in-the-loop. Честнее было бы называть: human-for-the-vibes.
Imagerly.Ai · № 01 · сентябрь 2026