Исследователи предложили новую концепцию «идентичности» ИИ-клонов личности: оценка извне вместо вопросов о сознании
Исследование на arXiv предлагает метод оценки того, насколько ИИ, имитирующий человека, является «подлинным», — через внешнее наблюдение, не вдаваясь в сложную проблему сознания
По мере того как ИИ, созданные для имитации личности реальных людей (personality clones), всё глубже входят в нашу жизнь, возникает вопрос: как понять, действительно ли этот ИИ «является» тем самым человеком? Новое исследование, опубликованное на arXiv под названием «Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones», отвечает на этот вопрос нестандартным подходом: предлагается измерять идентичность «извне», через наблюдение за проявляемым поведением, полностью исключив философскую проблему сознания (consciousness) из уравнения.
Авторы отмечают, что слово «идентичность» в обычном употреблении смешивает три значения, поэтому в работе они разделены на три чётких критерия: точность соответствия прототипу (fidelity), человекоподобие в целом (human-likeness) и уникальная индивидуальность (individuality). Один и тот же ИИ может проходить одни критерии и не проходить другие.
Ядро работы — разложение «наблюдаемой идентичности» на шесть факторов: субстрат или базовая архитектура (substrate), предрасположенности (dispositions), память (memory), динамика самообновления (update dynamics), контекст (context) и внешние обстоятельства (exogenous contingencies). Авторы также предлагают формулу измерения «неразличимости» (indiscernibility) с точки зрения наблюдателя и рекомендуют оценивать вклад каждого фактора с помощью рандомизированных абляционных экспериментов (randomized ablation).
Ключевое предложение работы состоит в том, что долгосрочную идентичность следует измерять через «climate fidelity» — согласованность вероятностей различных типов реакций ИИ, — а не пытаться заставить ИИ идеально повторять прежние паттерны диалога, как проигрывание записанной кассеты. Кроме того, авторы предполагают, что если ИИ осознаёт (или спроектирован так, чтобы осознавать), что его версии могут изменяться (versionability), это, вероятно, снизит надёжность его идентичности в долгосрочной перспективе.
Впрочем, важно подчеркнуть: это концептуальная работа (conceptual framework) и программа будущих исследований, а не эмпирические экспериментальные результаты. Кроме того, это препринт на arXiv, ещё не прошедший рецензирование (peer review), поэтому к нему стоит относиться с обычной долей осторожности
Когда ИИ, имитирующие реальных людей, — например, чат-боты знаменитостей или цифровые двойники умерших, — входят в нашу жизнь, наличие чётких критериев оценки поможет обществу решить, каким ИИ можно доверять, а какие лишь «похожи на человека», но не являются подлинными