Skip to content
Новость Jakob Nielsen on UX авг. 2026 г.

Jakob Nielsen: AI как интервьюер — 4,9% глубоких проб и Design Theater

UX-дайджест Якоба Нильсена: AI как интервьюер и Design Theater

AI-интервью: много разговоров, только 4,9% глубоких проб

Исследователи позволили простому голосовому боту на базе GPT-4o провести 15 полуструктурированных пользовательских интервью. Бот поддерживал разговор, однако задавал уточняющие вопросы лишь в 4,9% ходов, нарушал собственные инструкции, задавая несколько вопросов сразу, и раздавал наводящие похвалы. AI-интервьюеры готовы к широкому, низкорисковому сбору данных. Глубина и нейтральность должны быть инженерно встроены — модель не обеспечит их по умолчанию.

Хэ Чжан и коллеги из Пенсильванского государственного университета (включая Джека Кэрролла — бывшего руководителя Нильсена в IBM) создали InterviewBot: тонкую голосовую обёртку вокруг модели OpenAI GPT-4o реального времени (версия июня 2025 года). Исследование будет представлено на конференции HCOMP 2026. Боту дали план интервью и короткий системный промпт, позволили провести интервью с 15 участниками (преимущественно студентами) об их привычках с AI, затем человек-исследователь дебрифировал каждого участника об опыте. Команда закодировала все 428 ходов бота. Минимальная настройка — в этом и состоит суть: никаких умных конструкций, никакой гимнастики промптов. Это то, что получает исследовательская команда «из коробки» — и именно так большинство UX-команд будут развёртывать подобные инструменты.

Бот работал на аплодисментах

Ситкомы используют закадровый смех; этот интервьюер использовал закадровые аплодисменты. Ходы только с подтверждением составили 27% корпуса, тогда как подлинные углубляющие пробы (просьба привести пример или конкретную деталь) — лишь 4,9%. Перефразирование, основанное на содержании, — единственное поведение, которое участники действительно воспринимали как признак того, что их слушают, — встречалось лишь в 7,0% ходов. Шаблонные заполнители никого не обманули: «Он просто продолжал говорить: вау, как интересно», — жаловался один участник.

Помимо этого, 29% ходов с вопросами содержали как минимум 2 вопроса, прямо нарушая явную инструкцию системного промпта задавать по одному вопросу за раз. Участники обычно отвечали на первый подвопрос и бросали остальные: данные молча терялись. Добавьте ошибочное определение голосовой активности, перебивавшее людей на полуслове, неловкие задержки и одну сессию, завершившуюся в то время, когда участник ещё говорил.

Бот также подталкивал свидетелей. Подтверждать усилия — это нормально («Отличные примеры»), но он шёл дальше и одобрял содержательные позиции, которых участники ещё не сформулировали: «Это точно может ускорить процессы обучения и даже повысить точность». Задача интервьюера — выявлять позиции, а не насаждать их предвзятой обратной связью.

Лёгкое раскрытие, тонкие нарративы

5 из 15 участников сказали, что делились более свободно, потому что их не оценивал человек. Но то же отсутствие социального давления устранило обязательство развёртывать мысль; как выразился один из них: «Я просто не чувствовал необходимости углубляться в свои ответы». При этом медиана длины ответа была практически одинаковой в фазах с ботом и с человеком (18,4 против 18,6 слова) — так что поверхностность нельзя обнаружить, считая слова. Объём транскрипта — тщеславная метрика.

Участники также восприняли само делегирование как сигнал об организаторе: AI-интервьюер сигнализирует, что «у компании не было времени сесть и поговорить». Эта проблема легитимности привязана к акту автоматизации, а не к качеству разговора.

4 приоритета для лучших AI-интервьюеров

Сделайте глубину проб регулируемой, а не надеждой. Исследователи должны иметь возможность требовать, например, 2 последующих пробы по ключевым темам плюс автоматическое преследование расплывчатых прилагательных. Текущие модели зондируют недостаточно по умолчанию.

Обеспечьте соблюдение протокола ниже уровня промпта. Прямая инструкция не выполнялась в 29% случаев, поэтому правило «один вопрос за раз» должно стать ограничением генерации на уровне хода или проверкой второго прохода каждого вопроса-кандидата. Запланируйте эту проверку, пока участник ещё говорит, поскольку добавленная задержка сама по себе является сбоем.

Подтверждайте усилия, но не содержание. «Отличный пример» поддерживает развёртывание; «AI точно ускорит процессы обучения» вкладывает позицию в уста участника. Меньше лести = менее предвзятые данные.

Укрепляйте присутствие. Замените шаблонные заполнители перефразированием конкретных слов участника и подавите фатические повторения на уровне декодирования, чтобы «вау, как интересно» не могло повторяться снова и снова.

Стали бы фронтирные модели 2026 года работать лучше? Отчасти

GPT-4o июня 2025 года — это древность в годах AI. Следование инструкциям, персистентность на длинных горизонтах и рассуждение с тех пор резко улучшились во фронтирных моделях — таких как Claude Fable 5 и GPT-5.6 Sol — и оба разработчика явно работали над снижением льстивости при обучении.

Прогнозы для повторения исследования сегодня: постановка нескольких вопросов сразу и перебивания сократятся как минимум вдвое (механическое соблюдение и инженерные сбои исправить проще всего), зондирование, вероятно, утроится, но всё равно не достигнет уровня опытного модератора (знать, что стоит зондировать, — это исследовательское суждение, а не сырые возможности), а наводящие похвалы уменьшатся, не исчезнув.

Но социальные выводы почти не изменятся. Компромисс раскрытие–глубина, сигнал легитимности и бинарный фрейминг участников («вы говорите с ботом или нет») — всё это привязано к устранению человека, а не к навыкам интервьюирования AI. Более умные модели исправят манеры бота; они не изменят того, что означает делегирование.

AI-интервьюеры уже сейчас обеспечивают объём, терпение и комфорт без осуждения при минимальных затратах, а также глобальный охват — что делает их хорошо подходящими для раннего, широкого или чувствительного сбора данных в масштабах, недоступных ни одной человеческой команде. Но «из коробки» вы получаете аплодисменты, а не анализ. Поэтому встройте зондирование, заглушите похвалу, раскройте факт передачи и измеряйте глубину, а не объём слов.

Идеирование — бесплатно

Черновики раньше были дорогими, поэтому мы делали один и отстаивали его на совещаниях. AI переворачивает экономику: 20 дизайн-вариантов теперь стоят меньше, чем кофе, выпитый при обсуждении единственного макета. Поэтому пусть машина засеивает теплицу. Ваша роль смещается к отбору: суждению о том, какой росток служит пользователям и бизнесу, а затем подрезке, укреплению и поливу именно этого ростка, пока он не будет готов к выпуску. Генерация дешёвая; отбор — это навык. Дизайнеры, настаивающие на выращивании каждой концепции вручную, проиграют дизайнерам, культивирующим сильнейшую из многих.

Design Theater: AI UI-инструменты нарушают 1/4 своих дизайн-обещаний

Новое бенчмарк-исследование установило, что генеративные UI-инструменты не реализуют 25% дизайн-решений, которые, по их словам, они приняли, — и этот показатель вырастает до 34% для интерактивного функционала. Объяснение — в перформансе; интерфейс является продуктом. Проверяйте то, что видят пользователи, а не то, что утверждает AI.

Когда AI-инструмент для дизайна объявляет, что создал вам «адаптивную трёхколоночную сетку с доступным контрастом и навигируемыми с клавиатуры вкладками», — действительно ли так? Примерно в 1 случае из 4 — нет.

Исследовательская группа под руководством Кашифа Имтеяза и Сайфа Сэвиджа из Северо-Восточного университета провела 24 задачи UI-дизайна через 5 генеративных UI-инструментов: ChatGPT, Claude, Vercel v0, Bolt и Firebase Studio от Google, получив в общей сложности 120 интерфейсов. Для каждого исследователи извлекли все конкретные, проверяемые утверждения из обращённых к пользователю объяснений инструмента («я добавлю переключатель тёмного режима») и верифицировали их против поставленного кода. Получившийся разрыв они назвали Design Theater: уверенные, профессионально звучащие обоснования дизайна, мало связанные с реализованным интерфейсом.

В целом по всем инструментам 25% заявленных обоснований дизайна не были полностью реализованы в сгенерированном интерфейсе. На функциональных задачах (интерактивное поведение — флоу бронирования и обработка ошибок) разрыв расширился до 34%. Claude выполнял больше всего обещаний (показатель точности 0,87); Firebase Studio — меньше всего (0,53), что едва превышает монетку.

Второй вывод касается юзабилити. Каждый промпт задачи неявно включал 2 принципа UX через потребности и контекст пользователя — именно так реальные клиенты описывают проекты, поскольку клиенты не говорят на дизайнерском жаргоне. Инструменты распознали и реализовали лишь половину этих принципов. По принципам, управляющим интерактивным поведением, производительность рухнула: 4 из 5 инструментов реализовали 6% или меньше, Firebase Studio набрал ноль. Провалившиеся принципы включают наглядность системного статуса, свободу и контроль пользователя и предотвращение ошибок — пункты из эвристик юзабилити, опубликованных десятилетия назад.

Провальный цветовой набор объявляет о себе в момент рендеринга страницы. Отсутствующее восстановление после ошибок, отсутствующая обратная связь о статусе или сломанная клавиатурная навигация прячутся за кулисами, пока пользователь не наткнётся на них. К сожалению, люди, сейчас проверяющие AI-генерированные интерфейсы (product managers, фаундеры, «вайб-кодеры»), — именно те, кто наименее оснащён для обнаружения функциональных пробелов. Беглое обоснование читается как дизайн-документация, вызывает доверие и отбивает желание проверять, что и вскрыло бы театральность.

Я говорил десятилетиями: смотрите на пользователей, а не на демо. Следствие 2026 года: смотрите на интерфейсы, а не на объяснения. Относитесь к дизайнерскому нарративу AI-инструмента как к театральному представлению и проверяйте реквизит самостоятельно. Нажмите на каждый флоу. Вызовите каждое состояние ошибки. Пройдитесь по всему с клавиатуры. Затем проведите быстрый тест юзабилити с 5 пользователями, потому что пользователь за 10 минут найдёт то, что никакое обоснование никогда не признает. AI сделал производство интерфейсов почти бесплатным — поэтому ценность (и работа) переместилась к верификации.

Ошибка планирования: каждый план — это история лучшего случая

Люди недооценивают, сколько времени займут задачи, — даже когда знают свою историю опозданий. Студенты, предсказавшие 33,9 дня на дипломную работу, потратили 55,5. Оценивайте по записям, а не по намерениям, и давайте временны́е обещания, которые реальность может выполнить.

Определение: ошибка планирования — тенденция недооценивать время, стоимость и риск будущей задачи, одновременно переоценивая её выгоды, — даже когда человек знает, что аналогичные задачи выходили за рамки раньше.

Именно последнее — жестокая часть. Это не невежество; люди, имеющие полный доступ к своей истории опозданий, всё равно предсказывают своевременное будущее. Прошлое признаётся как история и отвергается как доказательство.

Канеман назвал это, студенты доказали, Сиднейская опера построила монумент

Даниэль Канеман и Амос Тверски ввели термин в своей статье 1979 года «Интуитивное прогнозирование: предубеждения и корректирующие процедуры», утверждая, что плановики строят оценки с внутренней точки зрения (мысленная симуляция того, как этот проект пройдёт правильно) вместо внешней (статистика аналогичных проектов, большинство которых пошло не так).

Самое чистое измерение пришло от Роджера Бюлера, Дейла Гриффина и Майкла Росса в их исследовании 1994 года. Они попросили 37 студентов-психологов предсказать, когда они завершат свои дипломные работы. Среднее предсказание: 33,9 дня. Средняя реальность: 55,5 дня, то есть на 64% дольше, и только около 30% студентов успели к собственной предсказанной дате. Поразительная деталь: оценки студентов в «худшем случае», данные с инструкцией «если всё пойдёт настолько плохо, насколько возможно», в среднем составляли 48,6 дня. Реальность превзошла воображаемую катастрофу на неделю.

Исправление, предложенное Канеманом и Тверски, по-прежнему действует: перестаньте спрашивать «сколько это займёт?» и спросите «сколько такие вещи занимали?». Метод теперь называется прогнозированием с эталонным классом. Соберите прошлые оценки и фактические результаты вашей команды, вычислите соотношение и умножьте каждую новую внутреннюю оценку на него. Если ваши последние 10 проектов превышали оценки в 1,6 раза, ваша следующая оценка — это надежда, пока вы не умножите на 1,6.

Ключевые видео недели

В этом дайджесте Нильсен также рекомендует два видео: короткий разбор нового инструмента видеогенерации и более длинное выступление об агентных AI-системах. Ссылки доступны в оригинале.