Статья
Роли больше не нужны. Но это не точно
Экспертная роль не повысила точность ответов на двух наборах тестовых вопросов. Это хороший результат, но он не отменяет роли как способ задать контекст, перспективу и форму ответа.
Люблю читать исследования в околоаишной тематике. Особенно те, в которых мне хватает мозгов разобраться.
Не люблю другое: когда один аккуратный вывод за пару часов превращают в универсальный запрет. С исследованием об экспертных ролях в промптах произошло именно это.
Откуда взялся спор
В декабре Wharton Generative AI Labs опубликовали технический отчёт Playing Pretend: Expert Personas Don’t Improve Factual AccuracyВнешняя ссылка, откроется в новой вкладке. Главный вывод легко помещается в заголовок: фразы вроде «ты эксперт по физике» не дали систематического прироста точности.
Дальше сработал обычный интернет. В пересказах аккуратное «не улучшает точность в этом эксперименте» быстро превратилось в «роли бесполезны, удаляйте их из промптов». Заодно досталось всем, кто когда-либо советовал начать запрос со слов «выступи в роли…».
Я и сам сейчас использую роли редко. Но иногда всё ещё прошу модель посмотреть на задачу с позиции редактора, архитектора или конкретного читателя. Поэтому полез в сам отчёт: хотелось понять, исследование действительно отменяет этот приём или ему приписали лишнее.
Что именно проверяли
Авторы взяли шесть моделей: GPT-4o, GPT-4o-mini, o3-mini, o4-mini, Gemini 2.0 Flash и Gemini 2.5 Flash. Их прогнали по 198 вопросам GPQA Diamond и 300 вопросам MMLU-Pro. Это сложные тестовые задания по физике, химии, биологии, инженерии и праву с выбором правильного ответа.
Для каждого вопроса использовали 12 вариантов промпта и по 25 повторов. Были запросы без роли, с подходящим экспертом, с экспертом из другой области и с заведомо низкой компетенцией вроде маленького ребёнка.
Результат получился вполне внятным. Подходящая экспертная роль в среднем не делала ответы точнее. Неподходящий эксперт чаще всего тоже мало что менял, хотя у Gemini 2.5 Flash появились отказы из-за конфликта роли и вопроса. А вот роль с низкой компетенцией нередко ухудшала результат. В отдельных комбинациях были исключения, но общей картины они не поменяли.
Для распространённого совета «добавьте эксперта, и модель начнёт лучше знать предмет» это плохая новость. Новых знаний такая строка модели не добавляет.
Где заканчивается вывод исследования
В эксперименте измеряли точность ответа на тестовый вопрос. Не качество объяснения, не полезность разбора, не тон и не соответствие формату. Это прямо следует и из названия отчёта: речь о factual accuracy.
Класс задач тоже узкий. Модели решали квиз с вариантами ответа. Они не редактировали статью, не проектировали API, не разбирали инцидент и не объясняли одну тему разным аудиториям. Переносить результат на все способы работы с LLM слишком смело.
Сами роли были короткими и общими. Исследование отвечает на вопрос, помогает ли ярлык вроде «эксперт по физике» выбрать правильный вариант. Более подробные ролевые инструкции оно не проверяет. Отсюда, кстати, не следует обратное: подробная биография профессора тоже не обязана повышать точность. Просто это уже другой эксперимент.
Ещё одна граница: в наборе нет GPT-3.5 и других старых моделей. Поэтому отчёт хорошо описывает выбранные шесть моделей, но не даёт честного основания объявлять один закон для всех поколений и размеров LLM.
Зачем я всё ещё задаю роли
Я никогда не воспринимал роль как способ загрузить в модель недостающие знания. Для меня это короткая упаковка контекста.
Если я пишу «выступи как редактор технического журнала», то задаю угол зрения: текст предназначен инженерам, термины надо пояснить, рекламные обороты выкинуть, а логику сделать заметнее. Можно расписать всё это отдельными требованиями, и для важной задачи так даже лучше. Но иногда роль передаёт нужную настройку быстрее.
Когда нужна точность, одной роли точно мало. Нужны нормальная постановка задачи, доступные источники, критерий правильного ответа, примеры и проверка результата. Фраза «ты эксперт» не заменяет ни один из этих пунктов.
Поэтому я оставляю роли там, где они помогают задать аудиторию, перспективу или манеру ответа. И убираю там, где роль маскирует отсутствие инструкции. Исследование полезно именно этим: снимает с приёма магический статус, а не запрещает его.
Так что давайте там это. Без крайностей.
Источники
- Playing Pretend: Expert Personas Don’t Improve Factual AccuracyВнешняя ссылка, откроется в новой вкладке: технический отчёт Wharton Generative AI Labs.
- Playing Pretend: Do Expert Personas Improve the Accuracy of AI Assistants?Внешняя ссылка, откроется в новой вкладке: препринт на arXiv.