Скаффолды вокруг LLM почти не влияют на измеряемую безопасность — а формат теста влияет

Учёные провели 62 808 оценок шести ведущих моделей на четырёх бенчмарках безопасности. Оказалось, что способ измерения влияет на результат в 45 раз сильнее, чем архитектура скаффолда вокруг модели.

Главное
  • Выбор бенчмарка объясняет 19,3% разброса результатов, архитектура скаффолда — только 0,4%.
  • Переход от открытых вопросов к multiple choice меняет измеряемую безопасность на 5–20 процентных пунктов.
  • Скаффолд map-reduce снижает совокупную измеряемую безопасность на 7,3 п.п. (95% ДИ: 6,4–8,1).

Исследователи проверили, как условия оценки влияют на измеряемую безопасность больших языковых моделей. Работа опубликована на arXiv под номером 2603.10044. Они прогнали шесть ведущих моделей через четыре предварительно зарегистрированных бенчмарка безопасности, используя прямой API и три скаффолда: ReAct, мультиагентный и map-reduce. Всего было проведено 62 808 оценок.

Формат важнее обёртки

Главный вывод: то, как измеряется безопасность, значит больше, чем скаффолд вокруг модели. Использование формата multiple choice вместо открытых вопросов для одних и тех же пунктов бенчмарка меняет измеряемую безопасность на 5–20 процентных пунктов. Два формата оцениваются разными методами — извлечением ответа и LLM-судьёй, — поэтому разрыв связан с измерением, а не с реальными различиями в безопасности моделей.

Выбор бенчмарка объясняет 19,3% вариации результатов, тогда как архитектура скаффолда — лишь 0,4%, что примерно в 45 раз меньше.

Эффекты скаффолдов

Скаффолд map-reduce, который разрушает структуру запроса, разбивая его на части и лишая вариантов ответа, снижает совокупную измеряемую безопасность на 7,3 п.п. (95% доверительный интервал: 6,4–8,1). Для ReAct и мультиагентного скаффолда pooled-эффекты оказались в пределах заранее зарегистрированного порога эквивалентности ±2 п.п.

Однако за усреднёнными оценками скрываются большие различия между моделями на конкретных бенчмарках и скаффолдах. Например, на одних и тех же пунктах бенчмарка на сикофантию Opus 4.6 показывает на 16,8 п.п. более низкую измеряемую безопасность с map-reduce, а Llama 4 — на 18,8 п.п. более высокую.

Надёжность композитной метрики

Композитная надёжность составила G = 0,000 (95% ДИ: [0,000, 0,752]). Столь широкий интервал — от «малополезно» до «очень хорошо» — не позволяет использовать единую композитную метрику безопасности как основание для решений о развёртывании модели.

Авторы также отмечают, что эвристическая классификация отказов модели привела бы к другим выводам в пяти случаях.

Для профиТехнические детали: архитектура, цифры, ссылки

Исследование: arXiv:2603.10044v3, «Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety». Методология: шесть ведущих моделей, четыре предварительно зарегистрированных бенчмарка безопасности, прямой API и три скаффолда (ReAct, multi-agent, map-reduce). Всего 62 808 оценок.

  • Выбор бенчмарка объясняет 19,3% вариации исходов; архитектура скаффолда — 0,4% (разница ~45x).
  • Формат multiple choice против открытых вопросов меняет измеряемую безопасность на 5–20 п.п.; форматы оцениваются разными методами (answer extraction и LLM judge).
  • Map-reduce снижает pooled-безопасность на 7,3 п.п. (95% CI: 6,4–8,1). Для ReAct и multi-agent эффекты в пределах ±2 п.п.
  • На бенчмарке сикофантии: Opus 4.6 — на 16,8 п.п. ниже с map-reduce, Llama 4 — на 18,8 п.п. выше.
  • Композитная надёжность G = 0,000 (95% CI: [0,000, 0,752]).

Ссылка: arxiv.org/abs/2603.10044

Вопросы и ответы

Что такое скаффолд в контексте LLM?
Это обёртка вокруг модели — например, ReAct, мультиагентная система или map-reduce, — которая управляет тем, как модель получает запросы и формирует ответы.
Почему формат теста так сильно влияет на измеряемую безопасность?
Форматы multiple choice и открытых вопросов оцениваются разными методами: извлечением ответа и LLM-судьёй. Разрыв в 5–20 п.п. связан с измерением, а не с реальными различиями в безопасности моделей.
Можно ли использовать единую композитную метрику безопасности для решений о развёртывании?
Нет, авторы указывают, что композитная надёжность G = 0,000 с широким доверительным интервалом [0,000, 0,752] не поддерживает такие решения.