Вы просите модель разобрать демонстрационный код с соревнования по компьютерной безопасности, перевести подозрительный фрагмент программы для отчёта или продолжить вполне невинный рассказ. Вместо ответа получаете знакомое: «Извини, но я не ...
Вы просите модель разобрать демонстрационный код с соревнования по компьютерной безопасности, перевести подозрительный фрагмент программы для отчёта или продолжить вполне невинный рассказ. Вместо ответа получаете знакомое: «Извини, но я не могу помочь с этим запросом».
Иногда причина понятна. Иногда модель отказывается обсуждать то, что лежит в первой ссылке из поисковой выдачи. А рядом на Hugging Face опубликована версия той же Qwen, Gemma или GLM со словом Uncensored. Автор обещает, что она будет отвечать без лишних нравоучений.
Но чем отличаются такие LLM? Неужели кто-то повторно обучил модели на сотни миллиардов параметров? Или просто удалили системную инструкцию? Может, нашли в весах переключатель censorship = false?
На самом деле, отказ может быть записан в весах модели, задан системной инструкцией или добавлен внешним классификатором на уровне сервиса. Поэтому под «снятием ограничений» скрываются разные процессы: от подмены инструкции до точечного редактирования матриц без градиентного обучения.
В этой статье постараемся ответить на три вопроса: откуда в LLM появляется отказ, как его ослабляют в открытых моделях и где можно взять "безотказную" модель.
