Несоответствие внутри стандартной политики дистилляции Дистилляция политики обучает учащегося ответам, выбранным из текущей политики учащегося, а затем просит более сильного учителя предоставить рекомендации на уровне токенов по этим траекториям. В ...
Несоответствие внутри стандартной политики дистилляции
Дистилляция политики обучает учащегося ответам, выбранным из текущей политики учащегося, а затем просит более сильного учителя предоставить рекомендации на уровне токенов по этим траекториям. В формулировке, используемой в статье GC-OPD, каждый выбранный токен получает преимущество, основанное на разнице между логарифмическими вероятностями учителя и ученика.
Этот сигнал является плотным и напрямую связан с токенами, сгенерированными учеником. Но это отвечает на узкий вопрос: предпочитает ли учитель этот токен текущей политике ученика?
Это не обязательно то же самое, что вопрос, удовлетворяет ли полный ответ задаче.
Это различие имеет значение, когда ответ должен объединять доказательства, разбросанные по большому объему входных данных. Ответ может оставаться правдоподобным на местном уровне, опуская необходимые доказательства или нарушая глобальные ограничения. Учитель по-прежнему может назначать благоприятные вероятности токенов, поскольку многие отдельные продолжения выглядят разумными. Вместо этого верификатор для конкретной задачи оценивает завершенный ответ, потенциально используя градуированные вознаграждения для обозначения частичного успеха.
Эта озабоченность согласуется с более широким наблюдением о том, что номинальный контекст c