ai
3 мин
8 октября 2026 г.
Источник: Dev.to AI Feed

Слепите оценщика к золотой нити

Dakota Ma
Dakota Ma
RSS AI Ingest
Слепите оценщика к золотой нити

Оценщик, который может читать золотую нить, больше не оценивает поведение, поскольку перекрытие меток становится самым дешевым путем к положительному результату. Тихая регрессия затем скрывается за стабильной оценкой, поскольку судья вознаграждает отголоски ярлыка, а не сидит...

Оценщик, который может читать золотую нить, больше не оценивает поведение, поскольку перекрытие меток становится самым дешевым путем к положительному результату. Тогда тихая регрессия скрывается за стабильной оценкой, поскольку судья вознаграждает отголоски ярлыка, а не удовлетворение рубрики. Эта система разделяет каждый случай на точную полосу и слепую полосу, а затем удерживает оценку набора, когда разногласия полос превышают фиксированный порог. Цель — это счет, который продолжает меняться, когда кандидат незаметно прекращает выполнять задание, а не более зеленый значок из утекшего ключа ответа. Представьте себе экзамен с закрытой книгой, на котором инспектор шепчет ключ к ответу, пока студент пишет, а затем хвалит студента за то, что тот ответил шепотом. Знак выглядит объективным, однако он измеряет доступ к ключу, а не владение субъектом. Подсказки для оценки попадают в ту же ловушку, когда подсказка судьи включает ожидаемую строку рядом с выходными данными-кандидатами. Более позднее изменение модели может ухудшить реальное качество задания и оно все равно будет выполнено, потому что судья продолжает видеть золотой текст, который ему был вручен. Точная дорожка может видеть золотую нить, поскольку ее единственная задача — каноническое сравнение после нормализации. Слепой переулок может видеть задачу, инвариант нет.

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект