Ваша оценочная система доверяет свидетелю, которого никогда не подвергали перекрестному допросу Каждый тест агента, который я построил, заканчивается одной и той же строкой кода: модель оценивает результаты другой модели, и я рассматриваю полученное число как измерение. Рубрика, сильная модель, ...
Ваша оценочная система доверяет свидетелю, которого никогда не подвергали перекрестному допросу
Каждый тест агента, который я построил, заканчивается одной и той же строкой кода: модель оценивает результаты другой модели, и я рассматриваю полученное число как измерение. Рубрика, сильная модель, оценка пять.
Отправьте это.
Судья – это языковая модель. У него есть задокументированные режимы сбоя: ему нравятся длинные ответы, ему нравится первый ответ, ему нравятся уверенные ответы, и он дрейфует, когда вы меняете его температуру. Мы знаем все это. А потом мы все равно оцениваем по нему и ни разу не спрашиваем, хорош ли он для оценки.
Поэтому я построил инверсию: установку, на которой тестируется грейдер. Он называется «Арбитр» — золотой набор человеческих ярлыков, четыре эксперимента и один резкий вердикт о том, заслуживает ли судья доверия по вашей рубрике.
То, что он измерил, удивило меня больше, чем я ожидал, и самый интересный результат вообще не в судье.
Установка
Золотой набор (20 предметов, помеченных человеком + 8 парных предметов)
|
в
Агент-судья (Pydantic AI, output_type=Verdict) 1. Необработанный % согласия, каппа Коэна, матрица неточностей 5x5, бутстреп-ДИ.
+--> 2. Позиция (A,B), затем (B,A) -> частота переворотов, разница среднего балла
