Изменение структуры: с Minto и без него
Каждая клетка — один судейский документ: оценка структуры с Minto минус оценка той же модели без него. Максимум за структуру — 8 баллов.
В этом прогоне Claude Haiku 4.5 отработал два кейса режима audit. На наборе заголовков структура выросла с 2 до 6 баллов из 8. На наборе ежемесячных отчётов — упала с 6 до 2. Одна модель, один режим, один навык — противоположный результат. Поэтому оценка устроена как карта кейсов, а не как одно число.
Прогон v1.7.0-final · 11 кейсов в 4 режимах · 8 моделей · 172 слепых вердикта по 86 парам
Шкала
Каждая клетка — один судейский документ: оценка структуры с Minto минус оценка той же модели без него. Максимум за структуру — 8 баллов.
Каждая клетка — один судейский документ: оценка качества текста с Minto минус оценка той же модели без него. Максимум за качество — 10 баллов.
Как читать заливку
В клетке один документ. Каждая клетка — одна судейская пара, а не среднее. Клетка в плюс-минус один балл — шум; средние по строке, взятые по восьми моделям, надёжнее, а средние по режимам ещё надёжнее.
172 вердикта, 86 пар. Каждую пару судят дважды: без навыка и с навыком. Отсюда и берётся число 172 на главной странице. Две пустые клетки — это qwen3.8-27b на двух самых длинных кейсах: он не уложился в лимит ни с навыком, ни без него, и вычитать нечего.
Эти дельты — вычитание, а не новая судейская работа. Отчёт v1.7.0 сознательно не считал дельты на уровне кейсов. Эта страница берёт их вычитанием: оценка с навыком минус оценка без него в уже оценённой паре. Ничего не пересуживали и ничего не перенастраивали.
Кейсы не взаимозаменяемы. Каждый режим проверяем на тех задачах, для которых он сделан: write — на создании и переработке текста, audit — на поиске дефектов, digest — на отчёте о прочитанном, viz — на показе готовой структуры. Общая оценка свела бы их в одно число, которое не описывает ни один из них.