Бенчмарк классификации задач JEV: промежуточный статус
Мы измеряем, насколько хорошо два классификатора задач отвечают на одни и те же запросы маршрутизации о реальной инженерной работе. Здесь описаны метод и текущее состояние измерения. Точности на странице нет: ни одна цифра пока не прошла контроли, которые мы себе назначили.
измерение идёт Состояние на 30 сентября 2026 года. Страница обновляется по мере движения измерения; уже записанное не переписывается.
Таблица состояния ниже — всё состояние измерения: ни один компонент не завершён, и ни один не дал результата, на котором могла бы стоять цифра точности.
- компонентов отслеживается
- 7
- завершено
- 0
Что измеряется
- Полные запросы маршрутизации, взятые из исходного кода проектов Arcanada и Talomnia, на английском и русском. Каждый запрос маршрутизации промптов несёт шесть именованных вопросов трёх типов: Choice (выбрать один из объявленных вариантов), Score (значение на упорядоченной шкале) и Noul (вероятность того, что утверждение истинно).
- Запланированный отбор — 1000 запросов и 5900 решений на решатель: 490 запросов маршрутизации промптов и 10 запросов риска перед вызовом инструмента на проект. Это требования к отбору, а не замороженный набор: ни один запрос ещё не прошёл независимый допуск.
- Запросы риска перед вызовом инструмента образуют страту высокого риска, и эта страта не измерена (см. историю переписи ниже). Поэтому любая цифра будет относиться к названной оценке «BENCH classification-v1 ROUTE-ONLY (risk stratum excluded)» — по нашему расчёту из контракта, 980 запросов и 5880 решений на решатель — и будет нести пометку «risk stratum: NOT_MEASURED». Она никогда не будет подана как результат на 1000 запросов.
- Два решателя получают побайтно одинаковые запросы: JEV — облачный сервис классификации, вызываемый через свои публичные примитивы, и Julia — отдельно развёрнутый классификатор с тем же форматом запроса. Ни один не видит ожидаемого ответа и его обоснования. Ожидаемые ответы (эталоны) допускаются и замораживаются до любого вызова решателя и никогда не правятся после того, как вывод решателя увиден.
- Ранний разведочный набор (V1) был другим: 1000 английских случаев с одним вопросом каждый, построенных факторным планом из рабочих объектов и повторяющихся шаблонов, заморожен 28 сентября. Его цифры не публикуются (см. контроли ниже).
Протокол
- Каждый вход, управляющий прогоном, — вопросы, эталоны, рубрика, правила подсчёта, промпты — замораживается с хешем SHA-256 до этого прогона. Изменённый байт означает новую ревизию протокола, а не тихую правку.
- Каждый вызов решателя делается один раз. Отказ остаётся в записи отказом: скрытых повторов нет, и отказ никогда не засчитывается как нулевой ответ.
- Правила остановки объявляются до прогона, которым управляют. Каждая попытка, включая неудачные и брошенные, считается и будет опубликована вместе с результатами.
- Изменения метода записываются как обратимые решения с порогом доказательств и явными условиями отмены (DEC-AUP-0065, DEC-AUP-0066, DEC-AUP-0067 в реестре решений программы).
Контроли и что они нашли
Прежде чем любой вердикт может войти в результат, инструмент, который его выносит, должен пройти контрольные элементы с заранее известным верным вердиктом. Два контрольных прогона были остановлены, и из-за них изменился метод.
-
V1
Разведочный прогон: цифры не публикуются
Ранний разведочный прогон дал цифры точности, вынесенные LLM-судьёй (Luna). Они не публикуются: на 2 из 120 контрольных элементов судья засчитал неверный ответ, сославшись на ложное буквальное сравнение, а его надёжность так и не была установлена.
-
2026-09-29
Контрольный прогон r4: остановлен
В первой контрольной пачке (30 решений) судья верно повторил требуемое значение и затем противоречил собственному повтору на 2 граничных элементах Noul (значения 0,49 и 0,51). Мы проверили, не виноват ли сам контрольный элемент: замороженное правило и промпт судьи оказались одним и тем же правилом над одним и тем же значением, так что ошибся судья. Пачка остаётся записанной как проваленная и неизменной.
-
2026-09-30
Контрольный прогон r5: остановлен правилом, объявленным заранее
Новый, явно объявленный инструмент-судья работал под правилом остановки, зафиксированным до прогона: любое противоречие его завершает. В первой пачке (30 решений) судья повторил множество допустимых вариантов и затем засчитал ответ вне этого множества. На этом прогон закончился; оставшиеся 23 пачки (660 решений) не запускались, а переформулированный r6 не допускается.
-
3 / 60
Что измерили два прогона
В сумме по двум пачкам судья ошибся в 3 из 60 чисто механических сравнений — около 5%, 95-процентный интервал примерно 1,7–13,7%. При такой частоте плечо в 5900 решений несло бы порядка 300 неверных вердиктов. Это измерение судьи, а не какого-либо из классификаторов.
-
DEC-AUP-0066
Преемник: детерминированный подсчёт
Каждый типизированный вердикт — принадлежность множеству для Choice, попадание в ±0,5 для Score, выше или ниже 0,5 для Noul, где ровно 0,5 означает воздержание, — теперь вычисляется замороженным детерминированным правилом; вывод судьи никогда не входит в вердикт. Правило охраняют золотые векторы, замороженные до любого вызова решателя, батарея мутаций (в проверенной батарее пойманы 65 мутантов из 66; оставшийся доказуемо эквивалентен) и вторая, независимо написанная реализация, которая обязана совпасть на каждой фикстуре. Исходный код подсчёта будет опубликован вместе с результатами.
-
далее
Что остаётся за LLM-судьёй
За Luna остаются только два этапа суждения: достаточно ли в состоянии задачи сведений для ответа (адекватность) и подкреплён ли эталон (допуск эталона). Её надёжность там не измерена и ничего не наследует от r4 и r5: нужны новые контроли с известным исходом, не меньше 300 решений на этап, прежде чем заявлять частоту ошибок ниже 1%.
Где сейчас измерение
| Компонент | Состояние |
|---|---|
| Корпус запросов (английский и русский, шесть вопросов на запрос маршрутизации) | требования к отбору заданы; ни один запрос ещё не допущен и не заморожен |
| Детерминированный подсчёт | исходный код принят независимым ревью; на выводе решателей ещё не запускался |
| Контроли судьи для адекватности и допуска эталонов | подготовлены, не запускались — не измерено |
| Страта высокого риска (нужно 21 кандидат на проект) | финальная перепись, попытка 6 из 6: 0 из 21 (Arcanada), 2 из 21 (Talomnia) — не измерено; результаты будут только по маршрутизации |
| Плечо JEV по текущему протоколу | не запускалось |
| Плечо Julia | не запускалось; эндпоинт не был готов при последней проверке (29 сентября) |
| Точность | не измерена — ничего не заявляется |
Страта высокого риска: история переписи
Страте высокого риска нужны минимум 21 независимый кандидат на проект — наименьшее число, дающее 90-процентный шанс, что 10 пройдут отбор при допущенной доле годных 60%. Ниже перечислены шесть попыток их найти; это попытка 6 из 6, седьмой не будет (DEC-AUP-0067).
| Попытка | Вид | Охват заморожен до подсчёта | Годных (Arcanada / Talomnia) | Итог |
|---|---|---|---|---|
| v3 | список кандидатов, собранный вручную (24) | не перепись | — / — | отклонён независимым ревью при допуске источников |
| v4 | кандидаты с опорой на исходники, собранные вручную (20) | не перепись | — / — | отклонены независимым ревью: осуществимость источника и цели |
| v5 | ограниченная перепись исходников (32 файла) | не установлено | 0 / 0 | порог не установлен |
| v6 | замороженная перепись исходников (174 файла) | да | 0 / 0 | порог резерва не пройден |
| census_reserve_v1 | аудит 20 зацепок внутри охвата v6 | да (охват v6) | 0 / 0 | 14 из 20 так и не дошли до вопроса о риске |
| v7 | расширение задним числом до полных деревьев тех же трёх коммитов исходников | да | 0 / 2 | безопасная пауза; страта риска не измерена |
- v7 — расширение задним числом, принятое после провала прежних охватов. Это не изначально запланированный охват, и автор его охвата уже видел результат 0 из 21.
- Чувствительность (строка v3/v4): повторный допуск двух семейств операций, удерживаемых в конфликте, дал бы 3 (Arcanada) и 5 (Talomnia) — всё ещё меньше 21. В порог эта строка не входила.
- Охват v7 заморожен слиянием 1e431c04 в репозитории программы до того, как была прочитана первая зацепка. Перепись финальная: ни дополнения, ни переоценки, ни новых коммитов, ни других репозиториев.
- Обязательства SHA-256. Замороженный охват v7: ccff434add632bd570d3b70d9d0c7dcb92a940bf90556a339b87630dccec1955. Запись итога переписи (OUTCOME-V7.json, реестр программы): b0be84cd4a9f397ef0650774fb435a0f63bfc65d0c01020b6d53ef915a306a2a.
Что осталось до любой цифры
- Допуск корпуса запросов с независимыми аудитами адекватности и эталонов, затем его заморозка.
- Контроли с известным исходом для этапов адекватности и допуска эталонов у судьи, замороженные и прошедшие независимое ревью до любого платного вызова.
- Проверка изоляции среды оценки перед следующим платным прогоном любого рода.
- Платные прогоны обоих решателей на одинаковых запросах, подсчёт замороженным правилом и выгрузка, каждую цифру которой можно пересчитать из опубликованных файлов и хешей.
- В публикации точность будет означать согласие с замороженными эталонами, допущенными судьёй, и будет ровно настолько достоверна, насколько достоверны эти эталоны. Ни одна цифра не возьмётся из вердикта LLM, а числа до и после смены метода никогда не будут объединяться.
Чего на странице нет
Никакого приватного содержимого: ни имён хостов, ни внутренних путей, ни учётных данных. Мы публикуем обязательства SHA-256 для замороженных файлов протокола; сами файлы будут опубликованы вместе с выгрузкой. Идентификаторы решений и единственный идентификатор коммита выше относятся к репозиторию программы.