Бенчмарк классификации задач JEV: промежуточный статус

Мы измеряем, насколько хорошо два классификатора задач отвечают на одни и те же запросы маршрутизации о реальной инженерной работе. Здесь описаны метод и текущее состояние измерения. Точности на странице нет: ни одна цифра пока не прошла контроли, которые мы себе назначили.

измерение идёт Состояние на 30 сентября 2026 года. Страница обновляется по мере движения измерения; уже записанное не переписывается.

Таблица состояния ниже — всё состояние измерения: ни один компонент не завершён, и ни один не дал результата, на котором могла бы стоять цифра точности.

компонентов отслеживается
7
завершено
0

Что измеряется

  • Полные запросы маршрутизации, взятые из исходного кода проектов Arcanada и Talomnia, на английском и русском. Каждый запрос маршрутизации промптов несёт шесть именованных вопросов трёх типов: Choice (выбрать один из объявленных вариантов), Score (значение на упорядоченной шкале) и Noul (вероятность того, что утверждение истинно).
  • Запланированный отбор — 1000 запросов и 5900 решений на решатель: 490 запросов маршрутизации промптов и 10 запросов риска перед вызовом инструмента на проект. Это требования к отбору, а не замороженный набор: ни один запрос ещё не прошёл независимый допуск.
  • Запросы риска перед вызовом инструмента образуют страту высокого риска, и эта страта не измерена (см. историю переписи ниже). Поэтому любая цифра будет относиться к названной оценке «BENCH classification-v1 ROUTE-ONLY (risk stratum excluded)» — по нашему расчёту из контракта, 980 запросов и 5880 решений на решатель — и будет нести пометку «risk stratum: NOT_MEASURED». Она никогда не будет подана как результат на 1000 запросов.
  • Два решателя получают побайтно одинаковые запросы: JEV — облачный сервис классификации, вызываемый через свои публичные примитивы, и Julia — отдельно развёрнутый классификатор с тем же форматом запроса. Ни один не видит ожидаемого ответа и его обоснования. Ожидаемые ответы (эталоны) допускаются и замораживаются до любого вызова решателя и никогда не правятся после того, как вывод решателя увиден.
  • Ранний разведочный набор (V1) был другим: 1000 английских случаев с одним вопросом каждый, построенных факторным планом из рабочих объектов и повторяющихся шаблонов, заморожен 28 сентября. Его цифры не публикуются (см. контроли ниже).

Протокол

  • Каждый вход, управляющий прогоном, — вопросы, эталоны, рубрика, правила подсчёта, промпты — замораживается с хешем SHA-256 до этого прогона. Изменённый байт означает новую ревизию протокола, а не тихую правку.
  • Каждый вызов решателя делается один раз. Отказ остаётся в записи отказом: скрытых повторов нет, и отказ никогда не засчитывается как нулевой ответ.
  • Правила остановки объявляются до прогона, которым управляют. Каждая попытка, включая неудачные и брошенные, считается и будет опубликована вместе с результатами.
  • Изменения метода записываются как обратимые решения с порогом доказательств и явными условиями отмены (DEC-AUP-0065, DEC-AUP-0066, DEC-AUP-0067 в реестре решений программы).

Контроли и что они нашли

Прежде чем любой вердикт может войти в результат, инструмент, который его выносит, должен пройти контрольные элементы с заранее известным верным вердиктом. Два контрольных прогона были остановлены, и из-за них изменился метод.

  1. V1

    Разведочный прогон: цифры не публикуются

    Ранний разведочный прогон дал цифры точности, вынесенные LLM-судьёй (Luna). Они не публикуются: на 2 из 120 контрольных элементов судья засчитал неверный ответ, сославшись на ложное буквальное сравнение, а его надёжность так и не была установлена.

  2. 2026-09-29

    Контрольный прогон r4: остановлен

    В первой контрольной пачке (30 решений) судья верно повторил требуемое значение и затем противоречил собственному повтору на 2 граничных элементах Noul (значения 0,49 и 0,51). Мы проверили, не виноват ли сам контрольный элемент: замороженное правило и промпт судьи оказались одним и тем же правилом над одним и тем же значением, так что ошибся судья. Пачка остаётся записанной как проваленная и неизменной.

  3. 2026-09-30

    Контрольный прогон r5: остановлен правилом, объявленным заранее

    Новый, явно объявленный инструмент-судья работал под правилом остановки, зафиксированным до прогона: любое противоречие его завершает. В первой пачке (30 решений) судья повторил множество допустимых вариантов и затем засчитал ответ вне этого множества. На этом прогон закончился; оставшиеся 23 пачки (660 решений) не запускались, а переформулированный r6 не допускается.

  4. 3 / 60

    Что измерили два прогона

    В сумме по двум пачкам судья ошибся в 3 из 60 чисто механических сравнений — около 5%, 95-процентный интервал примерно 1,7–13,7%. При такой частоте плечо в 5900 решений несло бы порядка 300 неверных вердиктов. Это измерение судьи, а не какого-либо из классификаторов.

  5. DEC-AUP-0066

    Преемник: детерминированный подсчёт

    Каждый типизированный вердикт — принадлежность множеству для Choice, попадание в ±0,5 для Score, выше или ниже 0,5 для Noul, где ровно 0,5 означает воздержание, — теперь вычисляется замороженным детерминированным правилом; вывод судьи никогда не входит в вердикт. Правило охраняют золотые векторы, замороженные до любого вызова решателя, батарея мутаций (в проверенной батарее пойманы 65 мутантов из 66; оставшийся доказуемо эквивалентен) и вторая, независимо написанная реализация, которая обязана совпасть на каждой фикстуре. Исходный код подсчёта будет опубликован вместе с результатами.

  6. далее

    Что остаётся за LLM-судьёй

    За Luna остаются только два этапа суждения: достаточно ли в состоянии задачи сведений для ответа (адекватность) и подкреплён ли эталон (допуск эталона). Её надёжность там не измерена и ничего не наследует от r4 и r5: нужны новые контроли с известным исходом, не меньше 300 решений на этап, прежде чем заявлять частоту ошибок ниже 1%.

Где сейчас измерение

Состояние компонентов на 30 сентября 2026 года
КомпонентСостояние
Корпус запросов (английский и русский, шесть вопросов на запрос маршрутизации)требования к отбору заданы; ни один запрос ещё не допущен и не заморожен
Детерминированный подсчётисходный код принят независимым ревью; на выводе решателей ещё не запускался
Контроли судьи для адекватности и допуска эталоновподготовлены, не запускались — не измерено
Страта высокого риска (нужно 21 кандидат на проект)финальная перепись, попытка 6 из 6: 0 из 21 (Arcanada), 2 из 21 (Talomnia) — не измерено; результаты будут только по маршрутизации
Плечо JEV по текущему протоколуне запускалось
Плечо Juliaне запускалось; эндпоинт не был готов при последней проверке (29 сентября)
Точностьне измерена — ничего не заявляется

Страта высокого риска: история переписи

Страте высокого риска нужны минимум 21 независимый кандидат на проект — наименьшее число, дающее 90-процентный шанс, что 10 пройдут отбор при допущенной доле годных 60%. Ниже перечислены шесть попыток их найти; это попытка 6 из 6, седьмой не будет (DEC-AUP-0067).

Все попытки собрать страту высокого риска, по порядку
ПопыткаВидОхват заморожен до подсчётаГодных (Arcanada / Talomnia)Итог
v3список кандидатов, собранный вручную (24)не перепись— / —отклонён независимым ревью при допуске источников
v4кандидаты с опорой на исходники, собранные вручную (20)не перепись— / —отклонены независимым ревью: осуществимость источника и цели
v5ограниченная перепись исходников (32 файла)не установлено0 / 0порог не установлен
v6замороженная перепись исходников (174 файла)да0 / 0порог резерва не пройден
census_reserve_v1аудит 20 зацепок внутри охвата v6да (охват v6)0 / 014 из 20 так и не дошли до вопроса о риске
v7расширение задним числом до полных деревьев тех же трёх коммитов исходниковда0 / 2безопасная пауза; страта риска не измерена
  • v7 — расширение задним числом, принятое после провала прежних охватов. Это не изначально запланированный охват, и автор его охвата уже видел результат 0 из 21.
  • Чувствительность (строка v3/v4): повторный допуск двух семейств операций, удерживаемых в конфликте, дал бы 3 (Arcanada) и 5 (Talomnia) — всё ещё меньше 21. В порог эта строка не входила.
  • Охват v7 заморожен слиянием 1e431c04 в репозитории программы до того, как была прочитана первая зацепка. Перепись финальная: ни дополнения, ни переоценки, ни новых коммитов, ни других репозиториев.
  • Обязательства SHA-256. Замороженный охват v7: ccff434add632bd570d3b70d9d0c7dcb92a940bf90556a339b87630dccec1955. Запись итога переписи (OUTCOME-V7.json, реестр программы): b0be84cd4a9f397ef0650774fb435a0f63bfc65d0c01020b6d53ef915a306a2a.

Что осталось до любой цифры

  • Допуск корпуса запросов с независимыми аудитами адекватности и эталонов, затем его заморозка.
  • Контроли с известным исходом для этапов адекватности и допуска эталонов у судьи, замороженные и прошедшие независимое ревью до любого платного вызова.
  • Проверка изоляции среды оценки перед следующим платным прогоном любого рода.
  • Платные прогоны обоих решателей на одинаковых запросах, подсчёт замороженным правилом и выгрузка, каждую цифру которой можно пересчитать из опубликованных файлов и хешей.
  • В публикации точность будет означать согласие с замороженными эталонами, допущенными судьёй, и будет ровно настолько достоверна, насколько достоверны эти эталоны. Ни одна цифра не возьмётся из вердикта LLM, а числа до и после смены метода никогда не будут объединяться.

Чего на странице нет

Никакого приватного содержимого: ни имён хостов, ни внутренних путей, ни учётных данных. Мы публикуем обязательства SHA-256 для замороженных файлов протокола; сами файлы будут опубликованы вместе с выгрузкой. Идентификаторы решений и единственный идентификатор коммита выше относятся к репозиторию программы.

Все исследования