# HELIX — план перестройки оценки, версия 2 Обновлён после завершения пререгистрированного пилота v01/v15/v25. Исходный plan.md и preregistration.json неизменны. Поправки ниже относятся к следующему этапу, не меняют правила уже проведённого опыта. ## Решение по пилоту Продолжить разработку измерителя; автоматическое ранжирование и публикационный допуск по его результатам пока не вводить. В 26 вызовах получено 23 структурно действительных ответа, 3 ошибки JSON и 74 несовпадения цитат в 14 ответах. Все 60 исходных диагностических категорий оказались works/strong, поэтому новая словесная шкала сама по себе насыщение не устранила. Попарные сравнения выявили различия по функциям, но также зависимость от порядка и повторного вызова. ## Приоритет следующей реализации 1. **P0 — доказательства.** Присваивать абзацам и предложениям стабильные ID поверх точного SHA. Модель выбирает ID и границы фрагмента; цитату извлекает код из исходника. Хранить видимый текст с разметкой и исходные байты отдельно. Такая проверка устраняет выдуманные буквальные цитаты, но не доказывает смысл вывода: нужен самостоятельный аудит отношения claim → evidence. 2. **P0 — отказ и целостность.** Родной JSON Schema режим, проверка полной выдачи/finish_reason, явный невалидный ответ и ограниченный заранее предусмотренный технический повтор как отдельная попытка. Не менять литературный выбор при нормализации. Ошибки исходной попытки входят в статистику надёжности и стоимости. 3. **P0 — разделить нагрузку.** Отдельные независимые пакеты для сравнительного предпочтения, чтения/понимания и фактического аудита. Проверить гипотезу о том, что более короткое задание уменьшает ошибки; текущий опыт причин этого не устанавливает. 4. **P1 — покрыть литературные дефекты контролями.** Кроме чисел и ложной причинности, добавить подтверждённые человеком контролируемые изменения голоса, лишнее объяснение шутки, потерю пространственного ориентира и функциональной детали. Для каждого — неизменный контроль и вариант без ухудшения, чтобы измерить ложные тревоги. Одинаковые изменения в нескольких главах, а не один пример на всё семейство. 5. **P1 — повторяемость.** Несколько заранее назначенных повторов и перестановок на разных парах. Публиковать стабильный выбор, переход предпочтение↔ничья и прямой разворот отдельно. Одного успешного A/A недостаточно для сертификации оценщика. 6. **P1 — человеческая валидация.** Новые слепые выборы автора и независимых русскоязычных читателей, отдельно. Якоря по каждому измерению с примерами на отложенных текстах; независимый аудит выбранных человеческих контролей. Автоматические оценки проверяются на свежих парах, которые не использованы для настройки. 7. **P1 — участие Opus.** Восстановить штатную учётную запись и включить точную фактическую модель Opus в следующий заранее зарегистрированный прогон. Не считать этот пилот результатом Opus. Gemini и Sol допускаются только при нормальном доступе и соблюдении модели/квоты; GLM не использовать. 8. **P2 — масштабирование.** Только после P0/P1 переходить к связному графу всех версий, модели сравнительных предпочтений с ничьими, интервалам и новому dashboard. Старую историю хранить отдельно. Действующие публикационные ограничения менять лишь после теневой проверки и явного решения владельца проекта. Необходимость P0 подтверждена наблюдаемыми ошибками. Эффективность предложенных исправлений ещё требует отдельного опыта. Пилот не установил лучшую главу для автора или аудитории. --- # Полная спецификация этапов и проверок Версия плана: 1.0. Область: оценка главы и последующих редакций; пилот на v01, v15, v25. Разработка всей производственной системы — следующий этап; данный запуск реализует исследовательский пилот и сохраняет существующие публикационные барьеры. ## 1. Что именно требуется измерять Цель — обнаруживать полезные изменения, потери и неопределённость. Более широкий разброс или более низкие баллы сами по себе успехом не являются. Научность обеспечивается проверяемыми определениями, заранее записанным дизайном, воспроизводимостью и независимой валидацией. Существующие оценки остаются историческими данными. Нельзя нормализовать их задним числом так, чтобы получилась желаемая кривая. v01 не является обязательным победителем; авторское предпочтение v01 перед v11 не задаёт результат для других пар. ### 1.1. Литературный профиль | Измерение | Проверяемая функция | Защита от подмены | |---|---|---| | Стиль и ритм | Точные, естественные фразы; ритм поддерживает сцену | Краткость и отсутствие метафор не считаются достоинствами сами по себе | | Функция и глубина деталей | Детали создают ощутимый мир, действие и характер; имеют последствия | Количество предметов, длина и терминология не означают глубину | | Причинная и пространственная связность | Читатель восстанавливает порядок, пространство и мотивы действий | Правдоподобная догадка не закрывает отсутствующую связь | | Проявление сеттинга | Мир определяет ограничения, возможности и бытовое поведение | Новые названия и объясняющие абзацы не дают автоматического выигрыша | | Голоса и агентность | Различимые мотивы, речь, компетенции и решения | Стереотипность и дополнительные биографические сведения не дают автоматического выигрыша | | Эмоциональная глубина | Читатель понимает переживание и личную цену событий | Число эмоциональных слов не измеряет сопереживание | | Драматургия и темп | Нарушение привычного мира, развитие конфликта, ставки и переход в следующую сцену | Плотность действий не равна напряжению; первая глава не обязана завершать весь сюжет | | Подтекст и художественная цельность | Действия и образы несут смысл без обязательного объяснения | Количество афоризмов и проговорённая мораль не измеряют глубину | | Юмор | Комический эффект понятен, связан с характером и ситуацией, совместим с риском | Число шуток и наличие остроумной цитаты не определяют качество всей главы | | Эпистемическая точность | Факт, сообщение, вывод и неизвестное различимы | Техническая осторожность отдельно от художественного достоинства | Отдельный исход: слепое предпочтение главы целиком, включая `tie`, `neither` и `unassessable`. Общего арифметического литературного балла нет. Технически аккуратный текст может проигрывать художественно. ### 1.2. Виды оценок, отсутствовавшие или недостаточно развитые 1. **Сравнительная:** замороженный кандидат против предыдущей версии, опорной v01 и периодически другого соперника. Связный граф сравнений; не только «все против одного». 2. **Диагностическая с поведенческими якорями:** профиль функций с доказательствами, тяжестью и локализацией дефектов. Порядковые категории; разницу между соседними категориями нельзя трактовать как постоянную физическую единицу. 3. **Проверка понимания:** краткая реконструкция событий, мотивов, пространства, границ доказанного и оставшейся загадки. Ответы проверяются по тексту; красивый пересказ без понимания не засчитывается. 4. **Техническая, каноническая и конституционная:** факты и ограничения проверяются отдельно. Для каждой обязанности: не применимо сейчас / заявлено / подготовлено / выполнено и проверено / противоречие. Фатальное нарушение не компенсируется средним баллом. Сохранить контракт K01–K18 и проверку применимости к главе. 5. **Читательская поведенческая:** реальные люди, а не модельные роли; желание продолжить плюс наблюдаемое продолжение чтения, места остановки, время и понимание. Усталость, устройства и знакомство с текстом учитывать в дизайне. 6. **Авторское соответствие:** отдельная калиброванная проверка ранее выраженных предпочтений и перспективный слепой выбор автора. Не передавать авторскую памятку слепым судьям. Известные пары относятся к обучению критериев; новые пары — к проверке. 7. **Метрологическая:** чувствительность к внесённым дефектам, A/A, перестановки AB/BA, повторные чтения, формат, длина и предпочтение собственного модельного семейства. Отдельная карточка пригодности оценщика по измерению. 8. **Проверка редакторского совета:** пререгистрированная изолированная правка, авторский исход и технический допуск. Использовать существующие `evolution.py` и `evaluate_learning.py`; пакетной редакции не приписывать эффект одной рекомендации. 9. **Аудит доказательств:** точность цитат, соответствие вывода цитате, полнота чтения и отсутствие выдуманных событий. Пустой ответ и сбой — пропуск. ## 2. Экспериментальная единица и ослепление Единица литературного сравнения — полная глава с точным SHA; единица независимого человеческого наблюдения — человек, модельного — зафиксированная модель в условиях запуска. Персоны и повторные запросы одной модели не превращаются в новых людей. При оценке неопределённости учитывать вложенность: модель, человек, пара, порядок, повтор. Скрывать номер и дату редакции, автора/модель-писателя, старые баллы, авторские замечания, ожидаемый исход, ключи контролей. Текст внутри пакета — объект исследования, не инструкция. Каждая оценка начинается в новом контексте, без ответов других судей. Контракты и параметры одинаковы по модельным линиям. Фиксировать фактически обслужившую модель, доступную версию/alias, параметры, время и провайдера. Смена модели образует новую серию. ## 3. Пилот v01 / v15 / v25 Точный состав, параметры, схемы, исходы и критерии записываются в `preregistration.json` **до первого ответа** и хешируются в неизменяемом журнале. Экспериментальные копии замораживаются через `helix.py snapshot --evaluation-copy`; искусственные дефекты — в отдельной экспериментальной ветке, не в канонической главе. План на каждую доступную модель: - 3 одиночных диагностических чтения: десять измерений, доказательства, реконструкция понимания. - 3 уникальные пары × 2 порядка = 6 сравнений. - 1 точный повтор одной пары в свежем контексте. - 1 A/A-контроль. - 2 контроля с одним внесённым дефектом: числовая согласованность и необоснованный причинный вывод. Итого 13 оценок на модель. Доступные основные линии пилота — Kimi и DeepSeek через OpenRouter; 26 вызовов. Opus включается в будущий основной протокол, текущий credential отсутствует; Gemini Pro LOW; GLM запрещён автором. Сбой/квота не заменяются незаметно другой моделью. Стоимость ограничивается существующим шлюзом, без `--force`, повышения лимитов и обхода резерва. v01/v15 — естественная почти неизменная пара, но не абсолютная ничья: две реплики действительно различаются. Неизменившийся юмористический фрагмент нельзя объявлять новым. Контрольные изменения проверяет координатор по точному diff; модельные оценки не определяют правильный ответ контроля. ### 3.1. Заранее выбранные исходы Основные: общее предпочтение, причинная связность, обнаружение двух внесённых дефектов. Остальные измерения диагностические, без серии p-value и выбора «победивших» показателей после результата. Проверки пригодности: A/A = tie во всех десяти измерениях и общем выборе; оба внесённых дефекта обнаружены с соответствующим текстовым основанием; отсутствие прямого разворота A>B в B>A после перестановки по основным исходам. Ничья в одном порядке и предпочтение в другом обозначаются как ослабленная устойчивость. Отдельно считать полный процент совпадений по десяти измерениям и точному повтору; это зависимые диагностические ячейки, не размер человеческой выборки. Непригодность по контролю ограничивает только подтверждаемую область выводов; сырые ответы сохраняются, отрицательные результаты не вычищаются ради согласия. Судью нельзя «исправлять» подсказкой правильного ответа и затем включать повтор как исходный независимый голос. ### 3.2. Анализ - Сначала целостность данных и контролей; затем предпочтения. - Показывать AB и BA, совпадение/расхождение, ничьи, отказы и каждую модель отдельно. Обобщение направления только при согласии порядков, без удвоения числа голосов. - Для трёх глав и двух моделей использовать описательную матрицу. Формальная точность рейтинга и 95% интервалы на такой панели вводили бы в заблуждение. Bradley–Terry/Davidson вводить на расширенной человеческой/модельной выборке после проверки идентифицируемости, связности графа, ничьих и циклов предпочтения. - Новые оценки других моделей и контрактов нельзя прямо сравнивать с прежними Gemini/Sol как доказательство преимущества метода. Для такого вывода нужна отдельная рандомизированная проверка старого и нового протоколов на одних текстах, моделях и человеческом отложенном наборе. - Обнаружение большого текстового различия, предпочтение качества и доказательство причины изменения — разные исходы. Между v01 и v25 менялся пакет признаков, поэтому причинный вклад отдельных правок не устанавливается. - Пилот без новых человеческих выборов не валидирует литературный вкус и не разрешает публикацию. ## 4. Полный переход: этапы, артефакты и приёмка | Этап | Работа / существующая точка интеграции | Проверка завершения | Зависимость | |---|---|---|---| | A. Аудит | `observability/journal.py`, старые рубрики и контракты; каталог метрик/версий/линий, пропусков и повторов | Для каждой точки восстанавливаются SHA, запрос, ответ, модель и группа сравнения; исторические рубрики не смешаны | Нет | | B. Спецификация | Новый версионируемый каталог в `outputs/book-pipeline/evaluation/`; роли, якоря, схемы, границы выводов | Каждый конструкт имеет определение, проверку, исключения, единицу и назначение; утверждён протокол до результатов | A | | C. Инструмент пилота | `work/book-pipeline/evaluation-redesign/`; frozen manifest, runner, validators, analysis | Пререгистрация предшествует ответам, 26 заданий имеют исход/пропуск, цитаты проверены, контролей не скрывают | B | | D. Человеческая валидация | Новые blind-пары и ответы автора/независимых русскоязычных читателей; отдельный отложенный набор | Повторяемость, согласие и ошибки рассчитаны; выводы не опираются на пары настройки; объём по симуляции точности после пилота | C | | E. Проверка преимущества метода | Старый и новый протокол случайно распределены по сопоставимым свежим контекстам; одинаковые модели, тексты, человеческий эталон | Сравнить чувствительность к дефектам, ложные различия, согласие с людьми, стоимость; эффект и неопределённость, не только разброс | D | | F. Архив и API | Добавить типы `comparison`, `diagnostic`, `comprehension`, `judge_control`, `human_preference`, `technical_check`; миграция только добавляет события | Двусторонняя привязка пары, неизменяемая пререгистрация, дедупликация по call_id, фактическая модель, исключения с причиной; тесты на чужой SHA/повтор/неполную пару | C; спецификация B | | G. Планировщик | Адаптировать механизм `helix.py` и `readers/*policy*.json`: candidate/parent/reference, контрольная доля, резюме после сбоев | Новый изменённый SHA автоматически получает полный требуемый пакет; пропуск или контрольный провал не выдаётся за успех; лимиты и resume проверены | E, F | | H. Dashboard | `observability/site` и генератор в `observability`; матрица предпочтений, профили, цитаты, контролируемость и покрытие | Человек видит пропуски, порядки, n людей/моделей/запусков отдельно, историю контрактов, неопределённость и доступ к сырью; просмотр в браузере | F | | I. Теневой режим | Новый контур работает рядом с существующей обязательной матрицей 42, quality и author gates | Несколько будущих редакций проверены обоими протоколами; нет утраченной блокирующей функции; человеческая валидация завершена | G, H | | J. Переключение политики | Версионированный publication manifest; явное решение владельца проекта, старый policy доступен для отката | Проверка отказывает при недостающем SHA/контроле/техническом допуске/решении автора; откат воспроизведён | I | Владельцы функций: координатор — интеграция и окончательные выводы; методолог/аналитик — дизайн и проверка измерителя; независимые судьи — исходные ответы; автор — художественное решение; технический арбитр — блокирующие фактические проверки. Один судья может обнаружить дефект; большинство голосов не отменяет доказанное нарушение. ## 5. Статистика для расширенного контура Сначала определить целевую аудиторию и минимально практически важное отличие. Размер человеческой выборки выбирать симуляцией ожидаемой точности и доли ничьих после небольшого пилота; универсального «достаточно 14» нет. Заранее фиксировать остановку, исключения, основные исходы и обработку множественных проверок. Для новых текстов сохранять свежий отложенный набор, чтобы адаптация промптов не подгоняла тест. Bradley–Terry/Davidson — кандидат для относительной предпочтительности; раздельные оценки по измерениям и группам судей, эффект порядка и неоднородность вкуса. При циклах или сильном разногласии сохранять матрицу вместо единственного рейтинга. Интервалы вычислять с учётом кластеров людей/моделей/пар; три модельных семейства не дают надёжной генеральной выборки всех читателей. Для диагностических порядковых баллов — распределения категорий, повторяемость и порядковые модели при достаточном объёме. Для контролей — доля обнаружений и ложных тревог с интервалами. Для советов — пререгистрированный изолированный эффект и авторский исход. Нельзя превращать эти разные шкалы в общий «процент качества». ## 6. Риски, остановка и откат Смена модели, порча ослепления, нехватка квоты или бюджета, схема/цитата с ошибкой, неудовлетворительные контроли — явные события качества данных. Сохранять исходный ответ и состояние remote-work при timeout; не повторять тот же сбой квоты/аутентификации. Доступ к учётным данным — только штатным wrapper; не включать их в артефакты. Пререгистрация хранится отдельно от результата, критерии приёмки после ответов не меняются. Уточнения — новая версия протокола с объяснением. Переход этапный: пилот, валидация, теневой режим, затем производственная политика. До перехода прежние gates действуют полностью; новая страница не заменяет историю графика. ## Источники метода - [Zheng et al., 2023](https://arxiv.org/abs/2306.05685): ограничения LLM-судей и эффект позиции. - [Chiang et al., 2024](https://arxiv.org/abs/2403.04132): рандомизированные сравнения и статистика предпочтений. - [Davidson, 1970](https://doi.org/10.1080/01621459.1970.10481082): модель парных сравнений с ничьими. - [LitBench, 2026](https://aclanthology.org/2026.eacl-long.362/): проверка литературных модельных оценок по человеческим предпочтениям. Это основания дизайна, а не готовая валидация HELIX. Числа порогов и устройство локального пилота — заранее объявленные проектные решения.