# HELIX — архивный научный пилот v01 / v15 / v25 ## Решение Эксперимент завершён. Новый сравнительный протокол показал различия отдельных функций и ошибки самого измерителя. **Вводить автоматический итоговый рейтинг или публикационный допуск по этому пилоту рано.** План полной перестройки с учётом результатов: [plan.v2.md](/Users/Andrey.Sarafanov/Documents/Codex/2026-09-30/english-harness-final-handoff/work/book-pipeline/evaluation-redesign/plan.v2.md). Исходный план и пререгистрация сохранены без изменений. Локальная исследовательская страница: [открыть пилот](http://127.0.0.1:9475/evaluation-pilot.html). **Действующее распределение ролей с 2026-10-02:** Astra (`gpt-6-astra`) планирует оценки и арбитрирует доказательства; все читательские, критические, числовые, сравнительные и технические роли выполняет Sol (`gpt-5.6-sol`). Этот отдельный пилот был зарегистрирован 2026-10-01 и проведён на Kimi и DeepSeek. Его данные сохраняются как историческое исследование измерителя и не входят в сопоставимые панели Sol. Человеческих ответов в источниках пилота нет. ## Что действительно проведено - 3 архивные главы: первая v01, v15-dialogue, последняя v25-futuristic. - 2 модельные линии: `moonshotai/kimi-k3`, `deepseek/deepseek-v4-pro`; фактические API-идентификаторы и upstream-провайдеры сохранены для каждого вызова. Backend-build модели сервисом не предоставлен. - 13 заранее назначенных заданий на модель: 3 самостоятельных профиля, 6 попарных сравнений AB/BA, 1 точный повтор, 1 A/A, 2 искусственных дефекта. - **26 вызовов; 23 структурно действительных ответа; 3 ошибки JSON.** Сбои: deepseek-p07 (v01/v25), deepseek-p10 (v15/v25), kimi-p09 (v01/v15). Не заменены выдуманным голосом или повтором с подсказкой. - Новые измерения: стиль, функция деталей, связность, сеттинг, голоса, эмоциональная глубина, драматургия, подтекст, юмор и границы знания. Отдельно — понимание текста и общее предпочтение. - Измеренная стоимость экспериментальных вызовов: **$0.5520**, включая ответы с ошибкой структуры; методологическая проверка плана вне этой суммы. - Экспериментальный журнал содержит 38 привязок рецензий к текстам: парный ответ записан для обеих глав, но остаётся **одним вызовом**, а не двумя независимыми голосами. Контроль A/A не удваивает запись. На момент регистрации этого пилота (2026-10-01) Opus credential был недоступен, а Gemini Pro имел LOW-статус (9% тогдашнего лимита); поэтому зарегистрированные экспериментальные линии были Kimi и DeepSeek. Эти квотные сведения исторические и не описывают текущий статус. По действующей с 2026-10-02 схеме пилотные Kimi/DeepSeek ответы не подменяют оценки Sol и исключены из Sol-панелей. ## Главный результат: измеритель всё ещё склонен к завышенному одобрению Все **60 из 60** исходных диагностических категорий попали в две верхние: `works` (16) или `strong` (44). Среди 38 категорий с дословно подтверждённой цитатой тоже нет нижних уровней. Поэтому замена чисел словесными якорями и добавление аспектов сами по себе насыщение не устранили. Это наблюдение об ответах этих моделей на эти тексты; человеческое качество глав им не доказано. ## Надёжность | Проверка | Kimi | DeepSeek | |---|---|---| | JSON-структура | 12/13 | 11/13 | | Ответы хотя бы с одной неточной цитатой | 3/12 | 11/11 | | Несовпадающие поля цитат | 6 | 68 | | Одинаковая глава против себя | Ничья по всем критериям и общему выбору; доказательства точны | Ничья по всем критериям и общему выбору; 4 поля доказательств не являются цитатами | | Внесённое 70 вместо 40 тонн | Обнаружено, доказательства точны | Обнаружено по смыслу, но цитаты склеены; строгий контроль не пройден | | Внесённый ложный вывод о кислороде | Обнаружено, доказательства точны | Обнаружено, доказательства точны | | Точный повтор v25/v01 | Совпали 5 из 9 ячеек, пригодных для сопоставления | Совпала 1 из 4 пригодных ячеек; по эмоции победитель сменился | Всего **74 несовпадения цитат в 14 из 23 ответов**. Это поля, не 74 независимых рецензента или ошибки сюжета. Часть — многоточия, склейка и изменение переносов; у одного ответа DeepSeek слова разбиты пробелами на слоги. Исходные ответы сохранены. Ни текст цитат, ни предпочтения автоматически не «исправлялись». Повтор содержит 10 аспектов плюс общий выбор. Знаменатели 9 и 4 различаются, потому что требуется дословное доказательство в обеих попытках. Эти зависимые ячейки нельзя использовать как размер выборки для доверительного интервала. Точного повторения предпочтения недостаточно, если цитата выдумана; точной цитаты недостаточно, если вывод из неё неверен. Дополнительный смысловой аудит нашёл два примера: Kimi в чтении v01 приписал локальному измерению возможность установить, что искажает данные именно ядро; в чтении v25 назвал протечку терпимой «годами», хотя такого срока в тексте нет. Это ошибки обоснования рецензента, а не доказанные дефекты главы. См. [semantic-audit.json](/Users/Andrey.Sarafanov/Documents/Codex/2026-09-30/english-harness-final-handoff/work/book-pipeline/evaluation-redesign/semantic-audit.json). ## Что можно сказать о трёх версиях ### v01 и v15 Diff показывает замену двух реплик про азот/воздух и завершающего перевода строки. v15 не является пятнадцатью последовательными крупными улучшениями v01. DeepSeek в обоих порядках предпочёл v15, ссылаясь на более предметный вопрос Орины и ответ Жени. Kimi дал ничью в одном порядке; второй ответ не разобрался как JSON. Уверенного общего рейтинга этой пары нет. ### v01 и v25 В двух основных порядках Kimi предпочёл v25. Устойчивые выборы с точными цитатами: **сеттинг, драматургия и границы знания — v25; подтекст и юмор — ничья**. По другим аспектам есть расхождения или невалидные цитаты. В дополнительном точном повторе Kimi изменил общий выбор с v25 на ничью: приобретения детали/действия уравновесились преимуществами раннего текста в голосах, юморе и эмоции. У DeepSeek один основной порядок невалиден, а повтор неполон по доказательствам. Это наблюдаемый компромисс, а не установленная победа v25 для автора. ### v15 и v25 У Kimi в обоих порядках с точными цитатами **детали, сеттинг и границы знания — v25; стиль, связность и подтекст — ничья**. По голосам победитель поменялся с порядком предъявления; общий выбор — v25 в одном порядке и ничья в другом. У DeepSeek один порядок невалиден, второй содержит неточную цитату общего предпочтения. По одному такому сравнению нельзя отделить эффект порядка от обычной нестабильности. Полные матрицы и причины доступны на странице пилота и в [analysis.json](/Users/Andrey.Sarafanov/Documents/Codex/2026-09-30/english-harness-final-handoff/work/book-pipeline/evaluation-redesign/analysis.json). Отдельные валидные ячейки сохранены, но неполные или нестабильные пары не превращены в устойчивую победу. ## Что меняется в плане 1. Сначала — извлечение доказательств кодом по устойчивым ID фрагментов и отдельная проверка смысла вывода. 2. Отдельные короткие пакеты для литературного сравнения, понимания и фактической проверки. Гипотезу об улучшении надёжности проверить новым опытом. 3. Несколько повторов, перестановок и A/A на разных текстах; контроли голоса, юмора, пространства и деталей, подтверждённые человеком. 4. Новые слепые выборы автора и независимых читателей на отложенных парах. Авторское соответствие и аудитория остаются разными исходами. 5. После проверки — расширенный граф сравнений всех версий и статистическая модель с ничьими. Сейчас описательная матрица информативнее формального рейтинга. 6. Производственный переход через теневой режим, с сохранением действующих технических, канонических и авторских барьеров и возможностью отката. Нужная система должна показывать и изменения главы, и пригодность инструмента, которым они измерены. Увеличение разброса оценок не является самостоятельной целью. ## Границы и воспроизводимость Это пилот двух модельных семейств, без новых человеческих решений. Он не доказывает превосходства метода над старым: для этого нужен опыт со старым/новым протоколом на одинаковых судьях, текстах и независимом человеческом эталоне. Предпочтения не устанавливают причинный эффект пакета правок. Грубые контрольные дефекты не проверяют тонкий литературный вкус. Opus и Gemini в этом опыте отсутствуют. Пререгистрация SHA-256: `422e394d5fcb30aef02f194e86697f0db496afa35a9a43bc6986751e22677c8b`. Все запросы зафиксированы до запуска; фактически отправленные запросы сверены с ними. Тексты не публиковались и каноническая глава не редактировалась. Искусственные дефекты находятся в отдельном исследовательском архиве и не добавляют фиктивных версий в основной график. Артефакты: `preregistration.json`, `contracts/`, `schemas/`, `packets/`, `results/*/request.json`, `response-envelope.json`, `response.json`, `status.json`, `archive/`, `analysis.json`. Смысловой аудит координатора не выдан за независимое человеческое чтение. Методологическая проверка плана — [plan-review.md](/Users/Andrey.Sarafanov/Documents/Codex/2026-09-30/english-harness-final-handoff/work/book-pipeline/evaluation-redesign/plan-review.md).