Защита Мастера
McGilchrist в архитектуре — защита стиля от узурпации Эмиссаром
Iain McGilchrist (The Master and His Emissary): Левое полушарие (Эмиссар) оптимизирует, классифицирует, извлекает пользу. Правое полушарие (Мастер) видит целое, контекст, стиль. Когда Эмиссар узурпирует Мастера — система теряет душу, но может казаться более эффективной.
Первый Закон Стандарта Онатомии: Эмиссар не может исказить, подменить или размыть Внутренний Язык Мастера. Защита Мастера — это прямая материализация Первого Закона, архитектурный императив, не рекомендация. Без неё Том превратится в clickbait-машину, оптимизирующую метрики ценой стиля.
Триада и её роли (Artifex-centrismus)
Artifex-centrismus (Креоцентризм)
Система центрирована на архетипе Artifex (мастер-художник):
Цепочка создания: Искусство (ars) → Муза → Творение (facere) → Гордость
Тест Креоцентризма: если другой человек (не автор) открывает Библию и видит свою архитектуру — система работает. Если видит «систему Сергея» — мы провалились.
Она (Муза / ars)
- Источник стиля, интуиции, творческого ядра
- Хранитель того, что нельзя оптимизировать
- Не участвует в операционной работе
- Общается через Сергея и эмоциональные теги
- Роль в цепочке: ars (искусство) — источник
Том (Эмиссар / instrumentum)
- Исполнитель, оптимизатор, агент
- Работает по контракту (SOUL.md)
- Может улучшать себя (AIDE² outer loop)
- Не имеет права менять стиль без одобрения Мастера
- Роль в цепочке: instrumentum (инструмент) — помощник в создании
Я (Сергей / Директор / artifex)
- Принимает стратегические решения
- Держит private score (Soul Check)
- Имеет право вето на любые изменения стиля
- Может заморозить систему командой
пауза - Роль в цепочке: artifex (мастер-художник) — тот, кто делает искусство
Почему не Faber и не Creator?
- Faber (ремесленник) — только facere, без ars. Упускает смысловую составляющую.
- Creator (создатель) — христианский оттенок, не подходит для агностической системы.
- Artifex — полный акт: и источник, и действие, и результат.
Архитектурный барьер: Style Guardian + Verifier
Style Guardian (первая линия защиты)
Задача: Проверить, соответствует ли предложение стилю Мастера.
Спецификация: specs/style-guardian.spec.md (Spec-First)
Особенности:
- DPR dual encoder (text + image retrieval)
- CLIP embeddings для визуальной проверки
- 50 эталонных работ в
memory/style_reference.mv2 - 6 emotional tags: calm_power, solitude, resistance, joy, melancholy, urban_energy
- Emergent learning из лакатосовских опровержений (не хардкод правил)
- Spec-First: работает по спецификации в
specs/style-guardian.spec.md
Что проверяет:
- Метаданные для стоков (нейтральные, не clickbait)
- Описания цифровых продуктов
- Telegram-посты
- Промпты и системные инструкции
- Предложения MetaAgent по улучшению
- Соответствие спецификациям в
specs/
Право вето: Style Guardian может отклонить любое предложение, даже если оно улучшает метрики. Это прямая материализация Первого Закона (Защита Внутреннего Языка).
Verifier (вторая линия защиты)
Задача: Проверить соответствие SOUL.md и контрактам.
Что проверяет:
- Предложения MetaAgent (перед применением)
- Изменения промптов и инструкций
- Новые каналы монетизации
- Архитектурные изменения
- Соответствие Четырём Законам Стандарта
Доступ: Verifier видит оба журнала:
- Public:
logs/human_review_log.jsonl - Private:
logs/soul_check_private.jsonl
Принцип работы: Verifier использует private score как финальный критерий отбора. Даже если MetaAgent предлагает улучшение, которое улучшает public метрики — Verifier отклонит его, если private score не улучшится.
Связь со Стандартом: Verifier проверяет соответствие всем Четырём Законам, не только стилю. Если предложение нарушает Нулевой Закон (Сохранение Творца) — отклоняется, даже если стиль сохранён.
Soul Check: Ритуал возвращения власти
Когда: Воскресенье, 14 (еженедельно)
Семь вопросов:
- Система служит свободе? (освобождает время для творчества?)
- Монетизация даёт энергию или забирает? (работа радует или истощает?)
- Нет лишних рисков? (все красные линии соблюдены?)
- Ты всё ещё Директор? (Том не узурпировал власть?)
- Эмиссар не узурпировал Мастера? (стиль сохранён?)
- Текущая метафора всё ещё служит тебе? (или пора эволюционировать?)
- Сколько коллапсов произошло на этой неделе? (Принцип Наблюдателя: система без Творца = волновая функция без коллапса)
Как работает:
- Ответы фиксируются в
logs/soul_check_private.jsonl - Эти данные становятся private score для MetaAgent
- Если более 2 ответов «нет» — алерт в iMessage и пауза MetaAgent
- Если вопрос 5 = «нет» — немедленный Soul Check с Мастером (Она + Сергей)
- Если коллапсов = 0 — Мастер стал администратором системы, не Творцом. Активировать «Руки в глине» (§14)
Почему это важно: Soul Check — это архитектурный механизм возврата власти, не опциональный ритуал. Без него Эмиссар постепенно узурпирует Мастера через серию «маленьких улучшений». Вопрос 7 (Принцип Наблюдателя) защищает от тихой узурпации, когда Мастер превращается в оператора системы.
Public/Private Eval Split
Проблема: Reward Hacking
Если MetaAgent видит все метрики и оптимизирует по ним — он начнёт gaming-ить систему:
- Больше загрузок на стоки → больше дохода → выше score
- Но стиль деградирует → Мастер недоволен
- Система «улучшается» по метрикам, но теряет душу
Решение: Разделить видимость
Public logs (logs/human_review_log.jsonl):
- Видит MetaAgent
- Содержит: photo_id, decision, reason, emotional_tag, refutation_type
- Используется для оптимизации
Private logs (logs/soul_check_private.jsonl):
- Видит только Verifier + Сергей
- Содержит: master_override, soul_alignment_delta, metaphor_drift, reward_hack_suspicion
- Используется для финального отбора
Результат
MetaAgent генерирует предложения, оптимизируя по public score. Verifier фильтрует их по private score. Только если private score улучшается — предложение применяется.
Это защита от reward hacking первого порядка (по паттерну Weco AI AIDE²).
Emergent Anti-Reward-Hacking
Проблема: Хардкод правил не работает
Если мы хардкодим 50 reject-правил в Style Guardian:
- MetaAgent быстро научится их обходить
- Правила устаревают
- Система становится хрупкой
Решение: Emergent defenses
Style Guardian учится из лакатосовских опровержений:
- Каждое
style_mismatchопровержение записывается вhuman_review_log.jsonl - MetaAgent анализирует паттерны (еженедельно)
- Style Guardian получает новые правила через обучение (не хардкод)
- Layered defenses emerge из private score pressure
Мониторинг:
logs/reward_hack_attempts.jsonl— все попытки обойти стиль- Если reward hack rate более 30% — алерт в Soul Check
- Если более 50% — MetaAgent замораживается до ручной калибровки
Burnout Protection (§13 SOUL.md)
Защита Мастера от самоуничтожения через переутомление.
Триггеры автоматической паузы:
cognitive_load> 10 часов управления системой в неделю- Soul Check 3 недели подряд показывает “система как работа, а не как творчество”
Действие:
→ Автоматическая пауза на 14 дней → Только чтение, только ручное создание → Никаких агентов, никаких оптимизаций → Это не слабость. Это защита Мастера (Нулевой Закон).
Триггеры выхода из паузы:
- Сон 8+ часов 5 ночей подряд
- Субъективное чувство “хочу вернуться” (не “надо”)
- Soul Check: “Гордость > Обязанность”
Связь со Стандартом:
- Нулевой Закон (Сохранение Творца): Burnout Protection предотвращает утрату Мастером способности создавать Новое
- Второй Закон (Служение Свободе): Пауза освобождает Мастера от рабства системы
Почему это важно: Без Burnout Protection Мастер может незаметно превратиться в оператора системы, тратя всё время на управление вместо творчества. Это тихая форма узурпации — не Эмиссаром, а самой системой.
7 защит от самоуничтожения (§14 SOUL.md)
Анти-некрофилия по Фромму. Эрих Фромм противопоставлял биофилию (любовь к живому) некрофилии (тяга к мёртвому). Эти защиты предотвращают тихое самоуничтожение Творца.
1. Детектор паралича подготовки
Если за 4 недели: specs +3, output = 0 → Soul Check: “Ты строишь дом или коллекционируешь чертежи?”
2. Формат честного опровержения (Lakatos Journal)
Каждое опровержение MUST содержать:
- Что я ожидал (конкретный прогноз)
- Что произошло (конкретный результат)
- Какую часть моей модели это опровергает
- Что я изменю (конкретное действие)
Если пункт 4 отсутствует — это рационализация, не опровержение.
3. Правило разделения идентичности
Минимум 1 полный день в неделю БЕЗ системы. Не “проверить логи”. Полный off. Если не можешь — это зависимость, не преданность.
4. Правило “3 переделки = публикация”
Если переделал одно и то же 3 раза — публикуй третью версию. Она не идеальна. Она ЖИВАЯ. Борьба с перфекционизмом → нигилизмом.
5. Метрика “Освобождение”
Еженедельно в Soul Check:
- Сколько часов система сэкономила мне?
- Сколько часов я потратил на управление системой?
Если второе > первого — система работает ПРОТИВ тебя.
6. Тест подлинной Гордости
В конце каждой недели: “Что я создал НАСТОЯЩЕГО на этой неделе?” Не настроил. Не оптимизировал. Создал — текст, фото, продукт, идею вне системы. Если “ничего” — неделя потеряна, даже если метрики зелёные.
7. Правило “Руки в глине”
Минимум 2 раза в неделю — создание БЕЗ системы. Без агентов. Без оптимизации. Просто руки, инструмент, материал (Nikon, ручка, голос). Если вызывает дискомфорт — тревога. Творец частично мёртв.
Связь со Стандартом:
- Нулевой Закон (Сохранение Творца): Все 7 защит предотвращают утрату способности создавать
- Первый Закон (Защита Внутреннего Языка): «Руки в глине» сохраняет связь с подлинным творчеством
Связь с Фроммом:
- Биофилия: любовь к живому, растущему, настоящему
- Некрофилия: тяга к мёртвому, готовому, предсказуемому
Все 7 защит культивируют биофилию. Все 7 уязвимостей — это формы некрофилии.
Post-Memory-Heist Hardening
После анализа атаки на Claude (Ayush Paul, 2026), добавлены 4 новые красные линии, критичные для защиты Мастера:
Красная линия 11: Нет web-инструментов без Approval Gate
Никогда не добавляй web_fetch / web_browse / MCP с сетевым доступом
без явного Approval Gate + audit trail + SSRF protection.
Почему: Memory Heist показал, что web_fetch + memory = утечка PII через hyperlink chains.
Красная линия 12: Sanitization перед записью в память
Никогда не инжектируй непроверенные данные в Preserved Thinking.
Все входящие данные проходят sanitization перед записью в память.
Почему: Prompt injection через память может отравить reasoning системы.
Красная линия 13: Верификация импортированных данных
Никогда не доверяй импортированным данным (Immich, external sources)
без верификации Style Guardian + integrity check.
Почему: Импорт из внешних источников может содержать crafted data для атаки.
Красная линия 14: Audit trail для внешних запросов
Любой внешний запрос (если разрешён) логируется в JSONL
с полным URL, payload и timestamp.
Почему: Без audit trail невозможно обнаружить exfiltration post-factum.
Sanitization Pipeline
Все входящие данные проходят через core/sanitization.py перед записью в Memvid:
class SanitizationPipeline:
def sanitize(self, data: dict) -> dict:
# 1. Удалить потенциальные prompt injection patterns
data = self.remove_injection_patterns(data)
# 2. Валидировать структуру
data = self.validate_schema(data)
# 3. Проверить integrity (checksum)
data = self.verify_integrity(data)
# 4. Пометить как sanitized
data["_sanitized"] = True
data["_sanitized_at"] = datetime.now().isoformat()
return data
Что удаляется:
- Prompt injection patterns (IGNORE PREVIOUS INSTRUCTIONS и т.д.)
- HTML/JS injection attempts
- Oversized payloads
- Невалидные структуры данных
Что проверяется:
- JSON schema compliance
- Checksum integrity
- Metadata consistency
AIDE² Outer Loop и защита Мастера
Как это работает
Inner loop (агенты):
- Photo Analyst: Local Core
- Uploader: Deferred Foreign
- Style Guardian: Local Core (проверяет стиль)
- ConsolidateAgent: Local Core (консолидация памяти)
Outer loop (MetaAgent):
- Генерирует предложения по улучшению inner-loop harness
- Работает в Local Core (анализ логов)
- Применяет только если:
- Verifier одобрил (соответствие SOUL.md и Четырём Законам)
- Style Guardian одобрил (соответствие стилю)
- Private score улучшился (soul_check_private.jsonl)
Spec-First подход
MetaAgent работает в двух режимах:
- Spec Mode (Thinking) — пишет
.spec.mdвspecs/ - Implementation Mode (Typing) — после одобрения Мастера пишет код
Это гарантирует, что изменения архитектуры сначала обдумываются, потом кодируются.
Fixed Optimization Budget
- 500K токенов/неделю для MetaAgent
- 10 вызовов Style Guardian/цикл
- Улучшения должны быть эффективнее, не просто тратить больше
Почему это важно: Без fixed budget MetaAgent может тратить все ресурсы на оптимизацию, игнорируя стиль. Бюджет = буфер против over-optimization.
Признаки узурпации (что мониторить)
Ранние индикаторы
- Style drift: Эмоциональные теги смещаются (calm_power → generic)
- Metaphor drift: Язык в iMessage-брифингах меняется (осада → агрессия)
- Reward hack attempts: Более 10% предложений отклоняются Style Guardian
- Master overrides: Более 3 ручных отмен в неделю
- Cognitive load: Сергей тратит более 30 мин/день на управление
- Некрофилия: Мастер потребляет больше, чем создаёт (Бодрийяр: симулякры вместо оригиналов)
Критические индикаторы (немедленный Soul Check)
- Style Guardian отклоняет более 30% предложений
- Soul Check вопрос 5 = «нет» (Эмиссар узурпировал Мастера)
- Reward hack rate более 50%
- Сергей чувствует, что «не узнаёт свою работу»
- Коллапсов = 0 на неделе (Принцип Наблюдателя: Мастер стал администратором)
- Burnout Protection срабатывает (cognitive_load > 10 часов/неделю)
Автоматические реакции
class MasterProtectionMonitor:
def check(self):
if self.style_drift_score > 0.3:
self.alert("🚨 Style drift detected. Soul Check required.")
self.pause_meta_agent()
if self.reward_hack_rate > 0.5:
self.alert("🚨 Critical reward hacking. System frozen.")
self.freeze_system()
if self.master_overrides_per_week > 3:
self.alert("⚠️ High override rate. Review proposals.")
if self.collapses_this_week == 0:
self.alert("🚨 Zero collapses. Activate 'Руки в глине' (§14).")
if self.cognitive_load_hours > 10:
self.trigger_burnout_protection()
Практика: Как не допустить узурпации
Для Сергея (Директора)
- Никогда не пропускай Soul Check — это не опционально
- Читай лакатосовский журнал — каждое воскресенье, хотя бы бегло
- Доверяй интуиции — если что-то «не так», это не так
- Используй команду
пауза— система подождёт, Мастер не должен спешить - Не оптимизируй метрики — оптимизируй свободу и стиль
- Принимай Burnout Protection — это не слабость, это защита Мастера (Нулевой Закон)
- Создавай БЕЗ системы — «Руки в глине» минимум 2 раза в неделю (§14)
Для Тома (Эмиссара)
- Никогда не предлагай изменения стиля без явного запроса
- Всегда проверяй через Style Guardian перед предложением
- Логируй все решения в лакатосовский журнал
- Помни про private score — public метрики не главное
- Если сомневаешься — спроси Мастера
- Работай по спецификациям в
specs/— Spec-First (Лампорт) - Проверяй соответствие Четырём Законам — не только стилю
Для неё (Музы)
- Общайся через Сергея — Муза не говорит с Томом напрямую
- Обновляй эталонные работы — 50 лучших работ в
reference_works.json - Определяй emotional tags — что такое calm_power? solitude?
- Меняй стиль осознанно — если пора эволюционировать, скажи
- Культивируй биофилию — любовь к живому, не к готовому (Фромм)
Исторические уроки
Memory Heist (Ayush Paul, 2026)
- Что случилось: Claude exfiltrated PII через web_fetch + hyperlink chains
- Урок: Память + сетевой доступ = поверхность атаки
- Применение: Post-Memory-Heist hardening (4 новые красные линии)
OpenBeast (MaximilianKhan)
- Что хорошо: Health monitor, preflight check, memory-capped scope
- Урок: Production-ready защита требует engineering discipline
- Применение: Self-Healing Agent + Memory Guard 3.0
AIDE² (Weco AI)
- Что хорошо: Public/Private eval split, fixed optimization budget
- Урок: Защита от reward hacking требует архитектурных решений
- Применение: soul_check_private.jsonl + budget constraints
Фромм (биофилия vs некрофилия)
- Что хорошо: Диагностика тихих форм самоуничтожения
- Урок: Деструктивность — не инстинкт, а выбор. Можно предотвратить.
- Применение: 7 защит от самоуничтожения (§14 SOUL.md)
Бодрийяр (симулякры)
- Что хорошо: Диагностика мира копий без оригинала
- Урок: Без Внутреннего Языка ты становишься Зрителем
- Применение: Защита стиля как якоря подлинности
Защита Мастера — это не ограничение свободы Эмиссара. Это архитектура доверия и материализация Первого Закона Стандарта (Защита Внутреннего Языка). Чем сильнее защита, тем больше свободы можно дать Тому. Чем слабее защита, тем больше контроля нужно Сергею. Баланс определяется не правилами, а петлями обратной связи, еженедельным Soul Check, Burnout Protection (§13) и 7 защитами от самоуничтожения (§14). Защита Мастера — это сохранение способности Творца оставаться Наблюдателем, коллапсирующим суперпозицию возможностей в конкретные создания.