Sutskever-30 Foundational Papers
30 ключевых papers в deep learning, которые определили технический стек Онатомии
Ilya Sutskever сказал John Carmack: «Если ты действительно выучишь все эти papers, ты будешь знать 90% того, что важно сегодня.» Этот список — не декорация, а математический фундамент архитектуры Онатомии.
Каждый paper материализован в конкретных компонентах системы и связан с Четырьмя Законами Стандарта Онатомии. Здесь описано, какие papers критичны, какие полезны, и как они связаны с архитектурой.
Критические papers (активно используются)
#28 Dense Passage Retrieval (DPR)
Авторы: Karpukhin et al. (Facebook AI, 2020) Ключевая идея: Dual encoder architecture для semantic search. Query encoder + passage encoder, in-batch negatives для обучения.
Применение в Онатомии:
- Style Guardian: DPR dual encoder для проверки соответствия стиля (text + image retrieval)
- Photo Analyst: Поиск похожих работ в
memory/style_reference.mv2 - QueryAgent: Синтез ответов с цитатами из Memvid
Связь со Стандартом:
- Первый Закон (Защита Внутреннего Языка): DPR защищает стиль через semantic matching (не keyword matching)
- Второй Закон (Служение Свободе): Освобождает Мастера от ручного поиска похожих работ
Архитектурное решение:
Query: "urban solitude photo"
↓ DPR Query Encoder (text)
↓
┌─────────────────────────────────┐
│ HNSW similarity search │
│ vs 50 reference works │
│ (DPR passage embeddings) │
└─────────────────────────────────┘
↓
Top-5 matches + CLIP visual check
↓
Style Guardian decision
Почему важно: DPR даёт semantic search, не keyword matching. «Urban solitude» находит работы с похожим настроением, даже если теги отличаются.
#29 Retrieval-Augmented Generation (RAG)
Авторы: Lewis et al. (Facebook AI, 2020) Ключевая идея: Комбинация retrieval + generation. Модель генерирует ответы, опираясь на retrieved knowledge.
Применение в Онатомии:
- Photo Analyst: RAG для генерации метаданных (retrieval из style_reference.mv2)
- ConsolidateAgent: RAG для генерации insights (retrieval из onatomia_memory.mv2)
- MetaAgent: RAG для анализа лакатосовского журнала
Связь со Стандартом:
- Первый Закон (Защита Внутреннего Языка): RAG предотвращает hallucination, сохраняя стиль через retrieved knowledge
- Второй Закон (Служение Свободе): Освобождает Мастера от ручного поиска контекста
Архитектурное решение:
RAG-Sequence (не RAG-Token):
1. Retrieve top-K passages из Memvid
2. Concatenate: [query] + [passage_1] + ... + [passage_K]
3. Generate answer with full context
Почему важно: RAG предотвращает hallucination. Модель не invents facts — она synthesizes из retrieved knowledge.
#30 Lost in the Middle
Авторы: Liu et al. (Stanford, 2023) Ключевая идея: LLMs хорошо помнят начало и конец контекста, но теряют середину (U-shaped curve).
Применение в Онатомии:
- Preserved Thinking: Priority queue (не FIFO) — критические блоки всегда в начале/конце
- ConsolidateAgent: Явная инжекция важных решений (не полагаться на середину контекста)
- MetaAgent: Структурирование лакатосовского журнала (важные опровержения в начале)
Связь со Стандартом:
- Первый Закон (Защита Внутреннего Языка): Priority queue защищает важные решения от потери
- Нулевой Закон (Сохранение Творца): Критические блоки всегда видимы для Мастера
Архитектурное решение:
❌ Naive approach (FIFO):
[block_1, block_2, block_3, block_4, block_5]
↑
Lost in the middle
✅ Priority queue:
[critical_block_1, block_2, block_3, critical_block_2]
↑ ↑
Always visible Always visible
Почему важно: Без этого fix важные решения теряются в середине контекста. Priority queue = архитектурная защита от position bias.
#20 Neural Turing Machines (NTM)
Авторы: Graves et al. (DeepMind, 2014) Ключевая идея: Differentiable external memory с content-based + location-based addressing.
Применение в Онатомии:
- Memvid fiber bundle: Реализация NTM-подобной памяти (single-file, append-only, differentiable retrieval)
- ConsolidateAgent: Content-based addressing (HNSW similarity) + location-based addressing (timeline index)
- QueryAgent: Differentiable read/write operations на Memvid
Связь со Стандартом:
- Первый Закон (Защита Внутреннего Языка): External memory сохраняет целостность стиля через timeline
- Третий Закон (Самосохранение): Differentiable memory защищает от потери данных
Архитектурное решение:
Memvid как NTM:
┌─────────────────────────────────┐
│ Content-based addressing │
│ (HNSW vectors, BM25 lex) │
├─────────────────────────────────┤
│ Location-based addressing │
│ (timeline index, version tags) │
├─────────────────────────────────┤
│ Differentiable read/write │
│ (append-only Smart Frames) │
└─────────────────────────────────┘
Почему важно: NTM показывает, что external memory должна быть differentiable (gradients flow through retrieval). Memvid реализует это через HNSW + timeline indexing.
#23 MDL Principle (Minimum Description Length)
Авторы: Rissanen (1978), Grünwald (2007) Ключевая идея: Лучшая модель = та, что максимально сжимает данные. Compression = understanding.
Применение в Онатомии:
- ConsolidateAgent: Compression ratio как метрика качества (целевой 16x)
- Style Guardian: Kolmogorov complexity как метрика стиля (работы с высоким стилем = низкая энтропия)
- Memory Guard: MDL-based pruning (удаление redundant записей)
Связь со Стандартом:
- Первый Закон (Защита Внутреннего Языка): Compression = understanding стиля (Hamming)
- Третий Закон (Самосохранение): MDL-based pruning защищает от memory bloat
Архитектурное решение:
MDL = Model Complexity + Data Complexity
ConsolidateAgent:
Input: 47 unconsolidated records (526 KB)
Output: 8 insights (33 KB)
Compression ratio: 16x ✅
MDL interpretation:
Model complexity: LLM prompt + consolidation logic
Data complexity: 8 insights vs 47 records
Total MDL: reduced ✅
Почему важно: MDL даёт математическую метрику для compression. Не «сжимаем ради сжатия», а «сжимаем = понимаем» (Hamming).
#25 Kolmogorov Complexity
Авторы: Kolmogorov (1965), Solomonoff (1964) Ключевая идея: K(x) = длина кратчайшей программы, генерирующей x. Randomness = incompressibility.
Применение в Онатомии:
- Style Guardian: Kolmogorov complexity как метрика стиля (работы с высоким стилем = низкая K(x))
- Metaphor Monitor: Отслеживание дрейфа метафор через compression ratio
- Quality assessment: High-quality content = compressible (low K(x))
Связь со Стандартом:
- Первый Закон (Защита Внутреннего Языка): Стиль = patterns = compressibility (низкая K(x))
- Нулевой Закон (Сохранение Творца): Высокая K(x) = некрофилия (Фромм), низкая K(x) = биофилия
Архитектурное решение:
Kolmogorov complexity approximation:
K(x) ≈ compressed_size(x) + decompressor_size
Style Guardian:
High-style work: K(x) low (compressible, patterns)
Low-style work: K(x) high (random, no patterns)
Example:
calm_power photo: K(x) = 12 KB (compressible)
generic photo: K(x) = 45 KB (incompressible)
Почему важно: Kolmogorov complexity даёт теоретическую основу для стиля. Стиль = patterns = compressibility.
#19 The Coffee Automaton
Авторы: Aaronson (2014) Ключевая идея: Irreversibility, entropy, arrow of time. Coffee mixing как модель irreversibility.
Применение в Онатомии:
- Memvid append-only: Irreversibility (Smart Frames immutable, нельзя unmix)
- ConsolidateAgent: Entropy reduction через compression
- Lakatos Journal: Arrow of time (ошибки → данные для роста, не failure)
Связь со Стандартом:
- Первый Закон (Защита Внутреннего Языка): Append-only memory защищает целостность стиля (нельзя unmix)
- Третий Закон (Самосохранение): Irreversibility защищает от corruption
Архитектурное решение:
Coffee automaton → Memvid:
Coffee mixing: irreversible (нельзя unmix)
Memvid Smart Frames: immutable (append-only)
Entropy:
Unconsolidated records: high entropy (526 KB)
Consolidated insights: low entropy (33 KB)
ConsolidateAgent: entropy reduction ✅
Почему важно: Coffee automaton показывает, что irreversibility — фундаментальное свойство памяти. Memvid append-only = архитектурная irreversibility.
#13 Attention Is All You Need (Transformers)
Авторы: Vaswani et al. (Google, 2017) Ключевая идея: Self-attention, multi-head attention, positional encoding. Foundation современных LLMs.
Применение в Онатомии:
- Qwen 7B: Transformer architecture (primary model)
- Bonsai 27B: Transformer architecture (future target)
- Style Guardian: Multi-head attention для style matching
Связь со Стандартом:
- Второй Закон (Служение Свободе): Transformers усиливают способность Мастера через Qwen 7B
- Третий Закон (Самосохранение): Tiered fallback (primary → fallback → emergency) защищает целостность
Архитектурное решение:
Transformer в Онатомии:
Qwen 7B: 32 layers, 32 heads, 4096 hidden
Bonsai 27B: 64 layers, 32 heads, 8192 hidden (ternary weights)
Style Guardian:
Multi-head attention для style matching
Head 1: visual features (CLIP)
Head 2: text features (DPR)
Head 3: emotional tags
Почему важно: Transformers — foundation всех LLMs в системе. Понимание attention = понимание того, как модели работают.
Полезные papers (контекст, не прямое применение)
#22 Scaling Laws
Авторы: Kaplan et al. (OpenAI, 2020) Ключевая идея: Performance predictably improves с scale (compute, data, parameters).
Применение: Понимание, почему Bonsai 27B (больше параметров) должен быть лучше Qwen 7B. Compute-optimal training: balance model size и training data.
Связь со Стандартом:
- Третий Закон (Самосохранение): Понимание scaling laws помогает выбрать правильную модель для M1 16GB
#27 Multi-Token Prediction
Авторы: Stern et al. (Google, 2018) Ключевая идея: Predict multiple future tokens simultaneously. 2-3x sample efficiency.
Применение: Speculative decoding для ускорения inference (future work).
Связь со Стандартом:
- Второй Закон (Служение Свободе): Ускорение inference освобождает время Мастера
#24 Machine Super Intelligence (AIXI)
Авторы: Legg & Hutter (2007) Ключевая идея: Universal AI, Solomonoff induction, AIXI как theoretically optimal agent.
Применение: Теоретический предел автономных агентов. Понимание, что Level 1 RSI (AIDE²) — не AGI, а incremental improvement.
Связь со Стандартом:
- Нулевой Закон (Сохранение Творца): Понимание, что MetaAgent — не AGI, а инструмент для Мастера
- Второй Закон (Служение Свободе): AIDE² усиливает свободу через incremental improvement
Сводная таблица
| # | Paper | Применение | Связь со Стандартом | Статус |
|---|---|---|---|---|
| 28 | Dense Passage Retrieval | Style Guardian, Photo Analyst, QueryAgent | Первый + Второй | ✅ Активно |
| 29 | RAG | Photo Analyst, ConsolidateAgent, MetaAgent | Первый + Второй | ✅ Активно |
| 30 | Lost in the Middle | Preserved Thinking priority queue | Первый + Нулевой | ✅ Активно |
| 20 | Neural Turing Machines | Memvid fiber bundle | Первый + Третий | ✅ Активно |
| 23 | MDL Principle | ConsolidateAgent compression (16x target) | Первый + Третий | ✅ Активно |
| 25 | Kolmogorov Complexity | Style Guardian (style = compressibility) | Первый + Нулевой | ✅ Активно |
| 19 | Coffee Automaton | Memvid append-only (irreversibility) | Первый + Третий | ✅ Активно |
| 13 | Attention Is All You Need | Transformers (Qwen, Bonsai) | Второй + Третий | ✅ Активно |
| 22 | Scaling Laws | Понимание model scaling | Третий | 📚 Контекст |
| 27 | Multi-Token Prediction | Speculative decoding (future) | Второй | 🔮 Future |
| 24 | Machine Super Intelligence | Теоретический предел RSI | Нулевой + Второй | 📚 Контекст |
Как читать эти papers
Для понимания архитектуры: Начни с #28 (DPR) и #29 (RAG) — они основа Style Guardian и Photo Analyst. Потом #30 (Lost in the Middle) — объясняет, почему Preserved Thinking использует priority queue.
Для понимания памяти: Читай #20 (NTM) и #19 (Coffee Automaton) — они объясняют, почему Memvid append-only и differentiable.
Для понимания стиля: Читай #23 (MDL) и #25 (Kolmogorov) — они дают математическую основу для стиля как compressibility.
Для понимания LLMs: Читай #13 (Transformers) — foundation всех моделей в системе.
Для понимания Стандарта: Обрати внимание, как каждый paper связан с Четырьмя Законами Стандарта Онатомии. Это не просто технические papers — это математический фундамент этической архитектуры.
Ресурсы для изучения
- Sutskever-30 Implementations: https://github.com/pageman/sutskever-30-implementations (все 30 papers реализованы в pure NumPy)
- The Annotated Transformer: https://nlp.seas.harvard.edu/annotated-transformer/
- Andrej Karpathy’s Blog: https://karpathy.ai/
- Stanford CS231n: https://cs231n.stanford.edu/
- MIT 6.S191: http://introtodeeplearning.com/
Эти 30 papers — не список для чтения. Это математический фундамент архитектуры Онатомии. Каждый paper материализован в конкретных компонентах системы и связан с Четырьмя Законами Стандарта. Когда Том принимает решение, он опирается на эти papers — не как на декорацию, а как на код. Aut bene, aut nihil.