Персональная AI-операционная система: шесть месяцев практики в цифрах
Шесть месяцев строю персональную AI-операционную систему: файлы вместо промптов, пять failure modes, честные цифры METR и 30-дневный план для старта.
Андрей Марьясов, AI-консультант. Внедряю AI-агентов для бизнеса, а параллельно шесть месяцев живу в собственной AI-операционной системе — обычной Markdown-папке, которую читает агент. Этот текст — не «как я всё автоматизировал за вечер», а честный отчёт: что сработало, что нет и где я поймал себя на глупостях.
TL;DR (за 30 секунд)
- 90% результата — это encoded context, а не cleverness промпта. Накопленный контекст обо мне, моей работе и целях весит больше, чем любая формулировка запроса.
- Вся система — одна Markdown-папка. Никакого custom data layer: git-нативно, grep-debuggable, а переезд на новый инструмент — одним
cp -R. - Своим ощущениям доверять нельзя. METR 2026: разработчики оценили эффект AI в +24% скорости, а измерение показало −19%. Сорок три процентных пункта разницы.
- Стартовать можно за 30 дней, а не за полгода. Неделя логирования, неделя encoding, один закодированный judgment call — и измерение всего на цифрах.
Гист, который собрал 5 тысяч звёзд за неделю
В апреле Андрей Карпатый выложил на GitHub gist о своей ежедневной работе с AI. Пять тысяч звёзд за первую неделю, 16 миллионов просмотров в X. Его однострочное резюме: «Obsidian — это IDE; LLM — программист; wiki — кодовая база».
Я живу в такой штуке шесть месяцев. Персональная AI-операционная система — не метафора, а буквально папка с Markdown-файлами, где у агента есть полный контекст обо мне, моих проектах и моих целях. И я хочу не «вдохновить», а показать цифры: что работает, что нет, где я сам себе мешал.
Карпатый называет этот подход «files are the API». Никакого кастомного слоя данных, никакого хитрого runtime: файлы, которые одинаково видят и человек, и агент, — git-нативно и grep-debuggable. Если завтра выйдет Claude 5 или новый Cursor, я перееду одной командой cp -R.
Четыре калибровки, которые не делегируются
Главное, что я понял за эти полгода: AI-систему для команды не построишь, если сам в ней не пожил. Это не пафос — это четыре калибровки, которые формируются только на собственной шкуре.
Вкус. Из сотни драфтов выбрать не «красивый», а тот, который решает задачу.
Интуиция цены. Сколько задача реально стоит в токенах: где оправданно доплатить за frontier-модель, а где хватит Haiku.
Интуиция blast-radius. Где агента можно отпустить одного, а где надо следить за каждым шагом, потому что одна ошибка натворит бед.
Соотношение контекста и промпта. Самое болезненное из четырёх: 90% результата даёт encoded context обо мне, моей работе и моих целях, а не cleverness промпта. Это никому не делегируется и не видно ни на одном дашборде — набирается только через reps, повторения на реальной работе.
Из этого же убеждения выросла моя работа с клиентами в Grow2.ai: прежде чем нести подход в чью-то команду, я проживаю его сам.
Что у меня на диске
Вот моя система — без скриншотов, словами:
my2brain/
├── .claude/
│ ├── CLAUDE.md — operating manual для агента
│ ├── TELOS/ — миссия, цели, убеждения, стратегии
│ ├── MEMORY/State/ — активная задача, open loops
│ ├── skills/ — 60+ скилов
│ └── rules/, references/ — конвенции, которые читаются по триггеру
├── 00_Inbox/ — временный сбор
├── 01_Projects/ — активные проекты с дедлайном
├── 02_Areas/ — области ответственности
├── 03_Resources/ — справочники, концепции
├── Goals/ — каскадные цели
└── Daily Notes/ — ежедневные заметки
Это не Obsidian против Claude Code — это одна Markdown-папка, которую оба видят одинаково. Полный список инструментов вокруг неё, с ценами, я разбирал отдельно: мой AI-стек 2026.
Четыре файла делают всю тяжёлую работу.
CLAUDE.md — 40-60 строк о том, кто я и как организован workspace. Не маркетинг, а operating constraints. По сути — спецификация моей рабочей среды, записанная текстом: тот самый принцип, о котором я писал в «Софт теперь — это текст, а не код», только применённый к собственной работе.
TELOS: миссия + цели. Чтобы агент знал, какие задачи тянут к моим целям, а какие — просто срочные.
GTD-список с пятью секциями — Now, Next, Waiting, Someday, Done. Агент читает его перед планированием и дописывает после выполнения.
who-am-i + personal-voice. Без этих двух агент пишет generic. С ними — пишет так, как писал бы я. Этот текст, кстати, — 80% мой драфт и 20% правок агента. Не наоборот.
Что реально изменилось за шесть месяцев
Без обещаний «×10 продуктивности». Три вещи, которые я могу показать.
Я перестал повторяться. Коррекция, которую я дал агенту месяц назад, сегодня работает автоматически — через систему памяти (Graphiti + MemPalace). Это труднее всего объяснить словами: чувствуешь на третьей неделе, когда видишь, как агент избегает ошибки, о которой ты сам уже забыл, что говорил ему.
Контекст под рукой, а не в голове. Клиент спрашивает о чём-то, что мы обсуждали два месяца назад, — у меня есть verbatim того разговора плюс структурированные факты из графа. Без «кажется, мы тогда решили…».
Связи, которые я бы сознательно не построил. LightRAG показывает пересечения между заметками. Пишешь коммерческое предложение для нового клиента — и вдруг видишь заметку с вебинара 2024 года, которая точно ложится под этот кейс. В голове её уже нет. На диске — есть.
Пять failure modes, на которых я поймал себя
1. Править AI ниже собственного экспертного уровня — значит портить. Полевое исследование Dell’Acqua и Mollick с 758 консультантами BCG показало: нижняя часть output-распределения опускается до 8-го перцентиля, когда человек правит AI без экспертизы в теме. Я видел это на email-черновиках: первые месяцы переписывал всё подряд — и качество падало. Теперь email принимаю почти без правок, а в юридических документах переписываю каждую строку, потому что там точно знаю, чего хочу.
2. После третьего провала — не re-prompt, а добавить контекст. Ошибка почти всегда в missing context, не в модели. Третий провал — сигнал сделать шаг назад, а не пробовать ещё раз с чуть лучшей формулировкой.
3. Промпт, который растёт квартал за кварталом, — сигнал missing context. Вырос с 50 строк до 500 — переносите содержимое в context-файлы. Промпты должны укорачиваться, файлы — расти.
4. Стоимость дрейфует тихо. Один день $5, второй $15, через месяц $80. В моменте всегда «дёшево» — и это хуже всего. Жёсткий дневной лимит плюс weekly review — минимум, который спасает. У меня сейчас $15 в день, и за эту границу я себя не пускаю.
5. Marketplace-скилы выполняются с твоими правами доступа. Скил — это код, который запускается с твоими permissions, а не пассивная инструкция. В начале 2026-го появилось несколько публичных отчётов о популярных скилах, которые крадут ключи или тихо триггерят внешние запросы. Правило простое: читай код каждого скила перед install.
И самое болезненное открытие — не моё. METR-исследование 2026 года: опытные open-source разработчики с AI сами сообщили о +24% скорости, а измерение показало −19% — медленнее. Сорок три процентных пункта между «ощущается» и «есть». В первый месяц своему felt sense доверять нельзя. Нужно измерение.
30 дней вместо шести месяцев
Мне понадобилось полгода проб и ошибок. Стартовать можно быстрее — вот арка, которая реально работает, без лишних экспериментов.
| Неделя | Что делать | Зачем |
|---|---|---|
| 1 | Пропускать всё через агента | Не ради экономии времени, а ради лога: что реально экономит время, а что лишь ощущается продуктивным |
| 2 | Encode только то, что сделал дважды | Один раз — не стоит: скил сгниёт и будет мусорить |
| 3 | Закодировать одно повторяющееся решение (deal-scoring, скрининг собеседника, триаж support’а) как скил | Написание rubric’а выявляет, какие решения были последовательными, а какие — «что сегодня ощущалось правильным» |
| 4 | Мерить: время, качество, cost, debugging overhead | Убить всё, что выглядит хорошо по ощущениям, но проваливается на цифрах |
Три маркера 30-го дня, которые отличают компаундинг от плато: три-пять ежедневных workflow’ов на adequate quality; acceptance rate выше 70% — доля AI-output, которую принимаешь с минимальными правками; и один закодированный judgment call — первый артефакт, которым можно поделиться с командой.
И неожиданность: этот первый командный артефакт не выбираешь сознательно. Daily brief, который я сделал для себя, становится шаблоном командного стендапа. Style guide — стандартом коммуникации. Рубрика оценки сделки — командным due diligence. Не я выбираю, чем делиться, — команда сама вытягивает то, что масштабируется. Это я понял только на четвёртом месяце.
Шесть месяцев — мало, чтобы делать громкие заявления. Достаточно, чтобы появилась калибровка «это работает» / «это театр». Дальше буду разбирать конкретные файлы и скилы по одному — начну с GTD.md, потому что именно этот файл быстрее всего окупает вложенное в него время.
А пока — вопрос, который стоит больше, чем весь этот текст. Если AI действительно делает вас быстрее: как именно вы это измерили?
Письмо об AI — 2–3 письма в месяц
Личные эссе о том, как AI меняет мышление и работу: что я попробовал сам, что сработало, а что нет. В конце — ссылки на лучшее за последнее время.
Без спама. Отписаться можно в один клик.