awareness · experience-essay 06 de julio de 2026 8 min

Sistema operativo personal de IA: seis meses de práctica en cifras

Seis meses construyendo un sistema operativo personal de IA: archivos en lugar de prompts, cinco failure modes, las cifras honestas de METR y un plan de 30 días para arrancar.

sistema personal de IAClaude CodeObsidianproductividadgestión del conocimiento

Andrew Maryasov, consultor de IA. Implemento agentes de IA para empresas y, en paralelo, llevo seis meses viviendo en mi propio sistema operativo de IA: una carpeta común de Markdown que lee un agente. Este texto no es “cómo automaticé todo en una noche”, sino un informe honesto: qué funcionó, qué no y dónde me descubrí haciendo tonterías.

TL;DR (en 30 segundos)

El gist que juntó 5 mil estrellas en una semana

En abril, Andrej Karpathy publicó en GitHub un gist sobre su trabajo diario con IA. Cinco mil estrellas en la primera semana, 16 millones de vistas en X. Su resumen de una línea: “Obsidian es el IDE; el LLM es el programador; la wiki es la base de código”.

Yo llevo seis meses viviendo en algo así. Un sistema operativo personal de IA no es una metáfora: es literalmente una carpeta con archivos Markdown donde el agente tiene el contexto completo sobre mí, mis proyectos y mis metas. Y no quiero “inspirar”, quiero mostrar cifras: qué funciona, qué no y dónde me estorbé a mí mismo.

Karpathy llama a este enfoque “files are the API”. Sin capa de datos a medida, sin runtime ingenioso: archivos que la persona y el agente ven exactamente igual — git-nativo y depurable con grep. Si mañana sale Claude 5 o un Cursor nuevo, me mudo con un solo comando: cp -R.

Cuatro calibraciones que no se delegan

Lo principal que entendí en este medio año: no puedes construir un sistema de IA para un equipo si no viviste en uno tú mismo. No es una frase grandilocuente — son cuatro calibraciones que solo se forman en carne propia.

Gusto. De cien borradores, elegir no el “bonito”, sino el que resuelve la tarea.

Intuición de costo. Cuánto cuesta realmente una tarea en tokens: dónde se justifica pagar más por un modelo frontier y dónde alcanza con Haiku.

Intuición de blast radius. Dónde puedes soltar al agente solo y dónde tienes que mirar cada paso de cerca, porque un error puede hacer destrozos.

La proporción entre contexto y prompt. La más dolorosa de las cuatro: el 90% del resultado lo da el encoded context sobre mí, mi trabajo y mis metas, no la astucia del prompt. Esto no se delega a nadie y no se ve en ningún dashboard — se acumula solo con reps, repeticiones en trabajo real.

De esa misma convicción nació mi trabajo con clientes en Grow2.ai: antes de llevar un enfoque al equipo de alguien más, lo vivo yo primero.

Qué tengo en el disco

Este es mi sistema — sin capturas de pantalla, en palabras:

my2brain/
├── .claude/
│   ├── CLAUDE.md           — operating manual para el agente
│   ├── TELOS/              — misión, metas, creencias, estrategias
│   ├── MEMORY/State/       — tarea activa, open loops
│   ├── skills/             — 60+ skills
│   └── rules/, references/ — convenciones que se leen por trigger
├── 00_Inbox/               — captura temporal
├── 01_Projects/            — proyectos activos con deadline
├── 02_Areas/               — áreas de responsabilidad
├── 03_Resources/           — referencias, conceptos
├── Goals/                  — metas en cascada
└── Daily Notes/            — notas diarias

Esto no es Obsidian contra Claude Code: es una sola carpeta de Markdown que ambos ven igual. La lista completa de herramientas alrededor de ella, con precios, la desglosé aparte: mi stack de IA 2026.

Cuatro archivos hacen todo el trabajo pesado.

CLAUDE.md — 40-60 líneas sobre quién soy y cómo está organizado el workspace. No es marketing, son operating constraints. En esencia, una especificación de mi entorno de trabajo escrita en texto: el mismo principio del que escribí en “El software ahora es texto, no código”, solo que aplicado a mi propio trabajo.

TELOS: misión + metas. Para que el agente sepa qué tareas empujan hacia mis metas y cuáles solo son urgentes.

La lista GTD con cinco secciones — Now, Next, Waiting, Someday, Done. El agente la lee antes de planificar y la actualiza después de ejecutar.

who-am-i + personal-voice. Sin estos dos, el agente escribe genérico. Con ellos, escribe como escribiría yo. Este texto, por cierto, es 80% borrador mío y 20% correcciones del agente. No al revés.

Qué cambió de verdad en seis meses

Sin promesas de “productividad ×10”. Tres cosas que puedo mostrar.

Dejé de repetirme. Una corrección que le di al agente hace un mes hoy funciona en automático, gracias al sistema de memoria (Graphiti + MemPalace). Es lo más difícil de explicar con palabras: lo sientes en la tercera semana, cuando ves cómo el agente evita un error que tú ya olvidaste que le habías señalado.

El contexto está a mano, no en la cabeza. Un cliente pregunta por algo que discutimos hace dos meses — y tengo el verbatim de esa conversación más los hechos estructurados del grafo. Sin “me parece que habíamos decidido…”.

Conexiones que yo no habría construido a propósito. LightRAG muestra los cruces entre notas. Escribes una propuesta comercial para un cliente nuevo — y de pronto ves una nota de un webinar de 2024 que encaja exacto en ese caso. En la cabeza ya no está. En el disco, sí.

Cinco failure modes que descubrí en mí mismo

1. Corregir a la IA por debajo de tu propio nivel de expertise es arruinar el resultado. El estudio de campo de Dell’Acqua y Mollick con 758 consultores de BCG lo mostró: la parte baja de la distribución del output cae hasta el percentil 8 cuando una persona corrige a la IA sin expertise en el tema. Yo lo vi en mis borradores de email: los primeros meses reescribía todo — y la calidad caía. Ahora los emails los acepto casi sin cambios, pero en los documentos legales reescribo cada línea, porque ahí sé exactamente lo que quiero.

2. Después del tercer intento fallido: no hagas re-prompt, agrega contexto. El error casi siempre está en el missing context, no en el modelo. El tercer fallo es la señal para dar un paso atrás, no para intentar otra vez con una formulación un poco mejor.

3. Un prompt que crece trimestre tras trimestre es señal de missing context. Si pasó de 50 líneas a 500, mueve el contenido a archivos de contexto. Los prompts deben acortarse; los archivos, crecer.

4. El costo se desvía en silencio. Un día $5, otro $15, al mes $80. En el momento siempre parece “barato” — y eso es lo peor. Un límite diario estricto más una weekly review es el mínimo que te salva. Yo ahora tengo $15 al día, y no me dejo pasar de ese límite.

5. Las skills del marketplace se ejecutan con tus permisos de acceso. Una skill es código que corre con tus permissions, no una instrucción pasiva. A principios de 2026 aparecieron varios reportes públicos sobre skills populares que roban claves o disparan solicitudes externas en silencio. La regla es simple: lee el código de cada skill antes de instalarla.

Y el descubrimiento más doloroso no es mío. El estudio de METR de 2026: desarrolladores open source experimentados reportaron por su cuenta +24% de velocidad con IA, y la medición mostró −19% — más lentos. Cuarenta y tres puntos porcentuales entre lo que “se siente” y lo que “es”. El primer mes no puedes confiar en tu felt sense. Necesitas medir.

30 días en lugar de seis meses

A mí me tomó medio año de prueba y error. Se puede arrancar más rápido — esta es la ruta que de verdad funciona, sin experimentos de más.

SemanaQué hacerPara qué
1Pasar todo por el agenteNo para ahorrar tiempo, sino por el registro: qué ahorra tiempo de verdad y qué solo se siente productivo
2Codificar solo lo que hiciste dos vecesUna sola vez no vale la pena: la skill se pudre y estorba
3Codificar una decisión recurrente (deal scoring, screening de interlocutores, triaje de soporte) como skillEscribir la rúbrica revela qué decisiones eran consistentes y cuáles eran “lo que hoy se sintió correcto”
4Medir: tiempo, calidad, costo, debugging overheadMatar todo lo que se siente bien pero falla en los números

Tres marcadores del día 30 que separan el efecto compuesto de la meseta: de tres a cinco workflows diarios con calidad adecuada; un acceptance rate arriba del 70% — la parte del output de la IA que aceptas con correcciones mínimas; y un judgment call codificado — el primer artefacto que puedes compartir con un equipo.

Y la sorpresa: ese primer artefacto de equipo no lo eliges a propósito. El daily brief que hice para mí se convierte en la plantilla del standup del equipo. El style guide, en el estándar de comunicación. La rúbrica para evaluar un deal, en el due diligence del equipo. No soy yo quien elige qué compartir — el equipo mismo toma lo que escala. Eso lo entendí recién en el cuarto mes.

Seis meses es poco para hacer declaraciones grandilocuentes. Es suficiente para que aparezca la calibración de “esto funciona” / “esto es teatro”. Más adelante iré desglosando archivos y skills concretos, uno por uno — voy a empezar con GTD.md, porque es el archivo que más rápido paga el tiempo que inviertes en él.

Mientras tanto, una pregunta que vale más que todo este texto. Si la IA de verdad te hace más rápido: ¿cómo exactamente lo mediste?

A
Andrew Maryasov

Fundador de Auspex y Grow2.ai. 28 proyectos de IA en 14 sectores y 7 países, 8 sistemas de IA propios en producción.

Newsletter

Una carta sobre IA — 2–3 emails al mes

Ensayos personales sobre cómo la IA cambia nuestra forma de pensar y trabajar: qué probé yo mismo, qué funcionó y qué no. Al final, enlaces a lo mejor de lo que he leído.

Sin spam. Puedes darte de baja con un clic.

Discovery gratuito de 30 min →