Por dentro de la plataforma

Cómo un agente de IA aprende una habilidad nueva - y ordena después

Un agente que solo recuerda hechos vuelve a deducir el procedimiento desde cero cada vez. Los agentes de Olano lo dejan por escrito. Este artículo explica la ingeniería que hay detrás: cómo el trabajo recurrente se convierte en un procedimiento escrito y reutilizable, cómo un agente mejora una habilidad que no escribió él sin llegar a sobrescribirla nunca, cómo una copia aprendida sobrevive al día en que el original se actualiza por debajo - y por qué nada de esto puede degradar en silencio el sistema que debe mejorar.

La memoria dice qué es cierto. Las habilidades dicen cómo se hace el trabajo.

Casi todas las conversaciones sobre memoria en IA se quedan en los hechos, y los hechos merecen conservarse: tus precios, tus reglas de escalado, quién es la cuenta difícil. De todo ese conjunto trata Cómo recuerdan los agentes de IA. Es realmente útil, y aun así no es lo mismo que competencia.

La competencia es procedimental. El informe del lunes se monta en un orden concreto, desde fuentes concretas y con salvedades concretas. La consulta de reembolso se contrasta con tres cosas antes de que nadie responda. La revisión trimestral de proveedores saca siempre las mismas seis cifras. Un agente con hechos perfectos y sin procedimiento hará cada una de esas tareas un poco distinta cada vez, y esa variación es justo lo que nota tu equipo.

Por eso los agentes de Olano guardan un segundo tipo de artefacto junto a la memoria: la habilidad. Una habilidad es una carpeta pequeña que contiene un archivo SKILL.md - un nombre, una descripción de una línea, un disparador que indica cuándo recurrir a ella y pasos numerados. Algunas habilidades vienen con la plataforma. Otras llegan de un paquete de habilidades o de un marketplace. Otras las escribes tú. Y algunas las escribe el agente para sí mismo, a partir de trabajo que realmente ha hecho.

De esa última categoría trata este artículo.

De dónde sale una habilidad aprendida

Cada turno que da un agente se añade a una transcripción. Un proceso en segundo plano lee esas transcripciones con una cadencia - cada hora en el ajuste más activo, cada cuatro horas en el más relajado - y lee solo lo que aún no ha leído, controlado por un desplazamiento de bytes en cada transcripción. Nada se vuelve a analizar, y nada se omite porque un archivo haya crecido entre una pasada y otra.

A partir de ahí, la pasada es deliberadamente difícil de disparar:

  • Con menos de cuatro turnos nuevos no hace nada. Los desplazamientos se confirman igualmente, así que esos turnos no se acumulan para que una pasada posterior los sobreinterprete.
  • Se ejecuta en el nivel de razonamiento profundo, o no se ejecuta. No hay un modelo barato de repuesto. Cada agente tiene un tope diario de pasadas profundas - unas seis, doce o veinticuatro según el preajuste de cadencia - y cuando se agota el tope o el presupuesto de gasto, el ciclo se omite y se reintenta la próxima vez, dejando sus desplazamientos sin confirmar. Un análisis degradado es peor que ninguno: produce procedimientos seguros de sí mismos y equivocados.
  • Se aparta mientras se reescribe la memoria. La pasada de consolidación de memoria toma un bloqueo; el destilador lo ve y se retira en lugar de escribir en un archivo que se está reescribiendo entero.

Cuando sí se ejecuta, los hechos llegan primero a la memoria. Después, si el aprendizaje de habilidades está activado, esos mismos turnos pasan a una segunda pasada.

El explorador lee la biblioteca antes de leer la transcripción

Esta es la parte que evita que una biblioteca aprendida se convierta en un vertedero. Al explorador de habilidades no se le entrega una conversación y se le pregunta "¿qué has aprendido?". Se le entrega una conversación y además un inventario de todas las habilidades que el agente ya tiene - incluidas las gestionadas y las de terceros, que viven fuera de su propio espacio de trabajo y que sus herramientas de archivos no pueden ver por sí solas - y se le pregunta qué falta, si es que falta algo.

Cada candidata que devuelve lleva una acción, y dos de las tres acciones no producen ninguna habilidad nueva:

  • skip - la capacidad ya está cubierta. Es el resultado más habitual, y es un éxito.
  • update - una habilidad existente casi lo cubre y conviene afinarla. La candidata nombra el objetivo.
  • create - genuinamente nueva. Solo entonces se escribe una habilidad.

Una habilidad nueva pasa después por una segunda revisión que busca nombres casi duplicados, se detiene si encuentra uno y escribe un SKILL.md bien estructurado con el frontmatter correcto. Si esa revisión no puede completarse, el sistema escribe la candidata directamente en lugar de perderla.

Mejorar una habilidad que no escribió

Una mejora es el caso interesante, porque la implementación evidente es la equivocada.

Una habilidad que instalaste no es un documento único. Puede ser un manual de varios archivos: un SKILL.md más scripts, tablas de referencia, formularios, plantillas. Y su propiedad está aguas arriba: cuando se actualiza el paquete del que vino, esa carpeta se reemplaza entera. Así que un agente que "mejora" una habilidad así reescribiéndola en el sitio ha hecho dos cosas malas a la vez: ha exprimido un manual dentro de un resumen, y ha puesto su mejora justo en el camino de la siguiente actualización, que la borrará en silencio.

Olano bifurca en su lugar. La primera vez que un agente mejora una habilidad que no le pertenece:

  • La carpeta entera se copia a la biblioteca aprendida del agente, byte a byte, reescribiendo las referencias internas de rutas para que la copia funcione desde su nueva ubicación.
  • La copia reutiliza el nombre exacto del original, de modo que al cargar sus habilidades el agente ve la copia ensombreciendo al original en lugar de sustituirlo. El archivo original nunca se toca en disco.
  • Junto a ella se escribe un registro de procedencia: una huella por archivo del origen en el momento de la bifurcación, una huella por archivo de la copia en ese mismo momento, y la estructura de secciones del archivo SKILL.md original.
  • Se guarda aparte una instantánea intacta del estado inicial, que servirá más adelante como base de fusión.

Cada mejora posterior se aplica sobre la copia, de forma aditiva. De ahí salen dos propiedades que un diseño de reescritura en el sitio no puede tener: "¿esta mejora ha perdido algo?" se convierte en una pregunta comprobable contra una referencia registrada, en lugar de un diff difuso entre dos documentos sin relación, y "¿ha cambiado el original aguas arriba?" sigue siendo respondible para siempre.

La barrera de preservación

El fallo que todo el mundo teme en los sistemas que se modifican a sí mismos es la degradación gradual y silenciosa: cada pasada un poco más corta, un poco más sosa, hasta que lo que funcionaba es un párrafo de obviedades. Prometer que no pasará no es una respuesta de ingeniería.

Por eso cada copia aprendida se contrasta con su propio estado inicial registrado cada vez que se cargan las habilidades. No pasa si:

  • falta un archivo que existía en el momento de la bifurcación;
  • un archivo de texto ha encogido por debajo de la mitad de su tamaño original (los archivos de menos de medio kilobyte quedan exentos, porque los archivos pequeños cambian de tamaño mucho y con razón);
  • el archivo SKILL.md ha perdido más de un tercio de los encabezados de sección del original.

Una copia que no pasa queda en cuarentena: deja de ensombrecer y el original vuelve a servir. El agente pierde una mejora; no pierde una habilidad que funciona. Y la barrera se aplica deliberadamente solo a las copias escritas por máquina: una habilidad aprendida que escribió una persona a mano nunca se pone en cuarentena, porque una anulación deliberada debe seguir mandando aunque sea más corta.

Cuando el original cambia por debajo

Tarde o temprano la habilidad de origen se actualiza: una actualización del paquete, un cambio en el marketplace, una edición de tu equipo. Ahora hay dos linajes que se han movido, y el registro de procedencia permite una fusión a tres bandas de verdad en lugar de una conjetura. La resolución es por archivo, y primero determinista: solo se consulta a un modelo donde no existe una respuesta determinista.

El originalLa copia aprendidaQué ocurre
Sin cambiosLo que seaSe conserva la copia aprendida. Nada que hacer.
CambiadoIntactoSe toma la nueva versión de origen, se reescriben sus referencias internas de rutas y se vuelve a sellar la procedencia con la nueva huella del origen.
BorradoIntactoSe borra también de la copia aprendida. El origen lo quitó por algo y nada local lo contradice.
BorradoCambiadoSe conserva la copia aprendida y se adjunta una nota de conflicto. Alguien debería mirarlo; mientras tanto no se descarta nada.
CambiadoCambiado - textoFusión a tres bandas contra la base registrada. Una fusión limpia se aplica. Un conflicto real conserva la copia aprendida y pasa a la revisión de biblioteca para conciliarlo por sentido.
CambiadoCambiado - script o binarioSe conserva la copia aprendida y se marca. El código nunca se fusiona en automático: un script roto en silencio es peor que uno desactualizado.

Después, las huellas y la instantánea base se actualizan al estado fusionado. Eso es lo que hace converger el bucle: la misma desviación no se vuelve a señalar, y la barrera de preservación sigue trabajando contra la nueva referencia en lugar de una antiquísima. Una copia que ahora mismo no pasa la barrera queda fuera de la fusión por completo: volver a fusionar una copia degradada sería blanquearla.

Una pasada sobre toda la biblioteca

Validar habilidades de una en una no es lo mismo que mantener una biblioteca coherente. Por eso una pasada aparte, con su propio calendario, lee todas las habilidades del agente y trata la colección como unidad de trabajo: fusiona duplicados y casi duplicados en una versión de referencia con el mejor nombre, el disparador más claro y la unión de los pasos; borra las carpetas que ha fusionado; vuelve a fusionar cualquier copia cuyo original se haya desviado; y mejora lo que sobrevive.

El límite se impone, no se sugiere: los originales y las habilidades gestionadas son de solo lectura para esta pasada. Solo puede editar, fusionar y borrar dentro de la biblioteca aprendida. Antes de empezar hace una instantánea de cada archivo que podría tocar, y al terminar informa de lo que cambió con un único botón de deshacer.

El mismo trato para el propio espacio de trabajo

La configuración del propio agente también es prosa, y la prosa escrita a trozos durante meses se acumula igual: la misma instrucción formulada de tres maneras en tres sitios, una preferencia anotada en el archivo equivocado, una nota repetida en once registros diarios seguidos y, de vez en cuando, dos instrucciones que se contradicen en silencio.

De eso se encarga una pasada de consolidación del espacio de trabajo. Lee los archivos de identidad, comportamiento, instrucciones y memoria a largo plazo del agente, más sus registros diarios de las dos últimas semanas, y los reescribe en el sitio: fusiona duplicados reformulados, elimina contradicciones, agrupa lo relacionado bajo encabezados claros y mueve el contenido al archivo al que realmente pertenece. Los registros diarios reciben la deduplicación más agresiva, porque es donde la repetición se acumula más rápido.

La instrucción con la que trabaja cabe en una frase y carga con todo el peso: conserva la voz del agente y cada instrucción única; consolida, nunca borres. Igual que en la pasada de biblioteca, se hace una instantánea de cada archivo de destino antes de empezar, y el resultado se informa con un botón de deshacer.

Dos políticas, y la diferencia importa

No todo en este bucle se gobierna igual, y la separación es deliberada, no cómoda.

  • Cambiar lo que se le manda hacer a un agente es solo propuesta. The pass that reviews recent work and concludes an agent's instructions should be sharper does not edit those instructions. It writes grounded proposals into a review queue, and they wait - even with Fully Autonomous on, which otherwise lets new skills, memory and tidy-ups apply on their own. Nothing rewrites an agent's instructions because a background job thought it should, unless a deployment owner has explicitly lifted that hold for the agent.
  • El ordenado sin pérdidas se aplica, con instantánea y deshacer. Deduplicar memoria, fusionar dos habilidades aprendidas idénticas, consolidar una nota repetida: eso no cambia lo que hace el agente, solo lo ordenado que está por escrito. Exigir un clic humano para cada uno entrenaría a tu equipo a aprobar sin leer, que es el peor resultado posible para la cola que sí importa. Así que se aplican directamente, tras una instantánea, y cada ejecución informa de lo que cambió con deshacer incluido.

Todo esto se puede desactivar. Cada comportamiento - destilación, aprendizaje de habilidades, mantenimiento de la biblioteca, consolidación del espacio de trabajo, consolidación de la memoria - es un interruptor independiente, configurable para todo el despliegue y anulable por agente en cualquier dirección, de modo que "apagado en todas partes menos en este agente" es una configuración real. Por encima hay un interruptor maestro y una elección aparte entre ejecutarse según calendario o solo cuando alguien lo pide. Los preajustes de cadencia - relajado, equilibrado, agresivo - mueven a la vez los calendarios y los topes diarios de razonamiento profundo, y quedan por debajo de los mismos controles de gasto estrictos que rigen todo lo demás en el despliegue.

Cómo es un bucle completo

Los agentes hacen el trabajo real del díaSolo se analizan los turnos no leídos, en el nivel profundo o en ningunoLos hechos llegan a la memoria; el explorador revisa primero toda la bibliotecaLas habilidades nuevas se validan y se escriben; las mejoras se bifurcan, nunca se sobrescribenLa barrera de preservación pone en cuarentena lo que se haya degradadoLas actualizaciones de origen vuelven a entrar por fusión a tres bandasBiblioteca y espacio de trabajo consolidados, con instantánea y reversibles

El efecto acumulado es lento y concreto. El informe que tu agente de operaciones montó a mano tres semanas seguidas existe como procedimiento escrito a la cuarta. La habilidad de paquete que casi encajaba en tu sector lleva tu corrección y aun así absorbe la siguiente actualización del proveedor en vez de quedar aplastada por ella. El archivo de instrucciones que había crecido hasta cuatro páginas de indicaciones solapadas son dos páginas sin solapamientos, y cada frase que solo estaba en la versión que borraste sigue estando en la que conservaste.

Lo que esto no es

No se entrena, se afina ni se ajusta ningún peso de modelo. Todo este bucle opera una capa por encima del modelo, sobre artefactos escritos en lenguaje llano dentro de tu propio despliegue aislado: habilidades, entradas de memoria, propuestas de instrucciones. Son archivos. Tu equipo puede leerlos, editarlos a mano, aprobarlos, revertirlos y auditar quién cambió qué y cuándo.

No es una limitación que estemos sorteando. Es la razón de que el bucle sea algo que puedes gobernar en lugar de algo en lo que tienes que confiar - y por esa misma razón el modelo que hay debajo se puede cambiar sin que el agente pierda lo aprendido.

Lecturas relacionadas

El resto de la serie Por dentro de la plataforma, y los capítulos del manual que profundizan.

Preguntas frecuentes

¿Qué es una habilidad y en qué se diferencia de la memoria?

La memoria guarda lo que es cierto sobre tu negocio: precios, personas, decisiones, preferencias. Una habilidad guarda cómo se hace un trabajo: un procedimiento breve y escrito, con nombre, descripción, un disparador que dice cuándo recurrir a él y pasos numerados. La memoria evita que el agente te haga dos veces la misma pregunta. Las habilidades evitan que reinvente dos veces el mismo procedimiento, haciéndolo un poco distinto cada vez.

¿El agente reescribe las habilidades que le diste?

No. Las habilidades que vienen de ti, de un paquete de habilidades o de un marketplace son originales de solo lectura y nunca se editan ni se borran. Para mejorar una, el agente copia la carpeta entera a su biblioteca aprendida y edita la copia, que reutiliza el nombre del original y por eso tiene prioridad cuando el agente carga sus habilidades. El archivo original queda intacto en disco, y eso es lo que hace que una actualización posterior del origen se pueda fusionar en lugar de perderse.

¿Qué impide que una habilidad aprendida degenere en un resumen peor?

Una barrera de preservación que se ejecuta al cargar las habilidades. Cada copia aprendida se contrasta con su propio estado inicial registrado: si un archivo de texto ha encogido por debajo de la mitad de su tamaño original, si falta más de un tercio de los encabezados de sección originales, o si falta un archivo que existía al principio, la copia queda en cuarentena y vuelve a servir el original. Es una comprobación estructural, no una promesa - y las copias escritas a mano por una persona quedan exentas, porque las anulaciones deliberadas siguen mandando.

¿Qué pasa cuando la habilidad original se actualiza más adelante?

Una fusión a tres bandas, archivo por archivo, contra una instantánea del estado en el momento de la bifurcación. Los archivos que el origen cambió y la copia aprendida nunca tocó se toman del origen. Los archivos que cambió la copia aprendida y el origen no, se conservan. Donde cambiaron ambos, el texto se fusiona contra la base común, y un conflicto real pasa a la revisión de biblioteca. Los scripts y binarios nunca se fusionan en automático: la copia aprendida se conserva y se marca, porque un script roto en silencio es peor que uno desactualizado.

¿Se cambia algo sin preguntarme?

Depende de qué se esté cambiando, y la separación es deliberada. Todo lo que altera lo que se le manda hacer a un agente - sus instrucciones, su comportamiento - se escribe como propuesta en una cola de revisión y nunca se aplica por su cuenta. El ordenado sin pérdidas - deduplicar memoria, fusionar habilidades aprendidas duplicadas, consolidar notas repetidas - sí puede aplicarse directamente, pero solo tras una instantánea, y cada una de esas ejecuciones informa de lo que cambió con un botón de deshacer. Además puedes desactivar cada uno de estos comportamientos por separado, para todo el despliegue o para un único agente.

¿Esto reentrena un modelo de IA con mis datos?

No. No se entrena ni se afina ningún peso de modelo. Todo lo que produce este bucle es un archivo markdown corriente dentro de tu propio despliegue: una habilidad, una entrada de memoria, una propuesta de cambio de instrucciones. Tu equipo puede leerlos, compararlos, editarlos a mano, aprobarlos y revertirlos. Esa legibilidad es justo el punto: es lo que convierte un bucle de mejora en algo que puedes gobernar y no en algo en lo que tienes que confiar.

Despliega un sistema que deja por escrito lo que aprende

El efecto acumulado solo importa si el trabajo que hay debajo es real. Reserva una consulta: mapeamos el flujo de trabajo, lo presupuestamos y solo construimos cuando tú lo apruebas.

Hablemos de su proyecto