`aplicar.py` ejecuta un plan. La regla que lo define: **un paso que no se ejecutó no se marca como hecho**. Un plan tiene pasos ejecutables y pasos MANUALES cuyo `cmd` son comentarios («instalá el paquete», «cambiá el registro A»); un aplicador que ejecuta un bloque de comentarios obtiene exit 0 y lo marca «ok» — la peor mentira posible, porque deja el servicio caído con el informe en verde. Acá quedan `pendiente-humano`, la corrida sale con ≠0, y `--hecho N` los confirma — negándose si el paso sí tenía comandos («corrélo, no lo marques»). Se le cree a la VERIFICACIÓN, no al exit code: el rsync que llenó el disco devolvió 0 y dejó 1367 artefactos vacíos. Si el comando sale bien y la verificación falla, queda `sospechoso`. Y las verificaciones van TIPADAS (`cmd`/`humano`): «la columna Available debe ser > X» no es un comando. Estado reanudable en `<plan>.estado.json`, escrito con temporal + fsync + rename — la lección que costó un upgrade entero en el SDD 28. **Y un fallo propio, encontrado en la primera corrida real**: la verificación del paso de datos imprimía el número de directorios vacíos y devolvía 0 igual. Dio «✓ verificado: 2» donde ese 2 eran dos vacíos en destino. Un guardián que siempre pasa no es un guardián. Ahora COMPARA los ficheros de los dos lados y falla si difieren. Probado con rotura a propósito y con el control que debe pasar: copia no hecha ⇒ origen=5 destino=0 ⇒ FALLA; copia hecha ⇒ 5 y 5 ⇒ PASA. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01RomoxEGZUhaT4pob1QSX5x
13 KiB
SDD 29 — La mudanza: imagen portable, pasos exportables, y una app que censa, confirma y ejecuta
Escrito 2026-09-11, a pedido del usuario, corrigiendo el rumbo del SDD 28:
«quiero que estas máquinas sean un ejemplo. Tú dices "falta caddy", pero caddy es una instalación mía particular. Quiero que quede una imagen instalable siempre desde Hetzner o cualquier otro servicio, poder ejecutar una instalación paso a paso y que los pasos sean exportables para reproducirlos en cualquier lado; y que si estoy mudando, la app mudadora detecte qué servicios hay, qué contenido, confirme con el usuario qué se muda y qué se borra, y deje al servidor nuevo corriendo. Todo automático, sin IA.»
0. La corrección que ordena todo
El SDD 28 derivó hacia «poner ESTA caja a punto»: instalar caddy, copiar claves, montar discos. Eso es configurar un servidor, no construir un producto. caddy no es un hueco de la imagen: es una instalación particular del usuario, y el programa tiene que DESCUBRIRLA, no traerla.
La imagen lleva lo que hace a un sistema takana. Todo lo demás —qué servicios corren, qué dominios sirven, qué datos pesan— se censa en la máquina vieja, se confirma con el usuario, y se ejecuta.
Y hay una consecuencia de método que conviene decir fuerte: todo lo que hice a mano en el SDD 28 es la especificación de este programa. Censar, cruzar declaración contra realidad, separar vivo de fósil, confirmar, copiar, verificar. Cada paso fue determinista; ninguno necesitó juicio salvo «¿esto se muda o muere?», que es justamente lo que se le pregunta al usuario. No hace falta IA: hace falta que esté escrito.
1. Las tres etapas
CENSO PLAN APLICACIÓN
censar.py → <censo>.toml (decisiones) → ejecutar, idempotente
sólo lee revisable · exportable deja el server corriendo
El fichero del medio es el producto real: es «los pasos exportables». Se revisa, se versiona, se lleva a otro proveedor, se vuelve a correr. Un plan que se ejecutó es también el registro de lo que se hizo.
2. Etapa 1 — el censo (implementado: scripts/mudanza/censar.py)
La regla que lo ordena: cruzar lo DECLARADO contra lo VIVO, y reportar tres clases:
| clase | qué es | por qué importa |
|---|---|---|
vivo |
declarado y corriendo | candidato a mudarse |
declarado-muerto |
declarado, sin proceso | candidato a morir |
no-declarado |
corriendo, sin declaración | el trabajo real: nadie sabe cómo levantarlo |
No es teoría — cada regla salió de un error medido:
rc-statusdecíastoppedde caddy, gitea, sshd, cronie y act-runner, y los cinco estaban vivos. Un censo que lea el init y no/procproduce un plan que no arranca.- De 29 dominios del Caddyfile, sólo 10 están vivos: 13 no tienen DNS, 2 dan 502, y 4 ya
resuelven a otra máquina — su bloque de config es fósil aunque el sitio funcione. Por eso el
censo compara la IP del DNS contra las IPs de la máquina: sin eso,
ya-mudadose lee comovivo. - El caddy de la caja nueva murió en un reinicio y nadie lo notó, porque estaba arrancado a mano
y no declarado. Ésa es la clase
no-declarado, y es la que duele. du -shno dice cuánto ocupa COPIAR un árbol con hardlinks (medido: 60 G vs 85 G). El censo reporta los dos números.- Los nombres no coinciden entre init y proceso:
act-runner/act_runner,crond/cronie,dbus-daemon/dbus,fail2ban-server/fail2ban. Sin normalizar, el mismo servicio sale a la vez comono-declaradoydeclarado-muerto: las dos clases que más importan, las dos mal. - Lo descartado se cuenta, no se esconde. Un proceso con
ppid==1que no es un servicio suele ser un huérfano, y eso es un hallazgo (losfirefoxfugados que dejaron la granja sin compilar hora y media fueron exactamente eso).
⚠ Y el criterio que decide si el censo sirve: un guardián con hallazgos falsos se ignora entero.
La primera versión daba 28 no-declarado con ruido; tras normalizar nombres da 18, y son reales
(matilda, pacha, puerta-…, adb, ModemManager). Afinarlo no es cosmética: es la diferencia
entre que alguien lo lea o no.
3. Etapa 2 — el plan (implementado: scripts/mudanza/planear.py)
El censo emite cada entrada con decision = "". El plan es ese fichero con las decisiones puestas
(muda / muere), más el orden y las dependencias. Requisitos:
- Nada sin decidir se ejecuta. Una entrada vacía aborta: el silencio no es consentimiento.
- Lo que muere se dice por su nombre, con su tamaño, antes de borrar nada.
- El plan es exportable y re-ejecutable en otro proveedor. Es el artefacto que el usuario pidió.
- Un TUI para llenarlo, y también editable a mano — el fichero es la interfaz, el TUI es comodidad.
Lo implementado
planear.py --censo <f> --target <host> [--decide] --out plan.toml
- Aborta con código 2 si queda algo sin decidir, listando qué. Probado.
--deciderecorre lo pendiente y propone (vivo→muda,ya-mudado/backend-caido→muere,no-declarado→muda). La sugerencia se imprime, nunca se aplica sola.- Cada paso lleva su comando literal y su verificación, así que el plan se ejecuta a mano, línea por línea, sin la herramienta y sin este repo. Eso es «los pasos exportables».
- El preflight dimensiona con el tamaño de copia (hardlinks expandidos), no con
du; y si algún tamaño resultó ilegible lo dice en vez de contarlo como 0 — un 0 inventado apaga el chequeo justo cuando hace falta. - El paso «muere» no borra nada: lista con nombre y tamaño lo que se pierde al apagar el origen.
⚠ El dato que vuelve accionable a un no-declarado: su invocación
Decir «este servicio no está declarado» es nombrar el problema. Lo que hace falta para resolverlo es
cómo se está ejecutando ahora, y eso se lee de /proc. El censo captura cmdline y cwd de
cada servicio vivo, y el plan los emite en el paso:
# cmdline: /mnt/vvv/tawasuyu/target/debug/deps/puerta-f6e393ffbef3999e
# cwd : /mnt/vvv/tawasuyu/shared/tejido
# puertos: 34221, 44961
Ese servicio de gioser es un binario de target/debug/deps/ corriendo en producción, con dos
puertos, que ninguna declaración conoce. Una vez apagada la máquina vieja eso no se reconstruye de
memoria. Ahora está escrito.
⚠ Se lee cmdline y cwd, nunca environ: el entorno suele traer tokens y contraseñas, y un
censo que se guarda en un fichero y se comparte no puede llevarlos.
4. Etapa 3 — declarar y aplicar (declarar.py implementado)
4.0 declarar.py — de «corre y nadie sabe cómo» a una Semilla que arranca
Es el paso que cierra la mudanza: copiar un binario no lo levanta al arrancar. Toma la
invocación que el censo leyó de /proc y emite seed.card.json.
Por qué no alcanza con arje-absorb: absorb traduce sysvinit/runit/dinit/openrc a una Semilla y
está bien hecho, pero lee la declaración del init ajeno — justo la que miente. En gioser
rc-status daba stopped para cinco servicios vivos, y los no-declarado no aparecen en ninguna
declaración por definición. Absorber la declaración reproduce el agujero. Los dos se complementan:
absorb para lo declarado, esto para lo que corre.
Medido sobre gioser: 37 de 37 servicios vivos declarados, cero fallos. La tarjeta de caddy sale
con su invocación real (/usr/bin/caddy run --config /etc/caddy/Caddyfile --adapter caddyfile), que
es exactamente lo que faltaba para que no muriera en el próximo reinicio.
Tres reglas:
- Un servicio sin
cmdlinelegible NO se emite, y se dice por su nombre. Una tarjeta que no puede arrancar es peor que una ausente: la ausente falla ruidosamente al primer arranque, la rota arranca el sistema y deja el servicio caído sin que nada avise. - El
cwdse preserva envolviendo. El payloadNativede arje aceptaexec/argv/envpy nocwd(comprobado sobre la semilla real del producto). 9 de los 37 servicios de gioser dependen de su directorio; sin envolver arrancarían en/y fallarían de un modo difícil de atribuir. Se emitesh -c 'cd … && exec …', el idioma que la propia tarjeta desshdya usa. - IDs deterministas derivados del nombre ⇒ el mismo censo produce la misma semilla byte a
byte (verificado con
sha256), así que dos corridas se comparan condiff. Un fichero generado que cambia en cada corrida no se puede revisar.
⚠ envp va vacío a propósito: el censo no lee /proc/<pid>/environ porque trae tokens. Un
servicio que dependa de variables necesita que alguien las escriba, y se avisa.
⚠ Un bug que costó el 70 % del censo y vale como lección: cmdline y cwd se leían en un solo
comando, y como readlink /proc/<pid>/cwd exige permiso de ptrace, en cualquier proceso de root el
comando entero salía ≠0 y se descartaba también el cmdline, que sí se podía leer. 26 de 37
servicios quedaban sin invocación —el dato que da sentido al censo— y el fallo se leía como «no se
pudo». Una sonda que falla es un dato; no puede arrastrar a las que funcionaron.
4.1 El aplicador (implementado: scripts/mudanza/aplicar.py)
aplicar.py --plan plan.toml [--dry-run] [--only <clase>] [--paso N] [--hecho N]
La regla que lo define: un paso que no se ejecutó NO se marca como hecho. Un plan tiene pasos de dos naturalezas y confundirlas es la forma más fácil de dar una mudanza por buena sin estarlo:
- ejecutable — tiene comandos de verdad (copiar, comprobar espacio);
- manual — su
cmdson COMENTARIOS («instalá el paquete», «cambiá el registro A»). No hay nada que correr, y un aplicador que ejecuta un bloque de comentarios obtiene exit 0 y lo marca «ok». Ésa es la peor mentira posible: deja el servicio caído con el informe en verde.
Acá un paso manual queda pendiente-humano, la corrida no se considera completa (sale con ≠0), y
se confirma con --hecho N — que además se niega si el paso sí tenía comandos: «corrélo, no lo
marques».
Se le cree a la verificación, no al exit code. El rsync que llenó el disco devolvió 0 y
dejó 1367 artefactos vacíos. Un paso pasa a ok sólo si su verificación pasa; si el comando salió
bien y la verificación falló, queda sospechoso, que se informa como peor que un fallo.
Y las verificaciones están TIPADAS (cmd / humano): «la columna Available debe ser > X» no es
un comando, y darla por buena porque «no dio error» es exactamente cómo un aplicador miente.
Reanudable: el estado vive en <plan>.estado.json, escrito con temporal + fsync + rename —
la misma lección que costó un upgrade entero en el SDD 28 §6.13. Re-correr saltea lo ya hecho.
⚠ Y una verificación que era decorativa
La primera versión del paso de datos verificaba así:
ssh … 'du -sh <p>; find <p> -maxdepth 1 -type d -empty | wc -l'
Imprimía el número de vacíos y devolvía 0 igual. En la primera corrida real dio «✓ verificado: 2» — donde ese 2 eran dos directorios vacíos en destino. Un guardián que siempre pasa no es un guardián.
Ahora compara: cuenta los ficheros de los dos lados y falla si no coinciden. Probado con rotura a propósito y con el control que tiene que pasar:
copia NO hecha → ficheros: origen=5 destino=0 ⇒ FALLA
copia hecha → ficheros: origen=5 destino=5 ⇒ PASA
Ejecuta el plan contra la máquina nueva. Requisitos, todos pagados en el SDD 28:
- Idempotente y reanudable. Cada copia grande se cortó al menos una vez.
- Verifica en DESTINO, no en origen. «Lo copié» no prueba nada: el
rsyncque llenó el disco dejó 1367 artefactos vacíos y sólo se vio contando en el destino. - Los servicios
no-declaradose declaran, no se replican a mano. Es la salida natural haciaarje-absorb, que ya traduce sysvinit/runit/dinit/openrc a una Semilla — pero leyendo la declaración, que es justo la que miente: hay que alimentarlo con el censo. - Deja el servidor corriendo, y lo prueba desde afuera: cada dominio
vivodel plan tiene que contestar 200 contra la IP NUEVA antes de dar la mudanza por hecha.
5. La imagen, independiente del proveedor
Lo que hoy la ata a Hetzner es poco y está medido:
- Arranque: la imagen es GPT+BIOS. Hetzner Cloud arranca BIOS; otros proveedores piden UEFI. Los
dos caminos existen (
install-image.sh/install-image-efi.sh); falta una imagen que haga las dos (ESP + BIOS boot en el mismo disco) para no elegir por proveedor. - Red:
netuphace DHCPv4 y ya cubre el caso difícil (IP/32con la puerta fuera del prefijo, que es lo de Hetzner). Falta IPv6 estático y los metadatos de otros proveedores. - Instalación:
rescue → dd → rebootno es de Hetzner: sirve en cualquier entorno de rescate con SSH. Lo único propio es cómo se ENTRA a ese rescate, que es una línea por proveedor. - Disco: ya se resuelve solo — el store es la última partición y crece al disco entero en el primer arranque.
⇒ la imagen está más cerca de ser portable que la herramienta de mudarse. Por eso el orden es censo → plan → aplicación, y la portabilidad de la imagen va en paralelo.