Files
takana/scripts/servidor-image.sh
SergioandClaude Opus 5 fd09ca77b0 arjectl en la imagen: relanzar en caliente — y el genesis NO alcanzaba para eso
El servicio que falla y agota su backoff sólo se podía recuperar reiniciando la máquina entera.
Ya no. Y no hubo que escribir nada: **el cliente existía en tawasuyu y el crate se llama `arje-ctl`**
(el binario, `arjectl`). Buscarlo por `arjectl` no lo encontraba, y de ahí salió mi conclusión falsa
de que había que implementarlo — el protocolo ya traía ListEntes, SpawnCardFromDisk,
StopCardFromDisk, KillEnte y EnteStatus.

`recipes/arjectl.toml` lo construye del MISMO commit que `arje-zero` (98db584f), y no por comodidad:
el bus es un protocolo entre dos binarios y un cliente de otro árbol puede conectar sin entenderse
con el init. Publica sólo `arjectl`; el crate también produce un `systemctl` de camuflaje que acá no
se instala — en una distro sin systemd, ese nombre en el PATH invita a escribir runbooks con el
verbo ajeno.

⚠ EL HUECO QUE SÓLO SE VE USÁNDOLO: el genesis de la seed dice qué arranca AL BOOT, pero
`start`/`restart` usan `SpawnCardFromDisk`, que lee `/etc/arje/cards.d/<label>.json` — y el armado
no lo escribía:

    $ arjectl start gitea
    Error: arje-zero rechazó: card gitea: No such file or directory
           (buscada en /etc/arje/cards.d/gitea.json)

Son dos preguntas distintas —qué arranca solo, y qué se puede encarnar a pedido— y arje las responde
desde sitios distintos. `inyectar-cards.py` escribe ahora los dos árboles, y en `cards.d` escribe
TODAS las cards, no sólo las nuevas: `sshd` viene del product-rootfs y tampoco era relanzable.

Medido con la VM arrancada UNA sola vez: la imagen trae `cards.d/{gitea,sshd}.json` · `list-units`
da PID/CPU/MEM/HILOS/reinicios · poner el `app.ini` + `arjectl start gitea` ⇒ **GET / 200 sin
reiniciar** (uptime 6 min) · `arjectl restart gitea` cambia el PID (118 → 192) y sigue en 200.

⚠ Y un aviso que costó un HTTP intermitente: **`arjectl start` sobre un Ente YA VIVO lo DUPLICA** —
`SpawnCardFromDisk` no deduplica por label y arje le da un ULID nuevo. En gitea el síntoma fue
`unable to lock level db … resource temporarily unavailable` y un `[F]`: dos servidores peleando por
el mismo estado. Para relanzar se usa `restart`, o se mira `list-units` antes. Un `start` idempotente
es trabajo de arje, no de esta imagen.

⚠ Deuda anotada, no barrida: `arjectl` va en `perfil.servidor` porque este frente es el que lo pagó.
TODA imagen de takana corre arje-zero como PID 1 y ninguna se puede operar sin él ⇒ el argumento
para subirlo a `base` es fuerte, y es una línea. Se deja como decisión.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_016Tf9T4vGzsMoT7eS8YzMFn
2026-09-14 17:59:11 +00:00

146 lines
9.3 KiB
Bash
Executable File

#!/bin/sh
# servidor-image.sh — arma la imagen de disco del `perfil.servidor` lista para escribir en una caja
# Hetzner Cloud por rescue (SDD 28 §3). No inventa nada: encadena `hydrate-profile.py` +
# `install-image.sh`, que ya existían, y agrega lo que ninguno de los dos puede saber solo.
#
# ── LO QUE ESTE SCRIPT EXISTE PARA NO OLVIDAR (todo medido el 2026-09-10) ────────────────────────
#
# 1. EL KERNEL. `recipes/linux.toml` NO sirve para hcloud: apaga SCSI (`-d SCSI`) y el disco de una
# caja Hetzner lo maneja virtio-SCSI ⇒ arranca y no ve el disco. Va `linux-generic`, que sí trae
# `CONFIG_SCSI_VIRTIO=y` — dato que NO está en la receta (lo enciende `make defconfig`) y que sólo
# se ve en el `.config` que el artefacto publica.
#
# 2. EL INIT SE PISA. La clausura del perfil trae `busybox`, y su `/sbin/init -> ../bin/busybox` gana
# por hidratarse DESPUÉS del product-rootfs, borrando el `-> /usr/bin/arje-zero`. La imagen
# arrancaría perfecta con el init equivocado. Se restaura acá y además `install-image.sh` escribe
# su propio wrapper encima; el cmdline no lleva `init=` para que ese wrapper —que monta /store y
# /var/lib/hammer— sea el que corre.
#
# 3. EXDEV. El staging y la hidratación HARDLINKEAN, y un hardlink no cruza un montaje aunque sea el
# mismo disco. Con el store en un volumen (el layout normal de este repo) hay que trabajar del
# lado del store. Se comprueba y se aborta con un mensaje claro en vez de fallar fichero a fichero.
#
# 4. LA CLAVE. Sin `authorized_keys` la instalación remota deja una máquina viva e INALCANZABLE, que
# es peor que una que no arrancó. Es obligatoria: sin `AUTHKEYS` no se arma la imagen.
#
# Uso:
# AUTHKEYS=~/.ssh/github5.pub ./scripts/servidor-image.sh
#
# Env:
# AUTHKEYS pubkey a instalar para root (OBLIGATORIO)
# PERFIL perfil de targets.toml a hidratar (def servidor)
# STORE store desde el que hidratar (def /mnt/cosecha/store)
# WORKDIR dir de trabajo, MISMO montaje que STORE (def /mnt/cosecha/servidor-build)
# IMG imagen de salida (def $WORKDIR/servidor.img)
# KERNELPKG paquete del kernel (def linux-generic)
# ROOT_SIZE/STORE_SIZE/STATE_SIZE MiB de cada partición (def 6144/512/512)
set -eu
ROOT="$(cd "$(dirname "$0")/.." && pwd)"; cd "$ROOT"
PERFIL="${PERFIL:-servidor}"
STORE="${STORE:-/mnt/cosecha/store}"
WORKDIR="${WORKDIR:-/mnt/cosecha/servidor-build}"
IMG="${IMG:-$WORKDIR/servidor.img}"
KERNELPKG="${KERNELPKG:-linux-generic}"
ROOT_SIZE="${ROOT_SIZE:-6144}"; STORE_SIZE="${STORE_SIZE:-512}"; STATE_SIZE="${STATE_SIZE:-512}"
# El binario: en un hub de desarrollo está en `target/release`, en una caja instalada es
# `/usr/bin/takana` y `target/` ni existe. Es el bloqueo que ya costó una vez en la caja nueva
# («unhashable 875» con el lab bien): los scripts asumían árbol de desarrollo.
TAKANA="${TAKANA:-$ROOT/target/release/takana}"
[ -x "$TAKANA" ] || TAKANA="$(command -v takana || true)"
[ -n "$TAKANA" ] && [ -x "$TAKANA" ] || { echo "!! no encuentro el binario takana (probá TAKANA=/usr/bin/takana)" >&2; exit 2; }
[ -n "${AUTHKEYS:-}" ] || { echo "!! falta AUTHKEYS: una imagen sin clave deja la caja INALCANZABLE" >&2; exit 2; }
[ -r "$AUTHKEYS" ] || { echo "!! no puedo leer AUTHKEYS=$AUTHKEYS" >&2; exit 2; }
# ── guarda de EXDEV: el rootfs se arma con hardlinks contra el store ─────────────────────────────
mkdir -p "$WORKDIR"
m_store=$(findmnt -no TARGET -T "$STORE")
m_work=$(findmnt -no TARGET -T "$WORKDIR")
[ "$m_store" = "$m_work" ] || {
echo "!! STORE ($STORE → montaje $m_store) y WORKDIR ($WORKDIR → montaje $m_work) están en" >&2
echo " montajes DISTINTOS. El armado hardlinkea y un hardlink no cruza un montaje aunque sea" >&2
echo " el mismo disco. Poné WORKDIR bajo $m_store." >&2
exit 1
}
# ── 1. base: el product-rootfs sellado, que es quien trae /sbin/init -> arje-zero ────────────────
PDIR=$(ls -dt "$STORE"/*-product-rootfs 2>/dev/null | head -1)
[ -n "$PDIR" ] || { echo "!! no hay product-rootfs sellado en $STORE (corré 'takana bootstrap product')" >&2; exit 1; }
KDIR=$(ls -dt "$STORE"/*-"$KERNELPKG" 2>/dev/null | head -1)
[ -n "$KDIR" ] && [ -r "$KDIR/boot/bzImage" ] || { echo "!! no hay $KERNELPKG sellado con /boot/bzImage en $STORE" >&2; exit 1; }
RFS="$WORKDIR/rootfs"
echo "==> base : $(basename "$PDIR")"
echo "==> kernel : $(basename "$KDIR")"
rm -rf "$RFS"; mkdir -p "$RFS"
cp -al "$PDIR/." "$RFS/"
# ── 2. userland del perfil encima ────────────────────────────────────────────────────────────────
echo "==> hidratando perfil '$PERFIL'"
python3 scripts/hydrate-profile.py "$PERFIL" --into "$RFS" --store "$STORE" --keep
# ── 2 bis. las CUENTAS que los paquetes del perfil declaran (`[[user]]`, SDD 30) ─────────────────
# El `/etc/passwd` del product-rootfs trae `root` y `sshd` y nada más, porque es una constante de
# Rust. Un paquete cuyo demonio se niega a correr como root —`gitea` lo hace explícitamente— tiene
# su Card haciendo `setuidgid`, así que SIN esta línea el servicio arranca, muere y reintenta para
# siempre, y el log dice «unknown user», no «a la imagen le falta una cuenta».
#
# `--merge` fusiona por clave y es idempotente: componer dos veces no duplica. Si una cuenta ya está
# con OTRA línea, sale ≠0 sin tocar ningún fichero — y acá eso ABORTA la imagen a propósito: un
# rootfs con el uid equivocado produce ficheros de un dueño que no existe, y eso se descubre dentro
# de la VM, varios pasos más tarde.
USERPATHS=$(python3 scripts/targets.py --user-paths "$PERFIL")
if [ -n "$USERPATHS" ]; then
echo "==> cuentas : $(echo "$USERPATHS" | wc -l) receta(s) declaran usuarios"
# shellcheck disable=SC2086
"$TAKANA" --store "$STORE" users $USERPATHS --merge "$RFS"
else
echo "==> cuentas : ninguna receta del perfil declara [[user]]"
fi
# ── 2 ter. las CARDS de los servicios que el perfil arranca (SDD 30 §4c) ─────────────────────────
# Sin esto la imagen trae el binario, trae la cuenta… y NADIE lo arranca: la seed del producto sólo
# conoce las cards que `takana-bootstrap` hornea (`sshd`, `console-getty`, `hammerd`). Medido en la
# primera imagen de este perfil: `gitea` instalado, su usuario en `/etc/passwd`, y en el `genesis`
# NADA — un servidor que arranca perfecto sin el servicio por el que existe. La métrica no lo ve:
# `--services` dice que el perfil lo habilita, y lo habilita; lo que faltaba era el paso que lleva
# esa declaración a la imagen.
#
# `service-cards` es la ÚNICA traducción `[[service]]` → Card, y `inyectar-cards.py` sólo compone la
# seed (idempotente por label, y con `os.replace` porque la seed es un hardlink al store).
SVCPATHS=$(python3 scripts/targets.py --service-paths "$PERFIL")
if [ -n "$SVCPATHS" ]; then
# shellcheck disable=SC2086
"$TAKANA" --store "$STORE" service-cards $SVCPATHS > "$WORKDIR/cards.json"
echo "==> cards : $(python3 -c 'import json,sys; print(len(json.load(open(sys.argv[1]))))' "$WORKDIR/cards.json") card(s) de $(echo "$SVCPATHS" | wc -l) receta(s)"
python3 scripts/gnome/inyectar-cards.py "$RFS/ente/seed.card.json" "$WORKDIR/cards.json" "$RFS/etc/arje/cards.d"
else
echo "==> cards : el perfil no arranca ningún servicio de paquete"
fi
# ── 3. reparar el init que la hidratación pisó (ver cabecera, punto 2) ───────────────────────────
antes=$(readlink "$RFS/sbin/init" 2>/dev/null || echo "(fichero)")
ln -sf /usr/bin/arje-zero "$RFS/sbin/init"
echo "==> init : $antes$(readlink "$RFS/sbin/init")"
[ -x "$RFS/usr/bin/arje-zero" ] || { echo "!! el rootfs no tiene /usr/bin/arje-zero" >&2; exit 1; }
# ── 4. la clave ──────────────────────────────────────────────────────────────────────────────────
install -d -m 700 "$RFS/root/.ssh"
install -m 600 "$AUTHKEYS" "$RFS/root/.ssh/authorized_keys"
echo "==> clave : $(wc -l < "$RFS/root/.ssh/authorized_keys") línea(s) en /root/.ssh/authorized_keys"
# ── 5. la imagen. SIN `init=`: así corre el wrapper de install-image.sh, que monta /store y el diario
# El serial primero y tty0 al final ⇒ /dev/console es tty0, que es lo que muestra la consola web
# de Hetzner; los mensajes del kernel salen por los dos.
CMDLINE="console=ttyS0,115200 console=tty0 root=PARTLABEL=hammer-root rw"
echo "==> cmdline : $CMDLINE"
ROOTFS="$RFS" STAGE="$WORKDIR/.stage" KERNEL="$KDIR/boot/bzImage" IMG="$IMG" \
ROOT_SIZE="$ROOT_SIZE" STORE_SIZE="$STORE_SIZE" STATE_SIZE="$STATE_SIZE" CMDLINE="$CMDLINE" \
./scripts/install-image.sh
echo
echo "✓ imagen del perfil '$PERFIL': $IMG"
echo " escribir en una caja Hetzner (con la caja en RESCUE):"
echo " zstd -T2 -3 -c $IMG | ssh root@<ip> 'zstd -d -c | dd of=/dev/sda bs=4M conv=fsync && sync'"