Files
takana/scripts/store-gc.sh
T
SergioandClaude Opus 5 4fe6046200 store-gc: decía «espacio: superados ·» y «libres: Available → Available» — dos bugs que salen en takana
Corrido por primera vez en la caja (una máquina busybox, no GNU), el recolector funcionó —337
artefactos borrados y verificados, 26,8 G liberados— pero sus dos NÚMEROS salieron vacíos:

  ==> espacio: superados  · huérfanos
  ==> 337 artefactos borrados y VERIFICADOS (0 sobrevivientes) · libres: Available → Available

1. `du -sch --files0-from=-` es de GNU coreutils y busybox NO lo tiene ⇒ `espacio()` devolvía vacío.
   Un número que falta se lee como un número chico: sin él nadie puede decidir si vale la pena
   correrlo, que es justo para lo que está el dry-run. Ahora `xargs du -sk` + awk, que anda en los
   dos mundos.

2. `df -h /home` estaba CABLEADO, y el store casi nunca vive ahí: en gioser es un bind-mount del
   volumen y en una caja takana es `/store`, su propia partición. En la caja no hay `/home`, así que
   `tail -1` se quedó con la CABECERA y el resultado fue «Available → Available». Se mide `$STORE`.

Medido de verdad con `df` a mano: /store pasó de 84,7 G usados (91 %) a 57,9 G (62 %) — 26,8 G
liberados, 1657 → 1320 artefactos. Y el control que importa después de un gc: los 11 enlaces de
`/usr/bin` que apuntan DENTRO del store siguen resolviendo y los 21 entes siguen corriendo.

⚠ Vale anotar la advertencia que el propio gc imprime y que en esa caja no se puede satisfacer: «sin
.config legible ⇒ NO se protege ningún kernel por esta vía». El default (sólo superados) no toca lo
vigente, pero `--huerfanos` en una máquina que arranca de su store hay que pensarlo dos veces.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-17 15:19:22 +00:00

239 lines
14 KiB
Bash
Executable File
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
#!/usr/bin/env bash
# store-gc.sh — recolector de basura del store content-addressed. `takana gc` no existe; esto es.
#
# ── EL PROBLEMA QUE RESUELVE ────────────────────────────────────────────────────────────────────
# El store acumula un artefacto por cada SELLADO, no uno por receta. Cuando una dep cambia, el
# ArtifactHash de todo lo que cuelga de ella cambia, y el sellado nuevo se suma al viejo en vez de
# reemplazarlo. Medido el 2026-08-05: 1996 artefactos para 1130 recetas — 12 copias de
# `libqalculate`, 9 de `qt6-qtdeclarative`, 8 de `gtk4`. 51G de los 74G eran versiones anteriores.
#
# ── EL CRITERIO, Y POR QUÉ TIENE DOS ESCALONES ──────────────────────────────────────────────────
# El conjunto VIVO es `takana hash` sobre TODAS las recetas de TODAS las colas: es la respuesta a
# «¿cuál es el hash vigente de esta receta HOY?», que el store solo no puede dar. Lo que no está en
# ese conjunto es RANCIO — pero rancio se parte en dos cosas muy distintas:
#
# SUPERADO — su nombre de receta TIENE un artefacto vigente presente en el store. Es una versión
# anterior de algo que ya está sellado al día. Borrarlo no pierde nada: si hiciera
# falta, se reconstruye desde la receta, que está en git.
#
# HUÉRFANO — ningún artefacto con ese nombre es el hash vigente. O sea que el hash de HOY no está
# sellado y éste es el ÚNICO ejemplar que existe. Borrarlo sí pierde: es la diferencia
# entre «reconstruible en 2 minutos» y «hay que rehacer la torre». En la medición del
# 2026-08-05 eran 255 artefactos (17G) y casi todos KDE (`kio`×8, `kparts`×8,
# `kcmutils`×8) — o sea que las recetas KDE se movieron después del último sellado y el
# escritorio hidratado vive de artefactos que ya no son vigentes.
#
# Por eso el default borra SÓLO los superados. `--huerfanos` existe para cuando lo que se quiera sea
# exactamente eso, y hay que quererlo a propósito.
#
# ⚠ EL ESPACIO NO SIEMPRE SE LIBERA. Los rootfs hidratados (`work/*-rootfs`) son HARDLINKS al store.
# Borrar el directorio del store no rompe el rootfs —los datos siguen vivos por el otro enlace— pero
# tampoco libera el bloque hasta que el rootfs también se vaya. Es una propiedad, no un fallo.
#
# ⚠ NO BARRE `store-rust/` NI `store-kern/`: son stores aparte (frentes selfhost y kernel) con sus
# propias recetas. Sus `.hammer` son manifiestos de artefacto, no recetas de entrada.
#
# Uso: scripts/store-gc.sh [--aplicar] [--huerfanos]
# (sin --aplicar es un DRY-RUN: mide y no borra)
# Env: STORE (def ./store) HAMMER (def ./target/release/takana) JOBS (def 8)
set -uo pipefail
ROOT="$(cd "$(dirname "$0")/.." && pwd)"; cd "$ROOT"
STORE="${STORE:-./store}"; HAMMER="${TAKANA:-${HAMMER:-./target/release/takana}}"; JOBS="${JOBS:-8}"
APLICAR=0; HUERFANOS=0
for a in "$@"; do
case "$a" in
--aplicar) APLICAR=1 ;;
--huerfanos) HUERFANOS=1 ;;
*) echo "opción desconocida: $a" >&2; exit 2 ;;
esac
done
TMP=$(mktemp -d); trap 'rm -rf "$TMP"' EXIT
# ── 1. el conjunto VIVO ─────────────────────────────────────────────────────────────────────────
# Todas las colas, más las recetas puestas en escena en `tandas/`. Las de tandas suelen no resolver
# sus deps (la resolución es hermano→padre y viven fuera de `recipes/`) y su hash falla; se incluyen
# igual porque las que SÍ resuelven son vivas de pleno derecho y omitirlas las volvería rancias.
{ ls recipes/*.toml recipes/incoming-*/*.toml 2>/dev/null
find tandas -name '*.toml' 2>/dev/null | xargs grep -l '^\[source\]' 2>/dev/null
} | sort -u > "$TMP/recetas.txt"
echo "==> recetas barridas: $(wc -l < "$TMP/recetas.txt")"
xargs -P "$JOBS" -I{} sh -c "$HAMMER --store $STORE hash \"{}\" 2>/dev/null | tail -1" < "$TMP/recetas.txt" \
| grep '^b3:' | sed 's/^b3://' | sort -u > "$TMP/vivos.txt"
echo " hashes vigentes calculables: $(wc -l < "$TMP/vivos.txt")"
# Cuántas NO dieron hash. No es fatal (ver arriba) pero es el número que dice cuánta confianza tiene
# la clasificación: si sube mucho, algo se rompió en la resolución de deps y NO hay que borrar.
FALLOS=$(( $(wc -l < "$TMP/recetas.txt") - $(
xargs -P "$JOBS" -I{} sh -c "$HAMMER --store $STORE hash \"{}\" >/dev/null 2>&1 && echo ok" < "$TMP/recetas.txt" | wc -l) ))
echo " recetas cuyo hash FALLA: $FALLOS"
# ── 2. clasificar el store ──────────────────────────────────────────────────────────────────────
ls "$STORE" | grep -E '^[0-9a-f]{64}-' > "$TMP/dirs.txt"
python3 - "$TMP" <<'PY'
import sys, os
t = sys.argv[1]
vivos = set(open(f"{t}/vivos.txt").read().split())
dirs = [l.strip() for l in open(f"{t}/dirs.txt") if l.strip()]
part = lambda d: (d.split('-', 1)[0], d.split('-', 1)[1])
nombres_vivos = {n for h, n in map(part, dirs) if h in vivos}
sup, hue, viv = [], [], []
for d in dirs:
h, n = part(d)
(viv if h in vivos else (sup if n in nombres_vivos else hue)).append(d)
for f, xs in (("vigentes", viv), ("superados", sup), ("huerfanos", hue)):
open(f"{t}/{f}.txt", "w").write("".join(x + "\n" for x in xs))
print(f" artefactos: {len(dirs)} · vigentes {len(viv)} · superados {len(sup)} · huérfanos {len(hue)}")
PY
# ── 2 bis. RAÍZ EXTRA: el kernel EN EJECUCIÓN (ADR 0017 §4) ─────────────────────────────────────
# El conjunto vivo de arriba sale de `takana hash` sobre las recetas: es «el hash VIGENTE de hoy».
# El kernel que la máquina está CORRIENDO no tiene por qué ser ese. Si la receta se movió después
# del último sellado, el artefacto del kernel vivo queda clasificado SUPERADO y el default lo borra.
#
# Y se pierde en silencio: el sistema sigue andando perfecto —el kernel ya está en RAM— hasta el día
# que hace falta volver atrás, y ese día el artefacto al que volver no existe. Es el mismo patrón
# que ya costó caro en el CAS: lo que no es alcanzable desde una raíz desaparece sin avisar.
#
# Cómo se identifica hoy, que es lo que se puede: por el `.config`. El kernel vivo expone el suyo en
# /proc/config.gz (o /boot/config-$(uname -r)), y cada artefacto de kernel guarda el suyo en
# boot/config-*. Si coinciden BYTE A BYTE, ese artefacto es el kernel que corre — o uno idéntico, y
# proteger de más es el lado correcto para un GC.
# ⚠ Es una identificación por CONTENIDO DEL CONFIG, no por hash del artefacto: dos artefactos con el
# mismo .config y distinta toolchain se protegen los dos. Cuando el hash del artefacto viaje en el
# kernel vivo (ADR 0017 §3) esto se vuelve exacto y esta función se simplifica.
python3 - "$TMP" "$STORE" <<'PYK'
import sys, os, gzip, hashlib
tmp, store = sys.argv[1], sys.argv[2]
def config_vivo():
try:
with gzip.open("/proc/config.gz", "rb") as f: return f.read()
except Exception: pass
try:
with open("/boot/config-" + os.uname().release, "rb") as f: return f.read()
except Exception: return None
cfg = config_vivo()
if cfg is None:
print(" kernel vivo: sin .config legible (ni /proc/config.gz ni /boot/config-<uname -r>)")
print(" ⇒ NO se protege ningún kernel por esta vía. Si vas a borrar en una máquina")
print(" que arranca desde este store, comprobalo a mano antes de --aplicar.")
raise SystemExit(0)
vivo = hashlib.sha256(cfg).hexdigest()
protegidos = []
for d in sorted(os.listdir(store)):
b = os.path.join(store, d, "boot")
if not os.path.isdir(b): continue
for f in os.listdir(b):
if not f.startswith("config-"): continue
try:
with open(os.path.join(b, f), "rb") as fh: h = hashlib.sha256(fh.read()).hexdigest()
except OSError: continue
if h == vivo: protegidos.append(d); break
if not protegidos:
print(f" kernel vivo: .config sha256 {vivo[:12]} — NINGUN artefacto del store lo tiene")
print(" (normal en el hub: acá corre un kernel ajeno, no uno de takana)")
raise SystemExit(0)
# Sacar los protegidos de superados/huérfanos y contarlos como vigentes.
movidos = 0
for nombre in ("superados", "huerfanos"):
ruta = f"{tmp}/{nombre}.txt"
xs = [l.strip() for l in open(ruta) if l.strip()]
quedan = [x for x in xs if x not in protegidos]
movidos += len(xs) - len(quedan)
open(ruta, "w").write("".join(x + "\n" for x in quedan))
with open(f"{tmp}/vigentes.txt", "a") as f:
for d in protegidos: f.write(d + "\n")
print(f" kernel vivo: .config sha256 {vivo[:12]} ⇒ {len(protegidos)} artefacto(s) RAIZ: {', '.join(protegidos)}")
if movidos:
print(f" !! {movidos} de ellos estaban marcados para BORRAR y se rescataron (ADR 0017 §4)")
PYK
espacio() { # du sobre una lista de dirs, tolerante a lista vacía
# ⚠ `du --files0-from=-` es de GNU coreutils y **busybox no lo tiene** (medido en la caja takana
# el 2026-09-17): devolvía vacío, así que el gc anunciaba «espacio: superados · huérfanos » y
# nadie podía saber si valía la pena correrlo. Un número que falta se lee como un número chico.
# `xargs du -sk` anda en los dos mundos; el total lo suma awk, en KiB, y se imprime humano.
[ -s "$1" ] || { echo "0"; return; }
sed "s|^|$STORE/|" "$1" \
| xargs -d '\n' du -sk 2>/dev/null \
| awk '{t+=$1} END {
if (t=="") {print "?"; exit}
if (t>1048576) printf "%.1fG\n", t/1048576;
else if (t>1024) printf "%.0fM\n", t/1024;
else printf "%dK\n", t }'
}
echo "==> espacio: superados $(espacio "$TMP/superados.txt") · huérfanos $(espacio "$TMP/huerfanos.txt")"
# ── 3. borrar ───────────────────────────────────────────────────────────────────────────────────
OBJETIVO="$TMP/superados.txt"
if [ "$HUERFANOS" = 1 ]; then
cat "$TMP/superados.txt" "$TMP/huerfanos.txt" > "$TMP/objetivo.txt"; OBJETIVO="$TMP/objetivo.txt"
echo "!! --huerfanos: se borran TAMBIÉN los únicos ejemplares de su receta"
fi
if [ "$APLICAR" != 1 ]; then
echo "==> DRY-RUN: no se borró nada. Repetí con --aplicar."
exit 0
fi
MANIFIESTO="work/store-gc-$(date +%Y-%m-%dT%H%M%S).txt"
mkdir -p work; cp "$OBJETIVO" "$MANIFIESTO"
echo "==> manifiesto de lo borrado: $MANIFIESTO"
ANTES=$(df -h "$STORE" 2>/dev/null | tail -1 | awk "{print \$4}")
sed "s|^|$STORE/|" "$OBJETIVO" | xargs rm -rf
# ── GUARDIÁN: NO reportar «borrado» sin comprobarlo ─────────────────────────────────────────────
# 2026-08-07: este script informó «364 artefactos borrados · libres: 24G → 48G» y NO había borrado
# NINGUNO — los 364 del manifiesto seguían enteros en el store, y los 24G que se liberaron esa vez
# vinieron de otro lado. `xargs rm -rf` salió con 0 y el `echo` de abajo se lo creyó. (Se reprodujo:
# corriendo el script en SEGUNDO PLANO el borrado no se materializa; en primer plano sí. Da igual la
# causa: un `rm` que devuelve 0 no es prueba de que el fichero se fue.)
#
# Consecuencia real: la válvula de escape del disco estaba rota EN SILENCIO, y encima reportaba éxito,
# que es peor que fallar. El disco llegó al 98%.
#
# Por eso ahora se RECUENTA sobre el filesystem y el script sale distinto de cero si sobrevivió algo.
QUEDAN=0
while IFS= read -r l; do [ -e "$STORE/$l" ] && QUEDAN=$((QUEDAN+1)); done < "$OBJETIVO"
PEDIDOS=$(wc -l < "$OBJETIVO")
# ⚠ `df -h /home` estaba CABLEADO, y el store casi nunca vive ahí: en gioser es un bind-mount del
# volumen y en una caja takana es `/store`, su propia partición. O sea que el «libres: antes →
# después» medía un sistema de ficheros que el gc ni toca. Se mide el del STORE.
AHORA=$(df -h "$STORE" 2>/dev/null | tail -1 | awk '{print $4}')
if [ "$QUEDAN" -gt 0 ]; then
echo "!! BORRADO INCOMPLETO: $QUEDAN de $PEDIDOS artefactos SIGUEN en $STORE."
echo "!! No te fíes del espacio libre de abajo. Reintentá en PRIMER PLANO y volvé a verificar."
echo "==> libres: $ANTES$AHORA"
exit 1
fi
# ── REGISTRO ACUMULADO, para que lo podado NO VUELVA ───────────────────────────────────────────
# 2026-08-07: se podaron 362 artefactos (24 G) por la mañana y por la tarde volvieron a aparecer LOS
# MISMOS 362 — solapamiento del 100%. La causa no estaba acá sino en `farm/farm-sync.sh`, que bajaba
# el store del worker entero; el worker no se poda, así que nos devolvía lo borrado en cada cosecha.
# Podar → cosechar → vuelven. Este registro es la memoria que le faltaba al sistema: `farm-sync` lo
# usa como `--exclude-from`. Sin él, el gc es una rueda de hámster que informa éxito cada vez.
# ⚠ RUTA ABSOLUTA Y `touch` PREVIO. El 2026-08-21 esta línea murió con
# «work/store-gc-superados.txt: No such file or directory» DESPUÉS de haber borrado ya los 256
# artefactos — o sea que la poda ocurrió y su registro NO se escribió, que es la combinación exacta
# que reabre el bucle churn: `farm-sync` no tiene qué excluir y la cosecha los devuelve. El script
# hace `cd "$ROOT"` al arrancar, así que la ruta relativa DEBERÍA valer; que fallara igual es razón
# de sobra para no depender de ello en el paso que evita repetir el trabajo de una tanda entera.
LEDGER="$ROOT/work/store-gc-superados.txt"
mkdir -p "$ROOT/work" && touch "$LEDGER"
if cat "$OBJETIVO" "$LEDGER" 2>/dev/null | sort -u > "$LEDGER.tmp" && mv "$LEDGER.tmp" "$LEDGER"; then
echo "==> registro acumulado: $(wc -l < "$LEDGER") artefactos que NO deben volver ($LEDGER)"
else
# Ruidoso a propósito: sin ledger la poda es una rueda de hámster que informa éxito cada vez.
echo "!! NO pude escribir el registro $LEDGER — los $PEDIDOS borrados VOLVERÁN en la próxima" >&2
echo "!! cosecha. Reconstruilo con: sort -u $MANIFIESTO > $LEDGER" >&2
exit 1
fi
echo "==> $PEDIDOS artefactos borrados y VERIFICADOS (0 sobrevivientes) · libres: $ANTES$AHORA"