Files
takana/scripts/farm/cosecha-cron.sh
T
sergioandClaude Opus 5 9388beba49 store en el volumen: «está sellado» dejó de ser «está en este disco»
El store de trabajo se mudó al volumen de la granja y el laptop quedó con
219 artefactos: los de fuente privada (que la granja no puede rehacer) más
lo que todavía no está respaldado. 979 artefactos verificados en el box se
borraron de acá, y con ellos el caché .dmerge de 92 G que sostenía sus
bloques: 128 G → 8,2 G, 115 G libres.

Eso rompía tres cosas que leían el disco local como si fuera la verdad:

- build-state.py habría reportado `never` sobre ~950 sellados y el latido
  lo habría COMMITEADO. Un grafo recién escrito miente con más autoridad
  que uno viejo. Ahora resuelve la presencia contra la unión del store y
  los manifiestos, y expone `sealed_remoto` para que «el store se mudó»
  no se lea nunca como «el corpus creció».
- farm-sync.sh armaba el manifiesto con `ls ./store`, así que le habría
  dicho al worker «el hub tiene 220» y el worker habría rehecho ~950. Es
  el bucle de churn que el propio fichero documenta, al revés. Ahora es la
  unión, con un guardián que aborta si el manifiesto encoge.
- cosecha-cron.sh bajaba el store entero cada 30 min: habría deshecho la
  mudanza sola, como la poda de 24 G que se deshacía en 2026-08-07. Ahora
  baja sólo la lista de nombres.

Los cuatro grafos regenerados dan idéntico a antes del recorte
(766/11/2), que es la prueba de que no se perdió nada.

Queda abierto: los artefactos nuevos viven SÓLO en el volumen hasta que
alguien corra una pasada de respaldo. El volumen tiene borrado protegido,
pero es una copia.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-09 21:22:36 -04:00

188 lines
12 KiB
Bash
Executable File
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
#!/usr/bin/env bash
# cosecha-cron.sh — el LATIDO de la granja: recoger + sembrar, en bucle, sin agente ni tokens.
#
# QUÉ HACE cada ciclo, por cada worker vivo en scripts/farm/.fleet:
# 1. SIEMBRA (sube): rsync de código + recetas laptop→worker (el laptop es canónico; si autoré
# recetas nuevas —p.ej. openrc— el worker las empieza a moler sin que yo intervenga).
# 2. RECOGE (baja): rsync del store sellado worker→laptop (CAS ⇒ merge seguro, sin conflicto).
# 3. Regenera el GRAFO DE ESTADO (build-state{,-kde,-gnome,-cosmic}.json) desde el store ya
# cosechado, y commitea SÓLO esos ficheros firmes. El `git log` de docs/state/ ES el avance
# que el humano ve y sigue (huecos, fallos, qué se selló entre dos ciclos).
#
# LO QUE **NO** HACE (a propósito): NO promueve incoming-kde→recipes/ canónico (esa es decisión de
# clasificación humana — "el hub clasifica", ver granja-promote-colisiones) ni firma el índice. Sólo
# captura al store del laptop y deja el veredicto para la mañana. Idempotente y re-corrible.
#
# INFINITO: vive en el crontab hasta que lo saques (`crontab -e`, borrar la línea cosecha-cron).
# Robusto a worker-ausente: si el dead-man ya mató al worker (cola seca ⇒ €0), el paso 1/2 falla
# suave, se loguea y igual regenera+commitea el estado local. NO relanza workers (eso gasta €;
# es decisión explícita con farm-up).
#
# Uso: scripts/farm/cosecha-cron.sh # un ciclo (lo que dispara el cron)
# */30 * * * * cd /home/sergio/hammer && scripts/farm/cosecha-cron.sh >>work/cosecha-cron.log 2>&1
# Env: SSH_KEY (def ~/.ssh/github5), REMOTE (def /opt/hammer), NO_COMMIT=1 (regenera pero no commitea)
set -uo pipefail
ROOT="$(cd "$(dirname "$0")/../.." && pwd)"
cd "$ROOT"
# LOCK (2026-07-22): el latido ya no viene sólo del crontab — `latido.sh` lo lanza desde la sesión
# porque el laptop arranca a veces con arje-zero y a veces con OpenRC, y cronie sólo existe en uno
# de los dos. Con dos disparadores posibles, dos ciclos pueden solaparse: ambos hacen rsync sobre el
# mismo store y, peor, `git commit`+`push` a la vez (index.lock, o un push que pisa al otro). El lock
# va ACÁ y no en el llamador para que valga venga de donde venga: cron, latido o a mano.
# -n = no esperar: si ya hay un ciclo corriendo, este sobra (el próximo tick recoge lo mismo).
LOCKFILE="${LOCKFILE:-$ROOT/work/.cosecha-cron.lock}"
mkdir -p "$(dirname "$LOCKFILE")"
exec 9>"$LOCKFILE"
if ! flock -n 9; then
echo "── $(date -u +%FT%TZ) cosecha-cron: ya hay un ciclo en curso ⇒ salgo (no me solapo)"
exit 0
fi
SSH_KEY="${SSH_KEY:-$HOME/.ssh/github5}"
REMOTE="${REMOTE:-/opt/hammer}"
FLEET="$ROOT/scripts/farm/.fleet"
HAMMER="${HAMMER:-$ROOT/target/release/hammer}"
# Workers efímeros reciclan IPs ⇒ no fijar known_hosts (hub-and-spoke, worker sin secretos).
SSH="ssh -i $SSH_KEY -o UserKnownHostsFile=/dev/null -o StrictHostKeyChecking=no -o BatchMode=yes -o LogLevel=ERROR -o ConnectTimeout=15"
ts() { date -u +%FT%TZ; }
echo "── $(ts) cosecha-cron arranca"
if [ ! -s "$FLEET" ]; then
echo " flota vacía (scripts/farm/.fleet) — nada que cosechar este ciclo"
else
while read -r name ip; do
[ -n "${name:-}" ] || continue
echo "==> $name ($ip)"
# 1. SIEMBRA: código + recetas laptop→worker (--delete: el laptop manda; nunca toca work/store/target).
if rsync -az --delete -e "$SSH" \
--exclude /work --exclude /store --exclude '/store-*' --exclude /target \
--exclude /dist --exclude /.dev-fs --exclude /.git --exclude /.scratch \
--exclude '*.png' --exclude '/content*' \
./ "root@$ip:$REMOTE/" 2>&1 | tail -2; then
echo " siembra ✓"
else
echo " ⚠ siembra falló (worker ausente/idle-muerto?) — sigo con el siguiente"
continue
fi
# 2. RECOGE: store sellado worker→laptop (CAS, merge seguro).
# ── ⚠ EXCLUIR LO YA PODADO, O LA POda SE DESHACE SOLA ─────────────────────────────────────
# El worker NO se poda nunca, así que conserva los artefactos superados y este rsync los
# devolvía enteros. Con el latido cada 30 min, una poda de 24 G quedaba deshecha en menos de
# una hora: medido el 2026-08-07, tres podas seguidas borraron LOS MISMOS 362 artefactos.
#
# El mismo arreglo está en `farm-sync.sh` — y ahí estuvo el error de método: lo puse allí, di el
# bucle por cerrado, y la churn siguió porque **hay DOS rutas que bajan el store** y el latido
# usa ésta. Arreglar una de dos copias y declarar victoria es peor que no arreglar: el síntoma
# se atenúa lo justo para dejar de mirar. Si aparece una tercera copia, va con el mismo exclude.
#
# ── 2026-08-09: EL STORE YA NO BAJA. BAJA EL MANIFIESTO ───────────────────────────────────
# El store se mudó al VOLUMEN de la granja y el laptop se quedó con lo que la granja no puede
# rehacer. Seguir bajando el store acá desharía esa mudanza cada 30 minutos — la misma forma
# exacta del bucle de churn que este bloque documenta arriba, y la razón por la que el exclude
# de abajo dejó de alcanzar: ya no se trata de filtrar QUÉ baja, sino de que no baja.
#
# Lo que el hub sí necesita es SABER qué hay sellado, para que el grafo de estado no reporte
# `never` sobre artefactos que existen. Eso son kilobytes: la lista de nombres. Se acumula en
# el manifiesto (nunca se pisa) porque el volumen es una sola foto y el hub recuerda todas.
if $SSH "root@$ip" "ls $REMOTE/store 2>/dev/null | grep -E '^[0-9a-f]{64}-'" \
> "$ROOT/work/.sellados-worker" 2>/dev/null && [ -s "$ROOT/work/.sellados-worker" ]; then
N_W=$(wc -l < "$ROOT/work/.sellados-worker")
cat "$ROOT/work/farm-sellados.txt" "$ROOT/work/.sellados-worker" 2>/dev/null \
| grep -E '^[0-9a-f]{64}-' | sort -u > "$ROOT/work/farm-sellados.txt.new"
mv "$ROOT/work/farm-sellados.txt.new" "$ROOT/work/farm-sellados.txt"
rm -f "$ROOT/work/.sellados-worker"
echo " manifiesto ✓ (worker: $N_W · total: $(wc -l < "$ROOT/work/farm-sellados.txt"))"
else
echo " ⚠ no pude leer el manifiesto del worker — sigo"
fi
# ⚠ Lo que NO cubre esto: los artefactos nuevos quedan SÓLO en el volumen hasta que alguien
# haga una pasada de respaldo. El volumen tiene borrado protegido, pero es UNA copia.
done < "$FLEET"
fi
# 2.5 REAPER HUB-SIDE (2026-07-23). El dead-man DEL WORKER probó FRÁGIL: un worker quedó 3.5h idle
# quemando € porque su `/etc/hammer-deadman.env` no tenía token válido ⇒ el dead-man llegaba a
# matarse pero salía 1 "sin HCLOUD_TOKEN" cada tick. La garantía "un vps idle es inadmisible" NO
# puede depender de que cada worker se auto-provisione bien un token (falla en silencio). El HUB sí
# tiene un token que funciona, y este latido corre cada 30 min aunque no haya sesión (setsid) ⇒ el
# hub es la AUTORIDAD de vida del worker. Es defensa en profundidad: el dead-man del worker cubre
# "hub caído"; esto cubre "dead-man del worker roto". Un worker sin trabajo activo REAPER_MAX ciclos
# seguidos se BORRA desde acá, con el MISMO blindaje que el dead-man (label role=hammer-worker;
# gioser no tiene label ⇒ jamás pasa, ni por accidente).
REAPER_MAX="${REAPER_MAX:-2}" # 2 ciclos × 30 min ≈ 1 h idle, igual que el dead-man del worker
if [ -s "$FLEET" ] && command -v hcloud >/dev/null 2>&1; then
mkdir -p "$ROOT/work/.reaper"; sobreviven=""
while read -r name ip; do
[ -n "${name:-}" ] || continue
# LISTA NEGRA (capa 1 de 2, igual que el dead-man): gioser JAMÁS se toca, pase lo que pase.
# Segunda capa = el chequeo de label abajo. gioser no tiene label Y no matchea worker de la
# granja ⇒ imposible que muera por acá. "Ahí está nuestra vida" (2026-07-23).
case "$name" in *gioser*) echo "==> reaper: $name en LISTA NEGRA ⇒ intocable"; sobreviven="${sobreviven}${name} ${ip}
"; continue;; esac
strike_f="$ROOT/work/.reaper/$name"
# ¿el server siquiera existe? Si ya no está en hcloud (borrado a mano o por un ciclo previo),
# NO cuesta € y no debe quedar en .fleet para siempre. Se dropea (no entra a `sobreviven`).
if ! hcloud server describe "$name" -o format='{{.Name}}' >/dev/null 2>&1; then
echo "==> reaper: $name ya no existe en hcloud ⇒ lo saco de .fleet"; rm -f "$strike_f"; continue
fi
if $SSH root@"$ip" 'pgrep -f "hammer build|campana-deuda|farm-worker-loop" >/dev/null 2>&1'; then
echo 0 > "$strike_f"; sobreviven="${sobreviven}${name} ${ip}
"; continue
fi
strikes=$(( $(cat "$strike_f" 2>/dev/null || echo 0) + 1 )); echo "$strikes" > "$strike_f"
echo "==> reaper: $name SIN trabajo activo — strike $strikes/$REAPER_MAX"
if [ "$strikes" -lt "$REAPER_MAX" ]; then sobreviven="${sobreviven}${name} ${ip}
"; continue; fi
# BLINDAJE (igual que el dead-man): sólo se borra un server con label role=hammer-worker.
if hcloud server describe "$name" -o format='{{.Labels}}' 2>/dev/null | grep -q hammer-worker; then
echo " ☠ IDLE $strikes ciclos ⇒ el HUB borra $name (label verificado; gioser protegido)"
if hcloud server delete "$name" >/dev/null 2>&1; then rm -f "$strike_f"
else echo " ⚠ delete falló — sobrevive, reintenta próximo ciclo"; sobreviven="${sobreviven}${name} ${ip}
"; fi
else
echo " ⛔ $name SIN label hammer-worker ⇒ NO se borra (protegido)"; sobreviven="${sobreviven}${name} ${ip}
"
fi
done < "$FLEET"
printf '%s' "$sobreviven" | grep -v '^[[:space:]]*$' > "$FLEET.tmp" 2>/dev/null; mv "$FLEET.tmp" "$FLEET" 2>/dev/null || true
fi
# 3. Regenerar el grafo de estado desde el store ya cosechado (usa el hammer del laptop, que tiene
# el subcomando `hash`). Barato (~14s cada uno). El corpus canónico y el frente KDE, por separado.
echo "==> regenerando grafo de estado"
if [ -x "$HAMMER" ]; then
scripts/build-state.py >/dev/null 2>&1 && echo " build-state.json ✓" || echo " ⚠ build-state.py falló"
scripts/build-state.py --kde >/dev/null 2>&1 && echo " build-state-kde.json ✓" || echo " ⚠ build-state.py --kde falló"
# GNOME faltaba acá (2026-07-27): el latido regeneraba base+KDE y NUNCA el grafo GNOME, así que
# build-state-gnome.json envejecía en silencio y reportaba `never` sobre recetas selladas hacía
# días (gobject-introspection, toda la onda 2). Un grafo viejo miente con la misma cara que uno
# fresco — por eso lo regenera el latido y no la mano.
scripts/build-state.py --gnome >/dev/null 2>&1 && echo " build-state-gnome.json ✓" || echo " ⚠ build-state.py --gnome falló"
# COSMIC (2026-08-03), por la MISMA razón por la que se agregó GNOME arriba: un frente que no
# regenera el latido envejece en silencio, y un grafo viejo miente con la misma cara que uno fresco.
scripts/build-state.py --cosmic >/dev/null 2>&1 && echo " build-state-cosmic.json ✓" || echo " ⚠ build-state.py --cosmic falló"
# Cola DERIVADA del grafo (P4): el orden de masticado por imagen, en ondas topológicas. No lanza
# ningún build — sólo deja escrito qué conviene moler primero, para que la cola deje de ser una
# lista escrita a mano. Barato (lee JSON, no hashea).
scripts/drenar.py --todos >/dev/null 2>&1 && echo " drenaje.json ✓" || echo " ⚠ drenar.py falló"
else
echo " ⚠ sin binario hammer en $HAMMER — no regenero estado"
fi
# 4. Commitear SÓLO el estado firme (el avance que el humano sigue). Recetas nuevas que YO autoré se
# commitean aparte, a mano, para no meter autoría a medias en un commit de cron.
if [ "${NO_COMMIT:-}" != "1" ]; then
git add docs/state/build-state.json docs/state/build-state-kde.json docs/state/build-state-gnome.json docs/state/build-state-cosmic.json docs/state/drenaje.json 2>/dev/null || true
if ! git diff --cached --quiet 2>/dev/null; then
git commit -q -m "estado: cosecha granja $(ts) — avance del árbol KDE" 2>/dev/null \
&& { git push -q origin main 2>/dev/null && echo "==> estado commiteado+pusheado" \
|| echo "==> estado commiteado (push falló, reintenta próximo ciclo)"; }
else
echo "==> sin cambios de estado este ciclo"
fi
fi
echo "── $(ts) cosecha-cron fin"