Files
takana/scripts/busybox-censo-proveedores.py
SergioandClaude Opus 5 466972e301 busybox: 79 → 69 applets sin otro dueño, y ninguno de los diez costó escribir userland
Cuatro artefactos sellados y el paso 2 del plan cerrado. Los diez applets que
dejan de depender de busybox salieron de arreglar recetas, no de escribir código:

  xz unxz xzcat lzma unlzma lzcat  → recipes/xz-tools.toml (nueva, b3:194c7d69…)
  vi                               → un symlink en recipes/vim.toml
  cpio                             → un symlink en recipes/libarchive.toml
  arch hostname                    → los trajo el feature de uutils (b3:614ff653…)

xz-tools es el TERCER caso de la familia de zstd-cli, y eso ya estaba escrito en
targets.toml: «la receta canónica construye sólo lib/ y su artefacto no tiene
usr/bin; declararla no habría arreglado nada». Igual que musl-shared, zlib-shared
y libffi-shared. Cuatro veces la misma forma — la receta publica la lib, la
imagen declara el paquete, y el binario no está. Va como variante porque ampliar
la canónica re-hashearía a sus 14 consumidores.

⚠ xz-tools selló DINÁMICO en la primera corrida pese al link = "static", y
funcionaba: comprimía y descomprimía sin una queja. Es el relink de libtool, que
libarchive.toml y bluez.toml ya documentan — hace falta LDFLAGS=-all-static en
compile Y en install. Lo delató el `file` del binario, no una prueba que fallara.

Paso 2 del plan: uutils, findutils, findutils-xargs, diffutils, gzip, grep y
xz-tools declarados en el perfil `base` — seis recetas que llevaban meses
`sealed` con `perfiles: []`. Hasta hoy, `find`, `xargs`, `diff`, `cmp`, `gzip`,
`zcat` y `grep` en una imagen de takana eran el applet de busybox, no porque
faltara escribirlos sino porque nadie los declaró. `grep` entra como PUENTE
declarado: ripgrep ya viaja pero publica `rg` y no es grep POSIX.

El censo gana modo --guardian, y vigila PÉRDIDAS, no un umbral: un umbral hay
que subirlo cada vez que se retira un applet y a la tercera nadie lo sube con
criterio; que un applet con proveedor medido deje de tenerlo es siempre una
regresión. Probado en los dos sentidos — rc=0 contra /store, rc=1 contra un store
mutilado, nombrando applet y proveedor perdido.

Los cuatro sellaron con el mismo hash en el store tirable y en /store: dos
work_root distintos, bytes idénticos.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-21 21:34:46 +00:00

134 lines
6.6 KiB
Python
Executable File

#!/usr/bin/env python3
"""Censo MEDIDO de quién provee cada applet de busybox, contra los artefactos del store.
Por qué existe. `docs/state/busybox-applets.tsv` asignaba un `destino` (el paquete que debería
reemplazar cada applet) por JUICIO — el propio `docs/plan-botar-busybox.md` lo dice: «el reparto
applet→destino es juicio, no medida». Al medirlo contra los artefactos sellados resultó que
**31 applets los provee otro paquete** y **79 no los provee NADIE salvo busybox**, entre ellos seis
—`xz unxz xzcat lzma unlzma lzcat`— cuyo dueño figura en seis perfiles con el `usr/bin` VACÍO.
Cómo mide. Índice inverso de `<store>/<hash>-<nombre>/{bin,sbin,usr/bin,usr/sbin,libexec}`: un
paquete «provee» un applet si instala un fichero o enlace con ESE nombre. Es equivalencia de NOMBRE,
no de banderas — un `nc` de socat cuenta como proveedor aunque su sintaxis difiera, y por eso la
columna `equivalencia` del TSV sigue haciendo falta.
⚠ Los rootfs ENSAMBLADOS (`product-rootfs`, `stage1-rootfs`) se excluyen: traen adentro el propio
busybox con sus 277 symlinks, así que contarlos haría que todo applet se «proveyera» a sí mismo.
El criterio no es el nombre sino el contenido — un artefacto con `bin/busybox` adentro que no SEA
busybox es un rootfs.
Uso: scripts/busybox-censo-proveedores.py [--store /store] [--escribir] [--guardian]
--escribir reescribe el TSV añadiendo las columnas `proveedor_medido` y `medido_el`.
--guardian sale ≠0 si algún applet PERDIÓ el proveedor que el TSV registra. Es el modo de CI.
⚠ El guardián no vigila un NÚMERO, vigila las PÉRDIDAS, y la diferencia importa: un umbral del tipo
«no más de 79 sin dueño» hay que subirlo cada vez que se retira un applet del defconfig, y a la
tercera vez nadie lo sube con criterio. Lo que sí es siempre una regresión es que un applet que
tenía proveedor medido deje de tenerlo — un `--disable-` nuevo en un `configure`, un `make install`
que cambia de objetivo, una receta de herramientas convertida en receta de librería. Los applets que
GANAN proveedor se reportan y no fallan: eso es avance, y el TSV se actualiza con `--escribir`.
"""
import argparse, csv, json, os, sys, collections, datetime
RAIZ = os.path.dirname(os.path.dirname(os.path.abspath(__file__)))
TSV = os.path.join(RAIZ, "docs/state/busybox-applets.tsv")
ESTADO = os.path.join(RAIZ, "docs/state/build-state.json")
SUBDIRS = ("bin", "sbin", "usr/bin", "usr/sbin", "usr/libexec", "libexec")
def indice(store):
"""nombre de binario -> {paquetes que lo instalan}, excluidos los rootfs ensamblados."""
prov = collections.defaultdict(set)
compuestos = []
for ent in os.scandir(store):
if not ent.is_dir():
continue
art = ent.name.split("-", 1)[1] if "-" in ent.name else ent.name
if art != "busybox" and os.path.exists(os.path.join(ent.path, "bin/busybox")):
compuestos.append(art)
continue
for sub in SUBDIRS:
try:
for f in os.scandir(os.path.join(ent.path, sub)):
prov[f.name].add(art)
except OSError:
pass
return prov, sorted(compuestos)
def main():
ap = argparse.ArgumentParser()
ap.add_argument("--store", default="/store")
ap.add_argument("--escribir", action="store_true")
ap.add_argument("--guardian", action="store_true")
a = ap.parse_args()
prov, compuestos = indice(a.store)
print(f"índice: {len(prov)} nombres · rootfs excluidos: {', '.join(compuestos) or '(ninguno)'}")
filas = list(csv.DictReader(open(TSV, encoding="utf-8"), delimiter="\t"))
vivos = [r for r in filas if r["recorte_2026_09_21"] != "RETIRADO"]
coincide, otro, solo = [], [], []
for r in vivos:
p = sorted(x for x in prov.get(r["applet"], ()) if x != "busybox")
r["_medido"] = ",".join(p) if p else "SOLO-BUSYBOX"
(coincide if r["destino"] in p else (otro if p else solo)).append(r)
print(f"\n el dueño del TSV lo provee : {len(coincide):>3}")
print(f" lo provee OTRO paquete : {len(otro):>3}")
print(f" SÓLO lo provee busybox : {len(solo):>3} ← el trabajo que queda")
est = json.load(open(ESTADO, encoding="utf-8"))["nodes"]
print("\n--- SÓLO BUSYBOX, por dueño declarado ---")
pord = collections.defaultdict(list)
for r in solo:
pord[r["destino"]].append(r["applet"])
for d, aa in sorted(pord.items(), key=lambda x: -len(x[1])):
n = est.get(d)
pf = ("en " + ",".join(n["perfiles"])) if n and n["perfiles"] else ("sellado sin perfil" if n else "sin receta")
print(f" {d:16} {len(aa):>2} [{pf}] {' '.join(sorted(aa))}")
print("\n--- lo provee OTRO paquete (el `destino` del TSV está mal) ---")
for r in sorted(otro, key=lambda r: r["applet"]):
print(f" {r['applet']:14} TSV={r['destino']:16} REAL={r['_medido']}")
if a.guardian:
perdidos, ganados = [], []
for r in vivos:
antes = (r.get("proveedor_medido") or "").strip()
if not antes:
continue # fila sin medición previa: nada que comparar
ahora = r["_medido"]
if antes != "SOLO-BUSYBOX" and ahora == "SOLO-BUSYBOX":
perdidos.append((r["applet"], antes))
elif antes == "SOLO-BUSYBOX" and ahora != "SOLO-BUSYBOX":
ganados.append((r["applet"], ahora))
if ganados:
print(f"\n{len(ganados)} applets GANARON proveedor (no es fallo; correr --escribir):")
for x, q in sorted(ganados):
print(f" {x:14} ahora lo provee {q}")
if perdidos:
print(f"\n✗ REGRESIÓN: {len(perdidos)} applets PERDIERON su proveedor y vuelven a depender de busybox:")
for x, q in sorted(perdidos):
print(f" {x:14} lo proveía {q}")
return 1
print("\n✓ guardián: ningún applet perdió su proveedor.")
return 0
if a.escribir:
hoy = datetime.date.today().isoformat()
campos = [c for c in filas[0] if not c.startswith("_")] + ["proveedor_medido", "medido_el"]
for r in filas:
r["proveedor_medido"] = r.pop("_medido", "") or ("n/a (retirado)" if r["recorte_2026_09_21"] == "RETIRADO" else "")
r["medido_el"] = hoy if r["recorte_2026_09_21"] != "RETIRADO" else ""
with open(TSV, "w", encoding="utf-8", newline="") as fh:
w = csv.DictWriter(fh, fieldnames=campos, delimiter="\t", lineterminator="\n")
w.writeheader()
w.writerows(filas)
print(f"\nTSV reescrito: {TSV} (+2 columnas)")
return 0
if __name__ == "__main__":
sys.exit(main())