kernel kexec: el reboot suave por kexec_file_load, sin kexec-tools

ADR 0017 §1. Se usa kexec_file_load, no el kexec_load viejo, y la
diferencia es de orden de magnitud: kexec_load recibe los segmentos YA
armados y el purgatory —el código que corre entre los dos kernels—, o
sea que usarlo obliga a reimplementar kexec-tools entero.
kexec_file_load recibe los DESCRIPTORES del kernel y del initrd y hace
el trabajo adentro. Son ~50 líneas.

El syscall va con asm! en vez de agregar la crate libc al workspace: es
UN syscall, su número y su ABI son contrato estable de Linux, y la
alternativa era arrastrar una dependencia a un workspace que comparten
dos frentes.

El cmdline viaja CON su NUL: el kernel cuenta cmdline_len incluyendo el
terminador, y sin él lee un byte de más. Es el error clásico de esta
llamada.

recipes/linux-metal-kexec.toml — variante cuya ÚNICA diferencia es
CONFIG_KEXEC_FILE=y. Variante y no flag en la canónica porque el .config
ES la identidad del artefacto (SDD 22 §1): tocar linux-metal re-hashea
el kernel que arranca las imágenes y el que reproduce bit a bit, y el
ADR deja esa decisión al usuario. Comprobado que la canónica no se
mueve: sigue en b3:2ed8f54a…, el que ya está sellado.

Y un diagnóstico que corregí a los dos minutos de escribirlo, porque
mandaba al lugar OPUESTO: decía "falta CONFIG_KEXEC_FILE" para EPERM.
Medido en este hub — el kernel de Artix trae CONFIG_KEXEC_FILE=y y aun
así devolvió EPERM, por no ser root. EPERM es falta de CAP_SYS_BOOT (o
lockdown si ya sos root); ENOSYS es el flag que falta. Confundirlos
manda a recompilar un kernel que estaba bien.

La ayuda del comando dice con todas las letras que esto NO es
"actualizar sin rebootear": el userspace muere igual. Ahorra los 20-30 s
de POST/UEFI, que es la mitad del downtime en un servidor remoto y nada
en un portátil.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01HHAKWoBqof9XvsYCvDicEj
This commit is contained in:
Sergio
2026-09-12 01:04:55 +00:00
co-authored by Claude Opus 5
parent f22beb1b35
commit 0a9622c7b0
3 changed files with 297 additions and 0 deletions
+141
View File
@@ -162,6 +162,147 @@ pub fn instalar_candidato(bzimage: &Path, esp: &Path, ruta_efi: &str) -> Result<
Ok(n)
}
// ══ kexec: el reboot suave (ADR 0017 §1) ═══════════════════════════════════════════════════════
//
// Se usa **`kexec_file_load`**, no el `kexec_load` viejo, y la diferencia es de orden de magnitud:
// `kexec_load` recibe los segmentos YA armados y el *purgatory* —el código que corre entre los dos
// kernels—, o sea que usarlo obliga a reimplementar kexec-tools. `kexec_file_load` recibe los
// **descriptores** del kernel y del initrd y hace el trabajo dentro del kernel.
//
// Se hace con `asm!` en vez de agregar la crate `libc` al workspace: es **un** syscall, su número y
// su ABI son contrato estable de Linux, y la alternativa era arrastrar una dependencia a un
// workspace compartido por dos frentes.
//
// ⚠ **Esto no es «actualizar sin rebootear».** El userspace muere igual: es un reboot que se salta
// el firmware. Lo que ahorra son los 20-30 s de POST/UEFI — la mitad del downtime en un servidor
// remoto, y nada en un portátil. La ayuda del comando lo dice con esas palabras a propósito.
#[cfg(target_arch = "x86_64")]
mod sys {
/// `kexec_file_load` en x86_64. Contrato: `include/uapi/asm-generic/unistd.h`.
pub const NR_KEXEC_FILE_LOAD: u64 = 320;
/// `reboot`.
pub const NR_REBOOT: u64 = 169;
pub const LINUX_REBOOT_MAGIC1: u64 = 0xfee1_dead;
pub const LINUX_REBOOT_MAGIC2: u64 = 672_274_793;
pub const LINUX_REBOOT_CMD_KEXEC: u64 = 0x4558_4543;
/// Cargar sin initramfs (el fd de initrd se ignora).
pub const KEXEC_FILE_NO_INITRAMFS: u64 = 0x4;
/// # Safety
/// Invoca un syscall crudo. Los argumentos tienen que respetar la ABI del syscall llamado.
pub unsafe fn syscall5(n: u64, a: u64, b: u64, c: u64, d: u64, e: u64) -> i64 {
let ret: i64;
unsafe {
std::arch::asm!(
"syscall",
inlateout("rax") n => ret,
in("rdi") a,
in("rsi") b,
in("rdx") c,
in("r10") d,
in("r8") e,
lateout("rcx") _,
lateout("r11") _,
options(nostack)
);
}
ret
}
}
/// Carga un kernel para el próximo `reboot -f kexec`. NO salta todavía.
#[cfg(target_arch = "x86_64")]
pub fn kexec_cargar(kernel: &Path, initrd: Option<&Path>, cmdline: &str) -> Result<()> {
use std::os::fd::AsRawFd;
let fk = std::fs::File::open(kernel)
.with_context(|| format!("abriendo el kernel {}", kernel.display()))?;
// El cmdline viaja con su NUL: el kernel cuenta `cmdline_len` INCLUYENDO el terminador, y sin él
// lee un byte de más. Es el error clásico de esta llamada.
let mut cl: Vec<u8> = cmdline.as_bytes().to_vec();
cl.push(0);
let (fd_i, flags) = match initrd {
Some(p) => {
let fi = std::fs::File::open(p)
.with_context(|| format!("abriendo el initrd {}", p.display()))?;
(Some(fi), 0u64)
}
None => (None, sys::KEXEC_FILE_NO_INITRAMFS),
};
let raw_i = fd_i.as_ref().map(|f| f.as_raw_fd()).unwrap_or(-1);
let r = unsafe {
sys::syscall5(
sys::NR_KEXEC_FILE_LOAD,
fk.as_raw_fd() as u64,
raw_i as u64,
cl.len() as u64,
cl.as_ptr() as u64,
flags,
)
};
if r < 0 {
let e = -r;
// Traducir los tres errores que de verdad pasan, porque «Permission denied» a secas manda a
// buscar permisos de fichero cuando el problema es otro.
// ⚠ EPERM y ENOSYS se confunden fácil y mandan a lugares OPUESTOS. Medido en este mismo hub:
// el kernel de Artix trae `CONFIG_KEXEC_FILE=y` y aun así devolvió EPERM — por no ser root.
// El primer texto de este match decía «falta CONFIG_KEXEC_FILE» para EPERM, que es
// exactamente el diagnóstico equivocado: manda a recompilar un kernel que estaba bien.
let pista = match e {
1 => " ⇒ falta CAP_SYS_BOOT: hay que ser root (y si YA sos root, es lockdown: Secure Boot no deja cargar un kernel sin firmar)",
38 => " ⇒ el kernel que CORRE no implementa kexec_file_load: le falta CONFIG_KEXEC_FILE",
13 => " ⇒ no puedo leer el fichero del kernel o del initrd",
22 => " ⇒ la imagen no le gustó al kernel (¿es un bzImage x86_64 válido?)",
_ => "",
};
bail!("kexec_file_load falló: errno {e}{pista}");
}
Ok(())
}
/// Salta al kernel ya cargado. **No vuelve.**
#[cfg(target_arch = "x86_64")]
pub fn kexec_saltar() -> Result<()> {
let r = unsafe {
sys::syscall5(
sys::NR_REBOOT,
sys::LINUX_REBOOT_MAGIC1,
sys::LINUX_REBOOT_MAGIC2,
sys::LINUX_REBOOT_CMD_KEXEC,
0,
0,
)
};
bail!("reboot(KEXEC) volvió con {r}: no había kernel cargado, o no somos root")
}
#[cfg(not(target_arch = "x86_64"))]
pub fn kexec_cargar(_: &Path, _: Option<&Path>, _: &str) -> Result<()> {
bail!("kexec: sólo implementado para x86_64")
}
#[cfg(not(target_arch = "x86_64"))]
pub fn kexec_saltar() -> Result<()> {
bail!("kexec: sólo implementado para x86_64")
}
/// ¿El kernel que corre soporta `kexec_file_load`? Se responde **preguntándole al kernel**, no
/// leyendo un `.config` que puede no ser el suyo.
pub fn kexec_file_disponible() -> bool {
// Un `kexec_file_load` con fd inválido devuelve EBADF (9) si el syscall EXISTE, y ENOSYS (38)
// si no está compilado. Distinguir los dos es toda la prueba, y no carga nada.
#[cfg(target_arch = "x86_64")]
{
let r = unsafe { sys::syscall5(sys::NR_KEXEC_FILE_LOAD, u64::MAX, u64::MAX, 0, 0, sys::KEXEC_FILE_NO_INITRAMFS) };
-r != 38
}
#[cfg(not(target_arch = "x86_64"))]
{
false
}
}
#[cfg(test)]
mod tests {
use super::*;
+63
View File
@@ -227,6 +227,28 @@ pub enum KernelCmd {
#[arg(long)]
dry_run: bool,
},
/// Soft reboot into a kernel: skip firmware and bootloader (ADR 0017 §1).
///
/// ⚠ **NO es «actualizar sin rebootear».** El userspace muere igual — es un reboot que se salta
/// el firmware. Ahorra los 20-30 s de POST/UEFI, que en un servidor remoto es la mitad del
/// downtime y en un portátil no es nada. Se dice acá porque media industria vende esto como
/// «live kernel update» y no lo es.
Kexec {
/// Artefacto del kernel en el store (nombre de directorio o ruta).
artefacto: String,
/// initramfs a cargar con él.
#[arg(long)]
initrd: Option<PathBuf>,
/// Kernel command line for the new kernel.
#[arg(long, default_value = "console=tty0 console=ttyS0,115200")]
cmdline: String,
/// Load it and stop there: the jump needs `--jump`.
#[arg(long)]
load_only: bool,
/// Actually jump. Without this it only loads and reports.
#[arg(long)]
jump: bool,
},
/// Say where this boot came from and what is on trial.
BootStatus {
#[arg(long, default_value = crate::efi_boot::EFIVARS)]
@@ -266,6 +288,8 @@ pub fn run(cmd: KernelCmd, store: &str) -> Result<()> {
match cmd {
KernelCmd::Stage { artefacto, esp, efivars, tries, state, dry_run } =>
ab_stage(&artefacto, store, &esp, &efivars, tries, &state, dry_run),
KernelCmd::Kexec { artefacto, initrd, cmdline, load_only, jump } =>
kexec_cmd(&artefacto, store, initrd.as_deref(), &cmdline, load_only, jump),
KernelCmd::BootStatus { efivars, state } => ab_status(&efivars, &state),
KernelCmd::Confirm { esp, efivars, state } => ab_confirm(&esp, &efivars, &state),
KernelCmd::Rollback { esp, efivars, state } => ab_rollback(&esp, &efivars, &state),
@@ -2120,3 +2144,42 @@ fn ab_rollback(esp: &Path, efivars: &Path, state: &Path) -> Result<()> {
println!("el kernel estable sigue siendo el que estaba. No se tocó.");
Ok(())
}
fn kexec_cmd(
artefacto: &str,
store: &str,
initrd: Option<&Path>,
cmdline: &str,
load_only: bool,
jump: bool,
) -> Result<()> {
let (bz, nombre) = bzimage_de(artefacto, store)?;
println!("kexec: {nombre}");
println!(" kernel: {}", bz.display());
match initrd {
Some(p) => println!(" initrd: {}", p.display()),
None => println!(" initrd: (ninguno)"),
}
println!(" cmdline: {cmdline}");
// Ojo: esto detecta si el SYSCALL existe, no si podemos usarlo. Un kernel con el flag puesto y
// un usuario sin privilegios pasa esta puerta y falla después con EPERM, que es lo correcto:
// mejor el error real del syscall que una sospecha nuestra.
if !kernel_ab::kexec_file_disponible() {
bail!(
"este kernel no implementa kexec_file_load (falta CONFIG_KEXEC_FILE).\n \
Los kernels del corpus traen CONFIG_KEXEC —el syscall viejo— que exige armar los \
segmentos y el purgatory a mano, o sea kexec-tools entero.\n \
La variante `recipes/linux-metal-kexec.toml` lo trae encendido."
);
}
kernel_ab::kexec_cargar(&bz, initrd, cmdline)?;
println!("✓ kernel cargado en memoria");
if load_only || !jump {
println!(" (no se salta: pasá --jump. El kernel queda cargado hasta el próximo reboot.)");
return Ok(());
}
println!("⚡ saltando — el userspace muere ACÁ. Esto no vuelve.");
kernel_ab::kexec_saltar()
}