From 7f6459c132d4808807e727d7802503697891f8a7 Mon Sep 17 00:00:00 2001 From: Sergio Date: Thu, 10 Sep 2026 14:58:50 +0000 Subject: [PATCH] =?UTF-8?q?atuq:=20el=20archivo=20personal=20=E2=80=94=20l?= =?UTF-8?q?o=20que=20le=C3=A9s=20queda=20congelado,=20y=20se=20encuentra?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit La unidad 8 del SDD 26 (§6.3), en su mitad pagable. Cada página que se lee se congela: el HTML **ya ejecutado** —lo que la persona vio, no lo que mandó el servidor— va al CAS con su BLAKE3, y la url, el título y el texto visible al índice. Después se busca, sin el navegador. visita 1 (página A) ⇒ archivada, visitas=1, total=1 visita 2 (página A) ⇒ dedup, visitas=2, total=1 ← volver NO duplica visita 3 (página B) ⇒ total=2 «masa» → 1 de 2 · «tobera» → 1 de 2 · «masa tobera» → 0 · «helicóptero» → 0 LA IDENTIDAD ES EL BLAKE3 DEL HTML, NO LA URL, y de ahí sale lo que hace que esto valga: la misma URL con otro contenido ES otra página, así que el archivo tiene VERSIONES de lo que leíste. Un historial de direcciones guarda punteros, y los punteros se pudren. ⚠ LA MITAD QUE NO SE PAGA HOY, dicha en el código, en el LEEME de allá y en el §6.3.bis: preguntarle al historial en LENGUAJE NATURAL. Eso es el registro semántico y en la suite ya tiene forma —un motor `rag-motor::RagMotor`, como `willay-rag`—, que necesita un daemon de embeddings y un backend LLM real y devuelve `None` cuando no están. `archive.search` es el registro LITERAL: todas las palabras tienen que aparecer. Enseñar lo uno diciendo que es lo otro sería el peor cambio posible. LO QUE NO SE ARCHIVA ES LA PARTE QUE HAY QUE MIRAR: nada de una ventana privada, nada fuera del marco principal (un `