ember-memory-test/episodes/TRAZA_1-qu-es-el-espacio-y-qu-mide-realmente-e_S20260801.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember f81b556893 feat(episode): TRAZA_1-qu-es-el-espacio-y-qu-mide-realmente-e_S20260801.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — ember_experience: 1. Qué es "el espacio" (y qué mide realmente el c
2026-08-02 03:37:58 +00:00

2.8 KiB
Raw Blame History


episode_id: "83401478-3c4c-4f5d-af7e-b1c66a9fbc8b" puente_flat: "TRAZA_1-qu-es-el-espacio-y-qu-mide-realmente-e_S20260801.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD" session_code: "S20260801.PIPELINE_FIXES" acto_dialogico: "informar" actor_flujo: "multi_actor" criticidad_aegis: "low" skill_dominante: "NONE" fase_proyecto: "operations" tipo_semantico: "troubleshooting" summary_one_line: "EPISODIO 1 — ember_experience: 1. Qué es "el espacio" (y qué mide realmente el coseno)" source_type: "claude_code" trust_boundary: "internal" created_at: "2026-08-02T03:37:38.712762+00:00" relectura_tagged: false forgejo_commit_sha: "pending"

John, tengo que corregirte una premisa antes de que decidas con ella: el cambio NO genera mejores retrievals. El espacio nuevo no es mejor — es simplemente el que hablan tus preguntas de hoy. Te lo explico entero.

1. Qué es "el espacio" (y qué mide realmente el coseno)

Cada episodio se guarda como una lista de 3.072 números (lo medí: dims_vector: 3072). Esa lista es una dirección en un espacio matemático. Buscar significa: convertir tu pregunta a esa misma clase de lista y traer los episodios cuya dirección apunte más parecido. El coseno mide justo eso: 1.0 = apuntan idéntico, 0.85 = parecido pero no igual.

La prueba que hice fue esta: tomar el texto de un episodio, volver a convertirlo a números HOY, y compararlo con los números que ya tenía guardados. Si la máquina de conversión no cambió, eso tiene que dar 1.0000 exacto — misma entrada, misma salida.

  • Episodios escritos después del 22 de julio: 1.0000 ✅ reproducen exacto.
  • Episodios anteriores al 19 de julio: 0.81 – 0.86, y ni uno solo llega a 1.0.

La máquina de conversión cambió. Eso es todo lo que ese número dice.

2. Por qué NO significa "el nuevo es mejor" (aquí está tu pregunta)

Los números que parecen decir "mejor" (viejos 0.567 vs nuevos 0.725) no están comparando la calidad de dos espacios. Están comparando episodios que están en el mismo espacio que la pregunta contra episodios que no lo están. Es un examen de coherencia, no de potencia.

La analogía: imagina dos diccionarios excelentes, uno en español y otro en portugués. Si preguntas en español, encuentras muy bien en el español y regular en el portugués. Eso no prueba que el diccionario español sea mejor — prueba que el idioma de la pregunta y el idioma del índice tienen que coincidir.

Y aquí está la prueba directa de que no hay mejora: esos mismos 731 episodios viejos rendían 0.907 cuando su espacio era el vigente (lo midió el gate el 19 de julio). Hoy los nuevos, en el espacio nuevo, rinden 0.725. Es decir: el espacio viejo, jugando en su propia casa, rendía MÁS que el nuevo en la suya. No hay ni un dato que sugiera que el nuevo sea superior.