Saltar al contenido principal
es/blog/chat-control/criptografia-homorfica/

Criptografía homomórfica — Promesas, límites ficción en la detección de CSAM

Por Xscriptor — Óscar Preciado8 min de lectura
TecnologíaCriptografíaPrivacidadInvestigaciónFHEcifrado homomórficocriptografíaprivacidadescaneoCSAMChat ControlXscriptorÓscar Preciado
Criptografía homomórfica — Promesas, límites ficción en la detección de CSAM

Si puedes computar sobre datos cifrados sin descifrarlos, tienes criptografía homomórfica. Si puedes hacerlo a escala de WhatsApp, tienes un milagro. Y los milagros no son una base sólida para la legislación.



En el debate sobre Chat Control, la criptografía completamente homomórfica (FHE, por sus siglas en inglés) aparece con frecuencia como la solución técnica que permitiría conciliar escaneo y privacidad. La idea es seductora: un servidor podría ejecutar un clasificador de CSAM sobre mensajes cifrados sin descifrarlos, obteniendo solo un resultado binario —"sospechoso" o "no sospechoso"— sin acceder al contenido.

La promesa es real. La viabilidad práctica, sin embargo, es otra historia.

¿Qué es la criptografía homomórfica?

Un esquema de cifrado homomórfico permite realizar operaciones aritméticas sobre datos cifrados. Formalmente:

Dado un cifrado E(m1)=c1E(m_1) = c_1 y E(m2)=c2E(m_2) = c_2, existe una operación \oplus tal que:

c1c2=E(m1m2)c_1 \oplus c_2 = E(m_1 \circ m_2)

donde \circ es una operación aritmética (suma o multiplicación) sobre los textos claros.

Tipos

Tipo Operaciones Ejemplo Rendimiento
PHE (Parcial) Solo suma o solo multiplicación RSA (multiplicativo), Paillier (aditivo) ~1-10× más lento
SHE (Algo homomórfico) Suma y multiplicación con límites BGV, BFV ~10³-10⁶× más lento
FHE (Completamente homomórfico) Suma y multiplicación ilimitadas CKKS, Gentry, TFHE ~10⁶-10⁹× más lento

La diferencia crucial entre SHE y FHE es el bootstrapping: una técnica que "refresca" el ruido acumulado en el cifrado después de cada operación, permitiendo cómputos arbitrariamente profundos. Sin bootstrapping, el ruido crece con cada operación hasta que el mensaje se vuelve indescifrable.

Cifrado FHE:      m → E(m) → [ruido inicial = ε]
Suma:             E(m₁) ⊕ E(m₂) → E(m₁+m₂) → [ruido ≈ 2ε]
Multiplicación:   E(m₁) ⊗ E(m₂) → E(m₁·m₂) → [ruido ≈ ε²]
Bootstrapping:    E(m) → E(E(m)) → descifrado homomórfico → E(m) limpio

El problema del rendimiento

El obstáculo fundamental del FHE es el rendimiento. Las operaciones sobre datos cifrados son entre 6 y 9 órdenes de magnitud más lentas que sobre texto claro. Para hacerse una idea:

Operación Texto claro FHE (estimación 2026) Factor
Suma de 2 enteros de 32 bits ~0.3 ns ~10 μs 30,000×
Multiplicación de 2 enteros ~0.5 ns ~1 ms 2,000,000×
Comparación (> / <) ~0.3 ns ~10 ms 30,000,000×
Clasificador CNN (una imagen) ~1 ms ~10⁶-10⁹ s Impracticable
Red neuronal completa (inferencia) ~10 ms ~10⁷-10¹⁰ s Impracticable

WhatsApp procesa aproximadamente 100 mil millones de mensajes al día (~1.16 millones por segundo). Un clasificador FHE para una sola imagen requeriría, en el mejor de los casos, horas de cómputo. Para la escala de mensajería global, el FHE es varios órdenes de magnitud más lento de lo que sería necesario.

¿Y si el clasificador es simple?

Un argumento que a veces se escucha es que un clasificador de CSAM no necesita ser una red neuronal compleja. Podría ser una simple comparación contra una base de datos de hashes perceptuales. Esto sería computable con FHE... en teoría.

El problema es que la detección de CSAM no es una comparación de hashes. El contenido CSAM no está etiquetado con un hash conocido hasta que es identificado y reportado. La mayoría del material que los sistemas actuales detectan es nuevo material no clasificado previamente, lo que requiere clasificadores basados en contenido (redes neuronales) que analicen la imagen o el vídeo para determinar si contiene material sospechoso.

Un clasificador de este tipo requiere:

  • Varias capas convolucionales
  • Funciones de activación no lineales (ReLU, sigmoide)
  • Capas de pooling
  • Capas completamente conectadas
  • Comparación contra embeddings

Cada una de estas operaciones es órdenes de magnitud más cara en FHE. Las funciones no lineales son particularmente problemáticas porque FHE solo soporta operaciones aritméticas lineales (suma, multiplicación), y las no linealidades deben aproximarse mediante polinomios, lo que añade aún más profundidad de cómputo y requiere más bootstrapping.

La paradoja del clasificador

Incluso si el rendimiento se resolviera (digamos, mediante hardware especializado o avances criptográficos significativos), quedaría un problema conceptual más profundo:


Para clasificar contenido cifrado como CSAM, el clasificador necesita saber qué es CSAM. Pero para definir CSAM, el clasificador necesita ver ejemplos de CSAM.


Esto significa que el clasificador —y por tanto la entidad que lo entrena, actualiza y despliega— contiene el conocimiento de lo que busca. Ese conocimiento puede ser:

  • Una base de datos de hashes: que puede ampliarse para incluir otros contenidos
  • Un modelo de red neuronal: que puede afinarse para detectar otras categorías
  • Un conjunto de reglas: que puede expandirse por mandato legal

La puerta no es trasera. Es estructural. El mecanismo que permite detectar CSAM permite, con la misma arquitectura, detectar cualquier otra cosa que la autoridad decida incluir.

FHE (ideal):      E(m) → [clasificador FHE] → sí/no
                  Nadie ve m. Solo el veredicto.

FHE (real):       E(m) → [clasificador FHE] → sí/no + confianza
                  La confianza revela información sobre m.
                  Si el clasificador se actualiza, el VEREDICTO CAMBIA.
                  La autoridad puede iterar clasificadores sobre datos pasados.

Este último punto es crítico y poco discutido. Si los mensajes se almacenan cifrados (y la plataforma los conserva), una orden futura que actualice el clasificador permitiría reescanear retrospectivamente todo el historial de comunicaciones. El FHE no impide esto: el clasificador se ejecuta sobre los datos cifrados almacenados, y la autoridad obtiene nuevos veredictos sin haber visto nunca el contenido original.

El estado del arte

A julio de 2026, el FHE ha logrado avances notables en laboratorio:

  • Redes neuronales pequeñas (∼10 capas, ∼1000 neuronas): inferencia en minutos por muestra
  • Comparación de hashes: factible para bases pequeñas (∼10⁶ entradas)
  • Bootstrapping optimizado: TFHE puede ejecutar una puerta lógica en ∼10 ms

Pero la brecha entre lo que es factible en laboratorio y lo que requiere la mensajería masiva sigue siendo de varios órdenes de magnitud:

Requisito FHE 2026 Necesario para CSAR Brecha
Clasificar 1 imagen ~10³-10⁶ segundos < 0.1 segundos 10⁴-10⁷×
1B imágenes/día Impracticable ~10⁵ imágenes/segundo Infranqueable
Clasificar vídeo Años por minuto Tiempo real Infranqueable
Privacidad del clasificador Posible No es el problema

Conclusión técnica

La criptografía homomórfica no es la solución que la Comisión Europea busca, por tres razones:


  1. Rendimiento: el FHE no puede procesar la escala de mensajería global con clasificadores sofisticados, y no hay indicios de que pueda hacerlo en la próxima década. Los avances en hardware acelerado (FPGA, ASIC) podrían reducir la brecha, pero no cerrarla.



  2. Clasificación retrospectiva: el FHE no impide el reescaneo histórico de comunicaciones almacenadas, lo que crea un riesgo de vigilancia diferida que la propuesta no aborda.



  3. Expansibilidad del clasificador: el mecanismo que permite detectar CSAM permite, con el mismo diseño, detectar cualquier contenido clasificable. El FHE no resuelve el problema de la pendiente resbaladiza; solo lo traslada al plano algorítmico.


El FHE es una tecnología prometedora para aplicaciones donde la cantidad de datos es moderada y el cómputo es simple (consultas a bases de datos cifradas, computación multiparte, privacidad en modelos de ML). Pero como base para un sistema de vigilancia masiva obligatoria, es una solución que busca un problema que no puede resolver.


Serie Chat Control:

  1. Chat Control — Definición y contexto — El punto de partida: qué propone la CSAR, su recorrido legislativo y las posiciones enfrentadas.
  2. Cifrado y vigilancia — Por qué el escaneo masivo rompe el E2EE — Por qué el escaneo obligatorio y el cifrado de extremo a extremo no pueden coexistir.
  3. Criptografía homomórfica — Promesas y límites — Por qué el FHE no es la solución técnica que la Comisión busca.
  4. Pruebas de conocimiento cero — Aplicaciones y límites — ZKP, PSI y por qué no resuelven el problema de detección sin romper la privacidad.
  5. Cifrado externo y claves compartidas — El enfoque de soberanía del usuario y por qué no escala como solución sistémica.
  6. Alternativas al escaneo masivo — Estrategias técnicas, políticas e híbridas para preservar la privacidad.
  7. El precio del control — Una perspectiva sobre el sacrificio de derechos fundamentales en nombre de la seguridad.