Datenmaske
TRANSPARENCIA IA

¿Qué IA ve
su documento?

Dejamos claro qué modelos trabajan en Datenmaske, dónde se ejecutan y con qué datos se entrenaron. Inferencia exclusivamente en la UE, sin entrenamiento con sus documentos , la decisión final de anonimización siempre la toma la persona usuaria.

REGLAMENTO UE DE IA

Datenmaske es un sistema de clase de riesgo mínima.

El Reglamento europeo de IA (RIA) clasifica los sistemas de IA por nivel de riesgo. Datenmaske no entra en las categorías de alto riesgo del Anexo III (sin biometría, sin persecución penal, ninguno de los ámbitos de uso críticos allí citados). La detección de PII en documentos de texto es una herramienta de apoyo y siempre está sujeta a la aprobación humana.

Clasificación: clase de riesgo mínima (comparable a los filtros antispam). No reclamamos ningún «certificado AI Act» — no existe tal certificado para clases de riesgo mínimas. La afirmación correcta es: riesgo mínimo + divulgaciones de transparencia voluntarias.

Fecha
Hito del RIA
Estado
02/2025
Prácticas prohibidas (Art. 5) + obligación de competencia en IA (Art. 4) aplicables
en vigor
08/2025
Obligaciones de modelos GPAI (Capítulo V) aplicables
en vigor
08/2026
Obligaciones de alto riesgo + Art. 50 transparencia aplicables
próximo

FICHAS DE MODELOS

Los modelos en detalle

spaCy NER (de_core_news_lg)

Propósito
Detección de entidades nombradas alemanas (personas, lugares, organizaciones) en la capa de texto
Origen
Modelo de código abierto (Explosion / spaCy), preentrenado con corpus alemanes
Ubicación de inferencia
Autoalojado en spacy.mokka-dev.de (UE)
Entrenamiento con documentos de clientes
No — nunca.
Actualización
Fijado por versión; sin reentrenamiento automático con datos de clientes

GLiNER (autoalojado)

Propósito
Named Entity Recognition zero-shot para ampliar la detección de spaCy
Origen
Modelo de código abierto
Ubicación de inferencia
Autoalojado en la UE
Entrenamiento con documentos de clientes
No — nunca.
Actualización
Fijado por versión; sin entrenamiento con datos de clientes

urchade/gliner_multi_pii-v1 (PII-NER)

Propósito
NER zero-shot específico de PII para ampliar la detección de categorías de datos especiales (salud, datos financieros, documentos de identidad)
Origen
Modelo de código abierto (urchade/gliner_multi_pii-v1, mDeBERTa), disponible en HuggingFace / onnx-community
Ubicación de inferencia
Autoalojado en la UE (runtime ONNX de onnx-community)
Entrenamiento con documentos de clientes
No — nunca.
Actualización
Fijado por versión; sin entrenamiento con datos de clientes

OpenMed (NER médico)

Propósito
Named Entity Recognition médica para informes médicos, diagnósticos y otros datos de salud (Art. 9 RGPD)
Origen
Modelo de código abierto (HuggingFace), corpus NER médico
Ubicación de inferencia
Autoalojado en la UE
Entrenamiento con documentos de clientes
No — nunca.
Actualización
Fijado por versión; sin entrenamiento con datos de clientes

Azure Document Intelligence (OCR)

Propósito
Reconocimiento de texto únicamente para páginas escaneadas (imágenes PDF)
Origen
Microsoft Ireland Operations Ltd.
Ubicación de inferencia
Región Alemania (Germany West Central); EU Data Boundary
Entrenamiento con documentos de clientes
No — nunca.
Actualización
Por parte de Microsoft; sin uso para entrenamiento del modelo (contractual)

Otros componentes del pipeline de detección (patrones basados en reglas/gaceteros, comparadores de cadenas) no son modelos de aprendizaje y se documentan en la descripción del pipeline en /forschung. Las fichas de modelos anteriores describen la pila NER y OCR de producción de Datenmaske Web; la edición Desktop (§ 203) usa una selección de modelos en parte distinta, agrupada localmente.

GARANTÍAS

Lo que garantizamos — y lo que no.

  • Inferencia UE. Toda la inferencia de modelos se ejecuta en la UE — spaCy/GLiNER autoalojados (Alemania), Azure OCR en la región Alemania (Germany West Central). No se produce ninguna transferencia a terceros países (véase el DPA § 2 Abs. 3).
  • Sin entrenamiento con documentos de clientes. Nunca utilizamos sus documentos para entrenar, ajustar o mejorar nuestros modelos. Los modelos están fijados por versión y se mantienen con independencia de los datos de clientes.
  • Human-in-the-Loop, fail-closed. Cada anonimización requiere la aprobación de la persona usuaria. La exportación se bloquea hasta que se supera la verificación (ninguna cadena PII detectada en la capa de texto).
  • Pista de auditoría. Cada detección y anonimización se documenta de forma trazable en el protocolo de anonimización (con hashes SHA-256) — responsabilidad Art. 5 Abs. 2 RGPD.
  • Sin función de chat LLM actualmente. Datenmaske no utiliza actualmente ningún modelo de lenguaje generativo que «interactúe» directamente con los usuarios finales (Art. 50 Abs. 1 RIA). La IA se ejecuta como proceso en segundo plano con aprobación humana. Si se añadiera una función LLM, la obligación de transparencia del Art. 50 se cumpliría previamente.
  • Sin garantía de exhaustividad de la detección. Las propuestas basadas en IA deben ser revisadas por la persona usuaria. Datenmaske apoya la revisión manual, no la sustituye.
DATENMASKE

Transparencia que usted puede verificar.

Suba un PDF y compruebe usted mismo la detección, la aprobación y el protocolo de anonimización — gratis, sin registro.