REGLAMENTO UE DE IA
Datenmaske es un sistema de clase de riesgo mínima.
El Reglamento europeo de IA (RIA) clasifica los sistemas de IA por nivel de riesgo. Datenmaske no entra en las categorías de alto riesgo del Anexo III (sin biometría, sin persecución penal, ninguno de los ámbitos de uso críticos allí citados). La detección de PII en documentos de texto es una herramienta de apoyo y siempre está sujeta a la aprobación humana.
Clasificación: clase de riesgo mínima (comparable a los filtros antispam). No reclamamos ningún «certificado AI Act» — no existe tal certificado para clases de riesgo mínimas. La afirmación correcta es: riesgo mínimo + divulgaciones de transparencia voluntarias.
FICHAS DE MODELOS
Los modelos en detalle
spaCy NER (de_core_news_lg)
- Propósito
- Detección de entidades nombradas alemanas (personas, lugares, organizaciones) en la capa de texto
- Origen
- Modelo de código abierto (Explosion / spaCy), preentrenado con corpus alemanes
- Ubicación de inferencia
- Autoalojado en spacy.mokka-dev.de (UE)
- Entrenamiento con documentos de clientes
- No — nunca.
- Actualización
- Fijado por versión; sin reentrenamiento automático con datos de clientes
GLiNER (autoalojado)
- Propósito
- Named Entity Recognition zero-shot para ampliar la detección de spaCy
- Origen
- Modelo de código abierto
- Ubicación de inferencia
- Autoalojado en la UE
- Entrenamiento con documentos de clientes
- No — nunca.
- Actualización
- Fijado por versión; sin entrenamiento con datos de clientes
urchade/gliner_multi_pii-v1 (PII-NER)
- Propósito
- NER zero-shot específico de PII para ampliar la detección de categorías de datos especiales (salud, datos financieros, documentos de identidad)
- Origen
- Modelo de código abierto (urchade/gliner_multi_pii-v1, mDeBERTa), disponible en HuggingFace / onnx-community
- Ubicación de inferencia
- Autoalojado en la UE (runtime ONNX de onnx-community)
- Entrenamiento con documentos de clientes
- No — nunca.
- Actualización
- Fijado por versión; sin entrenamiento con datos de clientes
OpenMed (NER médico)
- Propósito
- Named Entity Recognition médica para informes médicos, diagnósticos y otros datos de salud (Art. 9 RGPD)
- Origen
- Modelo de código abierto (HuggingFace), corpus NER médico
- Ubicación de inferencia
- Autoalojado en la UE
- Entrenamiento con documentos de clientes
- No — nunca.
- Actualización
- Fijado por versión; sin entrenamiento con datos de clientes
Azure Document Intelligence (OCR)
- Propósito
- Reconocimiento de texto únicamente para páginas escaneadas (imágenes PDF)
- Origen
- Microsoft Ireland Operations Ltd.
- Ubicación de inferencia
- Región Alemania (Germany West Central); EU Data Boundary
- Entrenamiento con documentos de clientes
- No — nunca.
- Actualización
- Por parte de Microsoft; sin uso para entrenamiento del modelo (contractual)
Otros componentes del pipeline de detección (patrones basados en reglas/gaceteros, comparadores de cadenas) no son modelos de aprendizaje y se documentan en la descripción del pipeline en /forschung. Las fichas de modelos anteriores describen la pila NER y OCR de producción de Datenmaske Web; la edición Desktop (§ 203) usa una selección de modelos en parte distinta, agrupada localmente.
GARANTÍAS
Lo que garantizamos — y lo que no.
- Inferencia UE. Toda la inferencia de modelos se ejecuta en la UE — spaCy/GLiNER autoalojados (Alemania), Azure OCR en la región Alemania (Germany West Central). No se produce ninguna transferencia a terceros países (véase el DPA § 2 Abs. 3).
- Sin entrenamiento con documentos de clientes. Nunca utilizamos sus documentos para entrenar, ajustar o mejorar nuestros modelos. Los modelos están fijados por versión y se mantienen con independencia de los datos de clientes.
- Human-in-the-Loop, fail-closed. Cada anonimización requiere la aprobación de la persona usuaria. La exportación se bloquea hasta que se supera la verificación (ninguna cadena PII detectada en la capa de texto).
- Pista de auditoría. Cada detección y anonimización se documenta de forma trazable en el protocolo de anonimización (con hashes SHA-256) — responsabilidad Art. 5 Abs. 2 RGPD.
- Sin función de chat LLM actualmente. Datenmaske no utiliza actualmente ningún modelo de lenguaje generativo que «interactúe» directamente con los usuarios finales (Art. 50 Abs. 1 RIA). La IA se ejecuta como proceso en segundo plano con aprobación humana. Si se añadiera una función LLM, la obligación de transparencia del Art. 50 se cumpliría previamente.
- Sin garantía de exhaustividad de la detección. Las propuestas basadas en IA deben ser revisadas por la persona usuaria. Datenmaske apoya la revisión manual, no la sustituye.