Datenmaske
TRANSPARENCE IA

Quelle IA voit
votre document ?

Nous indiquons clairement quels modèles travaillent dans Datenmaske, où ils s'exécutent et sur quoi ils ont été entraînés. Inférence exclusivement dans l'UE, aucun entraînement sur vos documents , la décision finale d'occultation revenant toujours à l'utilisateur.

RÈGLEMENT UE SUR L'IA

Datenmaske est un système de classe de risque minimale.

Le règlement européen sur l'IA (RIA) classe les systèmes d'IA par niveau de risque. Datenmaske n'entre pas dans les catégories haut risque de l'Annexe III (pas de biométrie, pas de répression pénale, aucun des domaines d'utilisation critiques qui y sont cités). La détection de PII dans les documents texte est un outil de support et reste toujours soumise à la validation humaine.

Classification : classe de risque minimale (comparable aux filtres anti-spam). Nous ne revendiquons aucun « certificat AI Act » — il n'en existe pas pour les classes de risque minimales. L'affirmation correcte est : risque minimal + divulgations de transparence volontaires.

Date
Jalon du RIA
Statut
02/2025
Pratiques interdites (Art. 5) + obligation de compétence IA (Art. 4) applicables
en vigueur
08/2025
Obligations des modèles GPAI (Chapitre V) applicables
en vigueur
08/2026
Obligations haut risque + transparence Art. 50 applicables
à venir

FICHES MODÈLES

Les modèles en détail

spaCy NER (de_core_news_lg)

Objet
Détection des entités nommées allemandes (personnes, lieux, organisations) dans la couche de texte
Origine
Modèle open source (Explosion / spaCy), pré-entraîné sur des corpus allemands
Lieu d'inférence
Auto-hébergé sur spacy.mokka-dev.de (UE)
Entraînement sur les documents clients
Non — jamais.
Mise à jour
Lié à la version ; aucun ré-entraînement automatique sur les données clients

GLiNER (auto-hébergé)

Objet
Named Entity Recognition zero-shot pour étendre la détection spaCy
Origine
Modèle open source
Lieu d'inférence
Auto-hébergé dans l'UE
Entraînement sur les documents clients
Non — jamais.
Mise à jour
Lié à la version ; aucun entraînement sur les données clients

urchade/gliner_multi_pii-v1 (PII-NER)

Objet
NER zero-shot spécifique aux PII pour étendre la détection des catégories de données particulières (santé, données financières, pièces d'identité)
Origine
Modèle open source (urchade/gliner_multi_pii-v1, mDeBERTa), disponible sur HuggingFace / onnx-community
Lieu d'inférence
Auto-hébergé dans l'UE (runtime ONNX onnx-community)
Entraînement sur les documents clients
Non — jamais.
Mise à jour
Lié à la version ; aucun entraînement sur les données clients

OpenMed (NER médical)

Objet
Named Entity Recognition médicale pour les lettres de médecin, diagnostics et autres données de santé (Art. 9 RGPD)
Origine
Modèle open source (HuggingFace), corpus NER médical
Lieu d'inférence
Auto-hébergé dans l'UE
Entraînement sur les documents clients
Non — jamais.
Mise à jour
Lié à la version ; aucun entraînement sur les données clients

Azure Document Intelligence (OCR)

Objet
Reconnaissance de texte uniquement pour les pages numérisées (images PDF)
Origine
Microsoft Ireland Operations Ltd.
Lieu d'inférence
Région Allemagne (Germany West Central) ; EU Data Boundary
Entraînement sur les documents clients
Non — jamais.
Mise à jour
Côté Microsoft ; aucune utilisation pour l'entraînement du modèle (contractuel)

Les autres composants du pipeline de détection (motifs basés sur des règles/gazetiers, correspondances de chaînes) ne sont pas des modèles d'apprentissage et sont documentés dans la vue d'ensemble du pipeline sur /forschung. Les fiches modèles ci-dessus décrivent la pile NER et OCR de production de Datenmaske Web ; l'édition Desktop (§ 203) utilise une sélection de modèles en partie différente, intégrée localement.

ASSURANCES

Ce que nous assurons — et ce que nous n'assurons pas.

  • Inférence UE. Toute l'inférence des modèles s'exécute dans l'UE — spaCy/GLiNER auto-hébergés (Allemagne), Azure OCR dans la région Allemagne (Germany West Central). Aucun transfert vers des pays tiers n'a lieu (voir DPA § 2 Abs. 3).
  • Aucun entraînement sur les documents clients. Nous n'utilisons jamais vos documents pour entraîner, affiner ou améliorer nos modèles. Les modèles sont liés à leur version et maintenus indépendamment des données clients.
  • Human-in-the-Loop, fail-closed. Chaque occultation nécessite la validation par l'utilisateur. L'export est bloqué tant que la vérification (aucune chaîne PII détectée restante dans la couche de texte) n'est pas réussie.
  • Piste d'audit. Chaque détection et occultation est documentée de manière traçable dans le journal d'occultation (avec empreintes SHA-256) — responsabilité Art. 5 Abs. 2 RGPD.
  • Aucune fonction de chat LLM actuellement. Datenmaske ne déploie actuellement aucun grand modèle de langage génératif qui « interagit » directement avec les utilisateurs finaux (Art. 50 Abs. 1 RIA). L'IA s'exécute comme traitement en arrière-plan avec validation humaine. Si une fonction LLM devait être ajoutée, l'obligation de transparence de l'Art. 50 serait remplie au préalable.
  • Aucune garantie d'exhaustivité de la détection. Les propositions basées sur l'IA doivent être vérifiées par l'utilisateur. Datenmaske accompagne la vérification manuelle, il ne la remplace pas.
DATENMASKE

Une transparence que vous pouvez vérifier.

Téléchargez un PDF et vérifiez vous-même la détection, la validation et le journal d'occultation — gratuitement, sans inscription.