AI Risk Assessment: Methodik für KI-Risikobewertung
2. November 2025, 14 Min. Lesezeit
Wann verarbeiten LLMs personenbezogene Daten? Rechtsgrundlagen, Betroffenenrechte, AVV mit Anbietern. Privacy by Design für KI-Systeme.
Die DSGVO ist 7 Jahre alt. LLMs sind 2 Jahre Mainstream. Die Kombination? Rechtlich und technisch herausfordernd.
Das Recht auf Löschung bei trainierten Modellen? Technisch kaum umsetzbar. Die Frage, ob ein LLM selbst "personenbezogene Daten" enthält? Von deutschen Aufsichtsbehörden unterschiedlich bewertet. Und trotzdem brauchen Sie pragmatische Lösungen – die noyb-Beschwerden gegen OpenAI zeigen, dass Enforcement kommt.
| Entwicklung | Status | Relevanz |
|---|---|---|
| DSK Orientierungshilfe KI | Mai 2024, Update Juni 2025 | Checkliste für Auswahl und Betrieb |
| DSK Orientierungshilfe RAG | Oktober 2025 | 18-seitiger Leitfaden für RAG-Systeme |
| noyb vs. OpenAI (1. Beschwerde) | April 2024, laufend | Halluzinationen = DSGVO-Verstoß? |
| noyb vs. OpenAI (2. Beschwerde) | März 2025 | Falsche "Kindermörder"-Behauptung |
| DeepSeek-Prüfverfahren | März 2025 | 7 deutsche Aufsichtsbehörden aktiv |
| EDPB-Leitlinien 03/2026 zu Web Scraping für generative KI | Juli 2026, Konsultation bis 30.10.2026 | Maßstab für die Herkunft von Trainingsdaten |
| EDPB-Leitlinien zur Anonymisierung | Juli 2026, Konsultation bis 30.10.2026 | Drei Prüfkriterien für "anonym" |
Was die noyb-Beschwerden bedeuten: OpenAI konnte auf Auskunftsanfragen nicht vollständig antworten und falsche Daten nicht berichtigen. Wenn das zu Bußgeldern führt (bis 4% des globalen Umsatzes), hat das Signalwirkung für jeden LLM-Betreiber.
Was die EDPB-Leitlinien bedeuten: Der Europäische Datenschutzausschuss hat am 8. Juli 2026 zwei Leitlinien vorgestellt. Beide sind Konsultationsfassungen, Stellungnahmen sind bis zum 30. Oktober 2026 möglich, Änderungen also noch zu erwarten. Die Scraping-Leitlinien stellen klar: Die DSGVO gilt, sobald beim Scraping personenbezogene Daten erhoben, gespeichert, geordnet oder abgerufen werden. Das berechtigte Interesse (Art. 6.1.f) bleibt die übliche Rechtsgrundlage privater Anbieter, verlangt aber eine dokumentierte Abwägung mit Schutzmaßnahmen: Quellen mit erkennbarem Widerspruch (etwa per robots.txt) ausschließen, Datenkategorien filtern, Risiken durch Memorisierung und Extraktion begrenzen. Für besondere Kategorien ist zusätzlich eine Ausnahme nach Art. 9 Abs. 2 nötig, eine pauschale Befreiung gibt es nicht.
Für Ihre Anbieterprüfung: Die Leitlinien richten sich an die Entwickler der Modelle. Sie liefern Ihnen aber den Fragenkatalog für die Beschaffung, denn laut EDPB-Stellungnahme 28/2024 kann ein mit rechtswidrig verarbeiteten Daten entwickeltes Modell die Rechtmäßigkeit seines Einsatzes beeinträchtigen, sofern es nicht wirksam anonymisiert wurde. Fragen Sie Anbieter deshalb nach Herkunft der Trainingsdaten, Rechtsgrundlage, Filter- und Ausschlussmechanismen sowie Maßnahmen gegen Memorisierung, und dokumentieren Sie die Antworten.
Die deutschen Aufsichtsbehörden sind sich nicht einig – das ist für Ihre Compliance relevant.
"Ein LLM stellt keine personenbezogenen Daten im Sinne des Art. 4 Nr. 1 DSGVO dar. In LLMs werden keine personenbezogenen Daten gespeichert."
Interpretation: Das Modell selbst ist nicht personenbezogen – nur Input/Output können es sein.
"Ein Personenbezug kann durch Interaktionen entstehen – etwa bei schlecht anonymisierten Trainingsdaten oder 'Model Attacks', mit denen personenbezogene Daten generiert werden."
Interpretation: Unter bestimmten Umständen kann das Modell selbst personenbezogen sein.
Für Ihre Praxis: Gehen Sie vom konservativeren Ansatz aus. Behandeln Sie LLM-Systeme so, als könnten sie personenbezogene Daten verarbeiten – dann sind Sie auf der sicheren Seite.
Offensichtlich:
"Schreibe eine E-Mail an [email protected] bezüglich seiner Bestellung #12345"
→ Name, E-Mail, Bestellnummer = personenbezogene Daten im Prompt
Weniger offensichtlich:
"Fasse die Beschwerde zusammen: 'Ich habe seit 3 Monaten Rückenschmerzen...'"
→ Gesundheitsdaten (Art. 9 – besondere Kategorie!)
Noch weniger offensichtlich:
"Analysiere diese Verkaufszahlen: Region Nord, Team Müller, Q3 2024"
→ "Team Müller" kann eine identifizierbare Person sein
Wenn Sie ein LLM fine-tunen oder RAG mit Unternehmensdaten aufbauen:
Die neue DSK-Orientierungshilfe zu RAG (Oktober 2025) adressiert genau diese Risiken.
LLMs generieren manchmal personenbezogene Daten:
Die Frage: Welche Rechtsgrundlage haben Sie für die Verarbeitung?
| Rechtsgrundlage | Geeignet für | Einschränkungen |
|---|---|---|
| Einwilligung (6.1.a) | Consumer-Apps mit Opt-in | Widerrufbar, dokumentationspflichtig |
| Vertragserfüllung (6.1.b) | Wenn LLM für Vertragsleistung nötig | Nur für tatsächlich erforderliche Daten |
| Berechtigtes Interesse (6.1.f) | Enterprise-Chatbots, interne Tools | Interessenabwägung dokumentieren! |
Für besondere Kategorien (Art. 9): Gesundheit, Biometrie, Religion → Ausdrückliche Einwilligung oder andere Art. 9-Grundlage nötig.
Das Problem:
Lösung:
LLMs sind "datenmaximierend" – mehr Kontext = bessere Antworten. Das steht im Konflikt mit DSGVO-Minimierung.
Praktische Umsetzung:
# Schlecht: Alle verfügbaren Daten
prompt = f"""Der Kunde {name} (geb. {geburtsdatum}, Steuer-ID {steuer_id})
hat eine Beschwerde über Produkt X eingereicht."""
# Besser: Nur das Nötige
prompt = f"""Ein Kunde hat eine Beschwerde über Produkt X eingereicht."""
Technische Lösung: PII-Redaction vor dem LLM-Call (siehe Architektur-Pattern unten).
Das noyb-Problem: ChatGPT halluzinierte falsche Informationen über reale Personen – falsches Geburtsdatum, im zweiten Fall sogar "Kindermörder"-Behauptung.
Ihre Pflicht als Betreiber:
Provider-Vergleich (Stand Dezember 2025):
| Provider | Consumer | Enterprise |
|---|---|---|
| OpenAI (ChatGPT) | 30 Tage (API), Training möglich | Keine Speicherung, kein Training |
| Anthropic (Claude) | 30 Tage (API) | Keine Speicherung (Team/Enterprise) |
| Microsoft (Azure OpenAI) | 30 Tage | Opt-out verfügbar |
| Google (Vertex AI) | Variabel | Keine Speicherung (Enterprise) |
Consumer-Versionen (ChatGPT Free, Claude Free, Gemini):
Risiken bei Cloud-LLMs:
Dokumentation, die Sie nachweisen können müssen:
| Dokument | Pflicht | Inhalt |
|---|---|---|
| Verzeichnis der Verarbeitungstätigkeiten (Art. 30) | Ja | Alle LLM-Systeme mit Zweck, Rechtsgrundlage, Kategorien |
| Datenschutz-Folgenabschätzung (Art. 35) | Bei High-Risk | Risikobewertung, Maßnahmen |
| AVV mit Providern (Art. 28) | Ja | Siehe unten |
| Technische und organisatorische Maßnahmen | Ja | PII-Redaction, Logging, Access Control |
Die Anforderung: "Welche Daten verarbeiten Sie über mich?"
Das Problem: Können Sie alle Prompts mit dieser Person finden? Alle RAG-Dokumente? Alle Outputs?
Technische Lösung:
Das noyb-Problem: OpenAI sagte, Berichtigung sei "technisch nicht möglich".
| System-Typ | Berichtigungsmöglichkeit |
|---|---|
| RAG | Quelldaten korrigieren (machbar) |
| Fine-Tuned | Model neu trainieren (aufwändig) |
| Base Model | Nicht möglich (nicht Ihr Problem) |
Workaround: Output-Filter für bekannte Fehler ("Erwähne Person X nicht mehr").
Die Anforderung: "Löschen Sie alle Daten über mich."
Was technisch möglich ist:
| Komponente | Löschung möglich? | Aufwand |
|---|---|---|
| Prompts/Logs | Ja | Gering |
| RAG-Dokumente | Ja | Gering |
| Fine-Tuning-Daten | Ja (Re-Training nötig) | Hoch |
| Base Model | Nein | — |
Position des HmbBfDI:
"Eine Löschung aus dem trainierten Model ist nicht erforderlich, wenn technisch nicht möglich. Aber: Outputs filtern, um die Person nicht mehr zu erwähnen."
Ihre Dokumentation sollte enthalten: Warum vollständige Löschung technisch nicht möglich ist, welche Ersatzmaßnahmen Sie ergreifen.
Wenn Sie Cloud-LLMs nutzen: Sie sind Verantwortlicher, der Provider ist Auftragsverarbeiter.
| Provider | AVV/DPA | EU-Hosting | Training mit Ihren Daten |
|---|---|---|---|
| OpenAI Enterprise | ✓ | ✓ (Option) | ✗ Nein |
| Azure OpenAI | ✓ | ✓ EU | ✗ Nein |
| Anthropic Enterprise | ✓ | ✓ EU | ✗ Nein |
| AWS Bedrock | ✓ | ✓ EU | ✗ Nein |
| Google Vertex AI | ✓ | ✓ EU | ✗ Nein |
Consumer-Versionen: Kein echter AVV möglich, Daten können für Training verwendet werden. Nicht für Unternehmensdaten.
| Aspekt | Cloud-LLM | Self-Hosted |
|---|---|---|
| Drittland-Transfer | Ja (meist US) | Nein |
| AVV nötig | Ja | Nein |
| Kontrolle über Daten | Eingeschränkt | Vollständig |
| Training mit Ihren Daten | Provider-abhängig | Sie entscheiden |
| Löschung | Eingeschränkt | Vollständig |
| Modell | Herkunft | Lizenz | DSGVO-relevant |
|---|---|---|---|
| Llama 3.x | Meta (US) | Permissive | Kein Drittland-Transfer beim Betrieb |
| Mistral | Mistral AI (FR) | Apache 2.0 | EU-Anbieter |
| Mixtral | Mistral AI (FR) | Apache 2.0 | EU-Anbieter |
| Qwen | Alibaba (CN) | Permissive | Herkunft dokumentieren |
Mapping lokal gespeichert (verschlüsselt)
Vorteil: Personenbezogene Daten verlassen nie Ihre Infrastruktur. Der LLM-Provider sieht nur Platzhalter.
support-agent-team-nordOhne Access Control: Ein Query über Produkte könnte Kundendaten retrieven, für die der User keine Berechtigung hat. Row-Level-Security von Anfang an implementieren.
| Prüfpunkt | Aktion bei Lücke |
|---|---|
| Welche LLMs sind im Einsatz? | Inventar erstellen (Consumer vs. Enterprise) |
| Gehen PII in Prompts? | Data Flow Mapping durchführen |
| Existieren AVVs mit Providern? | Fehlende AVVs einfordern |
| Kann der Anbieter die Herkunft seiner Trainingsdaten belegen? | Nachweise nach EDPB-Leitlinien 03/2026 anfordern |
| Consumer-Versionen für Geschäftsdaten? | Sofort stoppen |
| Maßnahme | Verantwortlich | Priorität |
|---|---|---|
| Enterprise-Pläne für alle geschäftlichen Anwendungen | IT/Procurement | Hoch |
| PII-Redaction evaluieren/implementieren | Engineering | Hoch |
| Verarbeitungsverzeichnis um LLM-Systeme erweitern | DSB | Mittel |
| Datenschutzhinweise aktualisieren | Legal/DSB | Mittel |
| Maßnahme | Verantwortlich | Priorität |
|---|---|---|
| DSFA für High-Risk-KI-Systeme | DSB + Engineering | Hoch |
| Prozesse für Betroffenenrechte bei LLMs | DSB + Engineering | Mittel |
| Privacy by Design als Standard | CTO/Engineering | Mittel |
| Self-Hosted-Optionen für sensitive Daten | Infrastructure | Niedrig |
"Wenn ein Betroffener nach Art. 15 Auskunft verlangt: Können Sie alle Verarbeitungen in LLM-Systemen nachweisen, die diese Person betreffen?"
Wenn die Antwort nicht "Ja" ist, haben Sie eine Lücke in Ihrer Dokumentation.
Für Vorträge, Interviews und fachlichen Austausch erreichen Sie mich direkt. Projekte und Beratung laufen über meinen Arbeitgeber ADVISORI, den Kontakt stelle ich gern her.