Ein Vertragsentwurf, ein Arztbrief, eine Gehaltsabrechnung, ein Angebot mit voller Kalkulation. Ausgerechnet die Dokumente, bei denen eine schnelle Zusammenfassung am meisten Arbeit spart, sind die heiklen. Ob ein Werkzeug technisch damit umgehen kann, ist dabei die einfachste aller Fragen. Schwieriger wird es bei der Frage, wer die Datei danach noch zu sehen bekommt und was passiert, wenn die falsche Person sie liest.
Dieser Ratgeber sortiert das Thema entlang der Fragen, die in der Praxis auftauchen. Er beschreibt, was beim Upload technisch geschieht, wie sich die Tarife der großen Anbieter beim Training unterscheiden, welche Verträge nötig sind, welche Berufsgruppen strenger gebunden sind und wie du ein Dokument so vorbereitest, dass es überhaupt hinausgehen darf. Alle Angaben haben den Stand vom 31. August 2026.
Was passiert technisch, wenn ich ein PDF bei einer KI hochlade?
Zwischen dem Klick auf die Büroklammer und der ersten Antwort liegen mehrere Verarbeitungsschritte, die vollständig auf fremden Rechnern ablaufen.
Vom PDF zum durchsuchbaren Zahlenraum
Zuerst öffnet ein Parser (ein Auslese-Programm) die Datei und trennt Text von Layout. Kopf- und Fußzeilen fliegen raus, Tabellen werden erkannt, das Ergebnis wird in kleine Abschnitte zerlegt, meist einige hundert Zeichen lang. Jeder Abschnitt wandert durch ein Embedding-Modell und wird zu einem Vektor, also einer langen Zahlenreihe, die die Bedeutung des Textes abbildet. Diese Vektoren landen in einer Vektordatenbank. Stellst du eine Frage, sucht das System die inhaltlich passenden Abschnitte heraus und legt sie dem Sprachmodell zusammen mit deiner Frage vor. Das Verfahren heißt Retrieval Augmented Generation, kurz RAG, und steckt in fast jedem Werkzeug, das mit hochgeladenen Dateien arbeitet.
Für den Datenschutz ist daran ein Punkt entscheidend. Dein Dokument liegt nach dem Upload in mehreren Fassungen beim Anbieter, nämlich als Originaldatei, als extrahierter Rohtext, als Sammlung von Textabschnitten und als Vektorindex. Wer die Datei löscht, hat damit nicht zwangsläufig alle abgeleiteten Fassungen erwischt.
Wie lange die Datei auf dem Server bleibt
Die Anbieter nennen dafür eigene Fristen, die sich je nach Tarif und Funktion unterscheiden. Üblich sind 30 Tage für gelöschte Inhalte, dazu kommen Sicherungskopien und Protokolle für die Missbrauchserkennung, die länger bestehen können. Bei ChatGPT zeigt ein laufendes US-Verfahren, wie wenig belastbar solche Fristen im Ernstfall sind. Im Rechtsstreit mit der New York Times bestätigte das Gericht im Januar 2026 die Anordnung, 20 Millionen anonymisierte Chatprotokolle herauszugeben. Das Verfahren ist nicht rechtskräftig abgeschlossen, es zeigt aber, dass eine gerichtliche Aufbewahrungsanordnung jede Löschroutine aushebeln kann.
Werden meine hochgeladenen PDFs zum Training verwendet?
Das hängt weniger vom Anbieter ab als vom gebuchten Tarif, und genau diese Unterscheidung geht im Alltag oft unter.
Kostenlose Konten und private Abos
Bei OpenAI werden Eingaben aus den Privattarifen standardmäßig für die Modellverbesserung genutzt, solange du die Einstellung nicht abschaltest. Das betrifft Free, Plus und Pro gleichermaßen. Anthropic hat seine Verbraucherbedingungen Ende August 2025 umgestellt, wirksam im Herbst 2025. Seitdem können Chats aus Free, Pro und Max in die Modellverbesserung einfließen, wenn die entsprechende Einstellung aktiv ist. Wer zustimmt, akzeptiert zugleich eine Aufbewahrung von bis zu fünf Jahren statt der sonst geltenden 30 Tage. Das gilt auch für Dokumente, die du Claude in einen Chat legst.
Google beschreibt für Gemini Notebook (früher NotebookLM) einen anderen Weg. Die eingespeisten Quellen fließen nach Angaben des Unternehmens nicht direkt in das Training der Basismodelle, solange du kein Feedback abgibst. Bewertest du eine Antwort, können Prompt, Quelle und Ausgabe von geschulten Teams gesichtet und bis zu drei Jahre getrennt vom Konto aufbewahrt werden. In Workspace- und Education-Konten entfällt beides.
Team-, Business- und Enterprise-Tarife
In den Geschäftstarifen dreht sich das Bild. OpenAI nutzt Eingaben aus Team, Enterprise und der API nach eigenen Angaben standardmäßig nicht für das Training, Anthropic handhabt das für Team, Enterprise und API ebenso. Beide Anbieter stellen für diese Tarife einen Auftragsverarbeitungsvertrag bereit, Enterprise-Kunden können zusätzlich eine Datenhaltung in der EU vereinbaren. Für Google Workspace gilt, dass Eingaben weder für das Training verwendet noch von Menschen gesichtet werden.
Daraus folgt eine klare Linie für den Berufsalltag. Ein Gratiskonto eignet sich für Material, das ohnehin öffentlich ist. Sobald fremde Daten im Spiel sind, führt der Weg über einen Geschäftstarif.
Reicht es, das Training in den Einstellungen abzuschalten?
Der Schalter hilft, er löst aber nur einen Teil des Problems.
- Er wirkt in der Regel ab dem Zeitpunkt des Umlegens, ältere Eingaben bleiben davon unberührt.
- Die Speicherung selbst endet nicht, das Dokument liegt weiter beim Anbieter.
- Mitarbeitende des Anbieters können im Rahmen der Missbrauchsprüfung weiterhin Zugriff auf Inhalte haben.
- Die Übermittlung in ein Drittland außerhalb der EU findet trotzdem statt und braucht eine eigene Rechtsgrundlage.
- Ohne Auftragsverarbeitungsvertrag fehlt die vertragliche Basis für die Verarbeitung fremder Daten, unabhängig von jeder Trainingseinstellung.
Der Schalter ist damit eine Mindestmaßnahme für Privatnutzung. Als Nachweis gegenüber einer Aufsichtsbehörde taugt er allein nicht.
Wann brauche ich einen Auftragsverarbeitungsvertrag für KI-Tools?
Sobald ein Anbieter personenbezogene Daten in deinem Auftrag verarbeitet, verlangt Artikel 28 der Datenschutz-Grundverordnung einen Vertrag über die Auftragsverarbeitung, kurz AVV.
Was in einem AVV stehen muss
Artikel 28 Absatz 3 DSGVO listet die Pflichtbestandteile auf. Dazu gehören die Bindung an deine Weisungen, technische und organisatorische Schutzmaßnahmen, die Regelung zu Unterauftragnehmern, die Vertraulichkeitsverpflichtung der eingesetzten Personen, die Unterstützung bei Auskunfts- und Löschbegehren, die Löschung oder Rückgabe der Daten nach Vertragsende sowie Nachweis- und Prüfrechte. Bei KI-Diensten kommen drei Punkte hinzu, auf die du gezielt schauen solltest: der ausdrückliche Ausschluss der Trainingsnutzung, der Ort der Verarbeitung und die Grundlage für die Übermittlung in die USA.
Fehlt der Vertrag, ist die Verarbeitung angreifbar. Der Bußgeldrahmen für Verstöße gegen Artikel 28 liegt bei bis zu zehn Millionen Euro oder zwei Prozent des weltweiten Jahresumsatzes, je nachdem, welcher Betrag höher ist.
Wann du keinen brauchst
Drei Fälle kommen ohne AVV aus. Rein private Nutzung für eigene Zwecke fällt unter die Haushaltsausnahme der DSGVO. Ein Modell, das vollständig auf deiner eigenen Hardware läuft, hat gar keinen externen Dienstleister. Ein Dokument ohne jeden Personenbezug löst die Vertragspflicht ebenfalls nicht aus, wobei genau dieser Nachweis in der Praxis schwerer zu führen ist, als er klingt.
Was gilt für Ärzte, Anwälte und andere Schweigepflichtige?
Für Berufsgeheimnisträger reicht das Datenschutzrecht als Prüfmaßstab nicht aus, weil zusätzlich das Strafrecht greift.
Warum ein Upload schon eine Offenbarung sein kann
Paragraf 203 des Strafgesetzbuchs stellt das unbefugte Offenbaren fremder Geheimnisse unter Strafe, mit einem Rahmen von Geldstrafe bis zu einem Jahr Freiheitsstrafe. Erfasst sind unter anderem Ärztinnen und Ärzte, Zahnärzte, Apotheker, Psychotherapeuten, Rechtsanwälte, Notare, Steuerberater und Wirtschaftsprüfer. Eine Offenbarung liegt bereits vor, wenn die Information in die Sphäre eines Dritten gelangt, der sie zur Kenntnis nehmen könnte. Ein Patientenbrief, der zur Zusammenfassung an einen Cloud-Dienst geht, erfüllt diese Bedingung ohne Weiteres.
Was Berufsgeheimnisträger zusätzlich zum AVV brauchen
Seit der Neuregelung von 2017 dürfen Berufsgeheimnisträger externe Dienstleister einbinden, wenn sie diese sorgfältig auswählen und ausdrücklich zur Geheimhaltung verpflichten. Der Dienstleister wird dadurch selbst an die Schweigepflicht gebunden. Für KI-Dienste bedeutet das zwei Verträge, den datenschutzrechtlichen AVV und eine gesonderte Verschwiegenheitsvereinbarung. Die Standardtarife der großen US-Anbieter enthalten Letztere üblicherweise nicht, weshalb sich am Markt spezialisierte Anbieter mit einem eigenen Modus für Berufsgeheimnisträger positionieren. Welche Werkzeuge in diesem Umfeld überhaupt in Frage kommen, ordnet der Beitrag zu KI in der Kanzlei genauer ein.
Verliere ich mein Betriebsgeheimnis, wenn ich es hochlade?
Diese Sorge ist berechtigt, und sie betrifft einen Punkt, der oft übersehen wird.
Das Geschäftsgeheimnisgesetz schützt eine Information nur dann, wenn sie geheim ist, wirtschaftlichen Wert hat und Gegenstand angemessener Geheimhaltungsmaßnahmen ist. Fällt die dritte Bedingung weg, entfällt der Schutz insgesamt, und mit ihm die Möglichkeit, gegen einen Abfluss vorzugehen. Einen gesetzlichen Standard für die Angemessenheit gibt es nicht, entschieden wird im Einzelfall. Ein Kalkulationsblatt, das ein Mitarbeiter in ein privates Gratiskonto mit aktivierter Trainingsnutzung schiebt, lässt sich schwer als geschützt darstellen.
Praktisch heißt das, wer Betriebsgeheimnisse schützen will, braucht eine schriftliche KI-Richtlinie, eine Liste freigegebener Werkzeuge, dokumentierte Schulungen und im besten Fall technische Sperren für nicht freigegebene Dienste. Diese Unterlagen sind später der Beleg dafür, dass Maßnahmen bestanden.
Welche Angaben in einem PDF sind überhaupt personenbezogen?
Der Begriff ist weiter gefasst, als die meisten vermuten, weil jede Angabe zählt, über die sich eine Person bestimmen lässt.
- Namen, Anschriften, Telefonnummern, private und dienstliche E-Mail-Adressen
- Kunden-, Personal-, Versicherten- und Steuernummern sowie Aktenzeichen
- Kontodaten, Kennzeichen, Vertragsnummern, IP-Adressen
- Unterschriften, Fotos und handschriftliche Vermerke am Rand
- Metadaten der Datei, also Autorenfeld, Bearbeiterkürzel, Kommentare und Änderungsverlauf
Eine eigene Kategorie bilden besonders schützenswerte Daten nach Artikel 9 DSGVO, darunter Gesundheitsdaten, Angaben zu Religion, Gewerkschaftszugehörigkeit, Sexualleben und biometrische Merkmale. Für sie gilt ein grundsätzliches Verarbeitungsverbot mit engen Ausnahmen. Ein Befund, ein Kündigungsschutzverfahren oder ein sonderpädagogisches Gutachten fällt darunter. Wie sensibel schon scheinbar harmlose Listen sein können, zeigt der Beitrag zu KI und Datenschutz an Schulen, wo Klassenlisten und Förderpläne dieselbe Prüfung durchlaufen müssen.
Wie schwärze ich ein PDF richtig, bevor ich es hochlade?
Schwärzen ist der wirksamste Zwischenweg, wenn du auf die Auswertung nicht verzichten willst, und zugleich die häufigste Fehlerquelle.
Warum das schwarze Rechteck oft nichts bringt
Ein Rechteck, das du in einem Vorschauprogramm über eine Zeile legst, verdeckt den Text optisch. In der Dateistruktur bleibt er bestehen. Er lässt sich markieren, kopieren, per Textextraktion auslesen und damit auch von jedem Parser verarbeiten, der das Dokument für die KI vorbereitet. Echte Schwärzung entfernt die Textobjekte physisch aus der Datei und ersetzt sie durch eine Fläche. Diese Funktion heißt in den Programmen meist Schwärzen oder Redaktion und ist von einer einfachen Zeichenfunktion zu unterscheiden. Nach dem Schwärzen gehört ein zweiter Durchgang dazu, der versteckte Informationen entfernt, also Metadaten, Kommentare, eingebettete Vorschaubilder und Ebenen.
Praktische Beispiele für den Austausch von Namen und Zahlen
Statt alles zu schwärzen, kannst du ersetzen, damit der Text lesbar bleibt und die Auswertung trotzdem funktioniert.
- Aus „Frau Kerstin Obermeier, Rosenweg 4, 93049 Regensburg“ wird „Frau A., Ort A“.
- Aus „Rechnungsbetrag 48.213,90 Euro“ wird „Rechnungsbetrag im mittleren fünfstelligen Bereich“, sofern die genaue Zahl für die Frage keine Rolle spielt.
- Aus „Vertragsbeginn 14.03.2024“ wird „Vertragsbeginn Frühjahr 2024“.
- Aus „Aktenzeichen 4 O 218/25“ wird „Aktenzeichen X“.
- Firmennamen, Produktbezeichnungen und Standorte bekommen durchgehende Platzhalter wie „Anbieter 1“ und „Werk Süd“.
Die Zuordnungsliste, welcher Platzhalter für wen steht, bleibt auf deinem Rechner. Sie ist der Teil, der das Dokument wieder identifizierbar machen würde.
Warum geschwärzt nicht gleich anonym ist
Der Europäische Gerichtshof hat am 4. September 2025 in der Sache C-413/23 P entschieden, dass der Personenbezug relativ zu beurteilen ist. Für einen Empfänger ohne Zusatzwissen kann ein pseudonymisierter Datensatz anonym sein, während er für die Stelle, die den Schlüssel besitzt, personenbezogen bleibt. Übertragen auf deinen Upload heißt das, dass ein sauber pseudonymisiertes Dokument beim Anbieter als anonym gelten kann, dich selbst aber weiterhin in der Pflicht hält. Bei kleinen Fallzahlen und markanten Details bleibt die Identifizierung ohnehin möglich, ein Dorfarzt mit drei Patienten desselben Krankheitsbildes ist auch ohne Namen erkennbar.
Sind lokale KI-Modelle die Lösung für vertrauliche Dokumente?
Für streng vertrauliches Material sind sie der einzige Weg, bei dem die Datei den eigenen Rechner nie verlässt.
Was du dafür an Technik brauchst
Verbreitet sind drei Wege. Ollama ist eine schlanke Laufzeitumgebung, die Modelle lädt und über eine lokale Schnittstelle bereitstellt. LM Studio bietet dasselbe mit Oberfläche und Modellkatalog. llama.cpp ist die technisch nächstliegende Variante für alle, die selbst schrauben wollen. Als Ausstattung gelten 16 GB Arbeitsspeicher als Untergrenze, 32 GB machen die Arbeit mit größeren Modellen erst angenehm. Kleine Modelle im Bereich von drei bis fünf Gigabyte laufen auf fast jedem aktuellen Rechner. Ein AVV entfällt, weil kein externer Dienstleister beteiligt ist.
Wo lokale Modelle an Grenzen stoßen
Die Antwortqualität liegt unterhalb der großen Cloud-Modelle, besonders bei langen Dokumenten, verschachtelten Tabellen und juristischer Feinarbeit. Die Einrichtung kostet Zeit, Modelle und Bibliotheken wollen gepflegt werden, und die Sicherheit hängt am Zustand des Geräts. Ein lokales Modell auf einem ungesicherten Notebook ohne Festplattenverschlüsselung verschiebt das Risiko lediglich. Für viele Aufgaben lohnt der Mittelweg, also lokale Vorverarbeitung mit Schwärzung und anschließende Auswertung des bereinigten Dokuments in der Cloud.
Was ist bei gescannten PDFs und Fotos von Dokumenten anders?
Ein Scan enthält keinen auslesbaren Text, sondern ein Bild, und das ändert die Lage in beide Richtungen.
Zuerst muss der Anbieter eine Texterkennung über die Seite laufen lassen, die Datei wird also zusätzlich durch einen OCR-Dienst geschickt. Das Bild transportiert dabei mehr als den Wortlaut. Briefkopf, Stempel, Unterschrift, handschriftliche Randnotizen und Vermerke einer dritten Person reisen mit, obwohl sie mit deiner Frage nichts zu tun haben. Bei Fotos kommen Standort- und Gerätedaten aus den EXIF-Feldern hinzu.
Schwärzen funktioniert hier anders. Weil kein Textlayer existiert, musst du die Stelle im Bild überdecken und die Seite anschließend neu ausgeben, damit die ursprüngliche Bildinformation verschwindet. Ein nachträglich eingefügter OCR-Layer wird sonst leicht übersehen und enthält den Klartext weiterhin. Wer regelmäßig Scans auswertet, sollte den Weg über ein Werkzeug gehen, das echte Schwärzung inklusive Neu-Rasterung beherrscht.
Wie riskant ist es, Cloud-Speicher an ein KI-Tool anzubinden?
Konnektoren zu Google Drive, OneDrive, SharePoint, Dropbox oder Box sind der Kanal, an den beim Thema Upload kaum jemand denkt.
Der Reiz ist verständlich, weil das Werkzeug damit direkt auf den Dokumentenbestand zugreift und niemand mehr Dateien einzeln anhängen muss. Genau darin liegt das Problem. Der Zugriff folgt den Berechtigungen des angemeldeten Kontos, und die sind in gewachsenen Ablagen selten so eng, wie sie sein sollten. Ein Ordner, den vor drei Jahren jemand für die ganze Abteilung freigegeben hat, wird damit Teil der Wissensbasis.
Hinzu kommt eine Angriffsart, die auf der Sicherheitskonferenz Black Hat vorgeführt wurde. Über eine indirekte Prompt-Injection genügte ein präpariertes Dokument in einem verbundenen Speicher, um Daten aus diesem Speicher abzuziehen. Der Anweisungstext steckte im Dokument selbst und wurde vom Modell wie eine Nutzereingabe behandelt. In der EU, der Schweiz und Großbritannien sind einzelne dieser Konnektoren derzeit ohnehin nicht verfügbar. Wo sie freigeschaltet werden, gehört die Entscheidung in die Hand der Administration, verbunden mit einer Prüfung der Freigaben im Speicher selbst.
Was ändert der EU AI Act für den Upload vertraulicher PDFs?
Die KI-Verordnung regelt Anbieter und Betreiber von KI-Systemen und tritt neben die DSGVO, ohne sie zu ersetzen.
Der Zeitplan läuft gestaffelt. Seit Februar 2025 gelten die Verbote bestimmter Praktiken sowie die Pflicht zur KI-Kompetenz, die auch Unternehmen trifft, die fremde Werkzeuge nur einsetzen. Beschäftigte müssen also wissen, was sie tun, und das schließt den Umgang mit Dokumenten ein. Seit August 2025 gelten die Pflichten für Anbieter von Allzweckmodellen, seit dem 2. August 2026 die Transparenzpflichten nach Artikel 50, etwa die Kennzeichnung von KI-erzeugten Inhalten und Deepfakes. Die Pflichten für Hochrisiko-Systeme wurden über das Digital-Omnibus-Paket im Sommer 2026 nach hinten verschoben, auf Dezember 2027 für die Anwendungsfälle aus Anhang III und August 2028 für Anhang I.
Für die Frage, ob ein bestimmtes PDF hochgeladen werden darf, bleibt damit die DSGVO der Maßstab. Der AI Act liefert die Pflicht, die eigenen Leute zu schulen und den Einsatz zu dokumentieren.
Was passiert, wenn doch etwas Vertrauliches hochgeladen wurde?
Der Fehler ist häufiger, als Unternehmen glauben, und die Reaktion darauf entscheidet über die Folgen.
Landet ein Dokument mit fremden personenbezogenen Daten in einem nicht freigegebenen Dienst, liegt in aller Regel eine Verletzung des Schutzes personenbezogener Daten im Sinne von Artikel 4 Nummer 12 DSGVO vor. Daraus folgt die Meldung an die zuständige Aufsichtsbehörde binnen 72 Stunden ab Kenntnis nach Artikel 33. Besteht ein hohes Risiko für die Betroffenen, kommt deren Benachrichtigung nach Artikel 34 hinzu. Jeder Vorfall gehört ins interne Verzeichnis, auch der, den du am Ende als nicht meldepflichtig einstufst.
Praktisch sind fünf Schritte sinnvoll: den Chat und die hochgeladene Datei im Konto löschen, die Trainingseinstellung prüfen und die Löschung dokumentieren, den Umfang der betroffenen Daten festhalten, die Datenschutzbeauftragte einbinden und die Fristen ab Kenntnis rechnen. Dass Aufsichtsentscheidungen in diesem Feld noch nicht gefestigt sind, zeigt das Verfahren der italienischen Behörde gegen OpenAI. Das Bußgeld von 15 Millionen Euro aus dem Dezember 2024 wurde vom Gericht in Rom im März 2026 aufgehoben. Verlassen solltest du dich darauf nicht, weil jede Behörde eigenständig entscheidet.
Welches Werkzeug passt zu welcher Vertraulichkeitsstufe?
Statt einer pauschalen Erlaubnis oder eines Verbots hilft eine Einteilung in vier Stufen, die sich in jedem Team vermitteln lässt.
- Öffentlich: Broschüren, veröffentlichte Studien, Gesetzestexte, eigene Webseiteninhalte. Hier ist jedes Werkzeug vertretbar, auch spezialisierte Dienste wie ChatPDF oder Ask Your PDF.
- Intern ohne Personenbezug: Prozessbeschreibungen, Schulungsunterlagen, anonymisierte Auswertungen. Geschäftstarif mit abgeschaltetem Training, AVV vorhanden.
- Vertraulich mit Personenbezug: Verträge, Personalunterlagen, Kundenkorrespondenz. Geschäftstarif mit AVV, EU-Datenhaltung, dazu Schwärzung aller Angaben, die für die Frage nicht gebraucht werden.
- Streng vertraulich: Gesundheitsdaten, Mandatsunterlagen, Konstruktionsdaten, Unterlagen aus laufenden Verfahren. Lokales Modell oder ein Anbieter mit Verschwiegenheitsvereinbarung, sonst gar keine KI.
Für die ersten beiden Stufen lohnt ein Blick auf die Werkzeuge und Arbeitsweisen im Überblick zum Thema PDF mit KI zusammenfassen, weil dort die Frage der Qualität im Vordergrund steht.
Woran erkenne ich vor dem Hochladen, ob ein Dokument raus darf?
Sechs Fragen genügen, und sie sind in einer Minute beantwortet.
- Stehen Namen oder andere Angaben darin, über die sich eine Person bestimmen lässt?
- Gehören diese Daten mir selbst oder jemand anderem?
- Unterliege ich für diesen Inhalt einer beruflichen Schweigepflicht?
- Würde ein Wettbewerber aus dem Dokument einen Vorteil ziehen?
- Habe ich für das gewählte Werkzeug einen AVV, und ist das Training abgeschaltet?
- Brauche ich für meine Frage wirklich das vollständige Dokument?
Die letzte Frage ist die wirksamste. Sehr oft genügen zwei Absätze, eine Tabellenspalte oder eine Seite, um die Antwort zu bekommen, wegen der du das Werkzeug überhaupt geöffnet hast. Datensparsamkeit ist in diesem Fall kein abstrakter Grundsatz, sie spart auch Zeit und liefert präzisere Ergebnisse. Wer sich diese Routine einmal angewöhnt, verliert die Sorge vor dem Upload, weil klar ist, was in der Datei steht, bevor sie das eigene Gerät verlässt.