Lernziele
Sie können den Begriff des Kontextfensters (Context Window) erklären und seine praktische Bedeutung für die Analyse von CSV-Dateien und PDF-Dokumenten einschätzen.
Sie können berechnen oder schätzen, ob eine gegebene Datei in das Kontextfenster eines bestimmten Modells passt, und geeignete Strategien anwenden, wenn sie es nicht tut.
Sie können mindestens drei Strategien für den Umgang mit zu großen Datensätzen benennen und anwenden: Filterung vor Upload, Vorabaggregation, Chunking.
Sie können erklären, was bei einer Kontextfenster-Überschreitung passiert und warum das Halluzinationsrisiko in diesen Situationen erhöht ist.
Sie können PDF-Dokumente für eine strukturierte Analyse vorbereiten und geeignete Tools für verschiedene PDF-Typen (strukturiert vs. gescannt) auswählen.
Sie können NotebookLM für die simultane Analyse mehrerer PDF-Dokumente einsetzen.
Auf einen Blick
| Dauer | 45 Min |
| Methodik | Input + Diskussion |
| Vorwissen | UE 49–53 abgeschlossen; Grundverständnis Token aus Modul 1 |
| AI-Act-Kompetenz | Grundverständnis · Risiko-Bewusstsein (Art. 4 EU AI Act) |
| Querverweise | UE 53 (Code Interpreter Grundlage), UE 55 (Datenschutz), UE 59 (Grenzen statistischer Zuverlässigkeit) |
Worum geht es? — Der didaktische Einstieg
Sie haben 80.000 Zeilen Transaktionsdaten in einer CSV-Datei. Sie möchten diese in ChatGPT analysieren lassen. Sie laden die Datei hoch — und erhalten nach kurzer Zeit eine scheinbar fundierte Analyse mit konkreten Zahlen und Empfehlungen. Was Sie nicht sehen: ChatGPT hat nur die ersten 15.000 Zeilen verarbeitet, der Rest wurde still abgeschnitten. Die präsentierten Zahlen beziehen sich auf einen Bruchteil der Daten — aber ChatGPT sagt das nicht explizit.
Dieses Szenario ist kein theoretisches Risiko, sondern eine reale Falle, in die viele Nutzende tappen. Das Kontextfenster — die maximale Datenmenge, die ein Sprachmodell in einer Anfrage verarbeiten kann — ist eine der wichtigsten technischen Beschränkungen, die jeder kennen muss, der Daten mit KI analysiert.
Lerntext — Theorie und Konzepte
Das Kontextfenster als zentrale Beschränkung
Jedes Sprachmodell verarbeitet Eingaben innerhalb eines begrenzten Kontextfensters, gemessen in Token. Grobe Faustregel: 1 Token ≈ 0,75 Wörter (für deutschen Text) oder 4 Zeichen.
| Modell | Kontextfenster | Typische Datenmenge |
| GPT-4o | ~128.000 Token | ~95.000 Wörter / ~700 Seiten Text / ~10.000 CSV-Zeilen |
| Claude 4 Sonnet | ~200.000 Token | ~150.000 Wörter / ~1.100 Seiten / ~15.000 CSV-Zeilen |
| Gemini 2.5 Pro | ~1.000.000 Token | ~750.000 Wörter / ~5.500 Seiten / ~75.000 CSV-Zeilen |
Merksatz
Das gefährlichste Szenario bei Kontextfenster-Überschreitung ist das stille Abschneiden: Die KI-Ausgabe sieht vollständig und fundiert aus, bezieht sich aber nur auf einen Teil der Daten. Immer die Zeilenanzahl im explorativen Einstiegsprompt bestätigen lassen.
Was passiert bei Kontextfenster-Überschreitung?
Stilles Abschneiden (Truncation): Das häufigste und gefährlichste Szenario.
Explizite Fehlermeldung: In einigen Fällen gibt das System eine Fehlermeldung aus.
Verarbeitungsfehler oder unvollständige Ausgabe: Bei Code-Interpreter-Analysen.
Strategien für große Datensätze
Strategie 1 — Filterung vor dem Upload: Die effektivste und schnellste Methode. Statt 100.000 Zeilen hochzuladen, filtern Sie in Excel auf die relevante Teilmenge.
Strategie 2 — Vorabaggregation: Statt Rohdaten hochzuladen, eine Pivot-Aggregation exportieren. Das reduziert die Datenmenge um 99 % bei Beibehaltung der analytisch relevanten Informationen.
Strategie 3 — Chunking: Die Datei in logische Segmente aufteilen (z. B. nach Quartal), jedes Segment separat analysieren, und abschließend die KI die Teilanalysen synthetisieren lassen.
Strategie 4 — Modell mit größerem Kontextfenster: Für wirklich große Datensätze bietet Gemini 2.5 Pro mit 1-Mio-Token-Fenster erheblich mehr Spielraum.

Abb. 54.1 — Entscheidungsbaum: Welche Strategie für welche Datensatzgröße bei der LLM-Analyse?
PDF-Analyse mit LLMs
Gut geeignet: Strukturierte PDFs mit echtem Text (nicht gescannt), bis ca. 200 Seiten. Einsatzfelder: Vertragsanalyse (Fristen, Klauseln, Risiken), technische Dokumentation zusammenfassen, Jahresberichte auf relevante Kennzahlen durchsuchen.
Einschränkungen: Gescannte PDFs erfordern OCR-Vorverarbeitung. Tabellen in PDFs werden manchmal unzuverlässig extrahiert.
Empfohlene Tools: - ChatGPT (PDF-Upload direkt im Chat) - Claude (besonders stark bei langen Verträgen) - NotebookLM (Google): Ermöglicht das Hochladen mehrerer PDFs gleichzeitig mit automatischer Quellenangabe
Halluzinations-Risiko bei Kontext-Grenzen
Wenn das Modell wegen Datenmangels keine valide statistische Aussage treffen kann, kann es plausibel klingende, aber falsch berechnete Zahlen ausgeben. Gegenmaßnahme: Nach jeder KI-Datenanalyse stichprobenartig prüfen, ob die gemeldeten Aggregatwerte mit manuell nachvollziehbaren Teilmengen übereinstimmen.
Vertiefung — Erweiterte Strategien und praktische Entscheidungsregel
Stratifizierte Stichprobe: Statt die Datei zu filtern, kann eine repräsentative Zufallsstichprobe gezogen werden. Eine 5.000-Zeilen-Stichprobe aus einer 500.000-Zeilen-Datei liefert bei statistischen Analysen annähernd dieselben Erkenntnisse.
Spaltenauswahl: Analysieren Sie zunächst nur die Spalten, die für die Fragestellung relevant sind.
CSV-Qualität vor dem Upload: Konsistente Spaltennamen (ohne Leerzeichen, ohne Sonderzeichen), explizite Datumsformate (ISO 8601: YYYY-MM-DD), numerische Werte ohne Einheitenbezeichnungen, UTF-8 als Encoding.
Praktische Entscheidungsregel: - Datei unter 1 MB und unter 10.000 Zeilen → ChatGPT Code Interpreter - Datei zwischen 1–10 MB oder 10.000–100.000 Zeilen → Claude oder Gemini - Datei über 10 MB oder über 100.000 Zeilen → Stratifizierte Stichprobe oder Gemini 2.5 Pro - PDF unter 50 Seiten, nativ → Jedes der drei Tools geeignet - PDF über 50 Seiten oder Scan → Claude bevorzugen, OCR vorher
Merksatz
Vorabaggregation schlägt Rohdaten — eine 500-Zeilen-Pivot-Tabelle aus einem 100.000-Zeilen-Export liefert oft präzisere Analyse-Ergebnisse als der direkte Upload der Rohdaten, die das Kontextfenster überschreiten.
Branchen-Anwendungen
IT-Dienstleistung & Beratung
In IT-Beratungshäusern kommen sowohl große Projekt-Exporte als auch mehrseitige Kundendokumentationen vor. Das Wissen über Kontextfenster-Beschränkungen hilft dabei, realistische Erwartungen zu setzen und die richtige Tool-Wahl zu treffen. Konkrete Anwendungsfälle: Für die Analyse eines 150-seitigen IT-Ausschreibungsdokuments auf relevante Anforderungen eignet sich Claude aufgrund des größeren Kontextfensters besser als ChatGPT. Für die Analyse eines Jahres-Projektdaten-Exports mit 20.000 Zeilen empfiehlt sich eine Vorabaggregation nach Quartal und Projekttyp vor dem Upload. NotebookLM eignet sich besonders gut, wenn mehrere Verträge oder Spezifikationen zu einem Projekt vorliegen und über-Kreuz analysiert werden sollen.
Industrie & Fertigung
In Fertigungsunternehmen entstehen sehr große Datensätze durch kontinuierliche Maschinenprotokolle und Qualitätsprüfungen. Ein Jahresprotokoll einer automatischen Prüfanlage kann leicht 500.000 Zeilen umfassen — weit über dem Kontextfenster aller aktuellen Modelle. Die empfohlene Strategie: Vorabaggregation nach Schicht, Maschine und Fehlertyp (Pivot in Excel), dann Upload der aggregierten Tabelle. Alternativ: Filterung auf einen kritischen Zeitraum (z. B. den Monat mit der höchsten Ausschussquote) für eine gezielte Ursachenanalyse. Für PDF-Analysen: technische Datenblätter und Wartungshandbücher sind oft gescannt — OCR-Vorverarbeitung mit Adobe Acrobat oder pdfminer ist in diesem Fall erforderlich.
Finanzdienstleistung & Versicherung
In Finanzinstituten werden sehr große Transaktionsdatensätze und vielschichtige PDF-Dokumente (Jahresabschlüsse, Verträge, regulatorische Berichte) analysiert. Für Transaktionsdaten empfiehlt sich die Vorabaggregation auf monatliche oder tägliche Summen, bevor KI eingesetzt wird. Für Vertragsanalysen ist Claude besonders geeignet, da Vertragswerke oft 50–200 Seiten umfassen. NotebookLM ermöglicht den simultanen Vergleich mehrerer Vertragsversionen oder regulatorischer Dokumente — ein erheblicher Effizienzgewinn bei Compliance-Prüfungen.
Öffentliche Verwaltung
In Behörden werden große Datensätze (Bürgeranfragen-Datenbanken, Förderprogrammdaten) und vielschichtige PDF-Dokumente (Gesetzestexte, Verwaltungsvorschriften, Jahresberichte) analysiert. Für sehr große Verwaltungsdatenbanken mit Zehntausenden von Einträgen ist die Stratifizierte Stichprobe besonders nützlich: Eine repräsentative Zufallsstichprobe liefert bei statistischen Auswertungen annähernd dieselben Erkenntnisse wie der vollständige Datensatz. Für die Analyse langer Gesetzestexte (z. B. 200-seitige Ausführungsvorschriften) ist Claude mit seinem größeren Kontextfenster die erste Wahl.
Übung 1 — Kontextfenster-Planung für einen realen Datensatz
Übung 1 — Token-Schätzung und Strategie-Entscheidung
Aufgabe: Sie erhalten eine Beschreibung von drei verschiedenen Datensätzen. Für jeden bestimmen Sie: Passt er in das Kontextfenster von GPT-4o? Welche Strategie empfehlen Sie?
Material: Kein externes Tool nötig — theoretische Analyse und Diskussion.
Datensatz-Beschreibungen: - Datensatz A: Monatliche Umsatzzahlen für 200 Kunden über 3 Jahre (200 × 36 = 7.200 Zellen, rein numerisch, 7 Spalten) - Datensatz B: Alle Ticket-Beschreibungen aus dem Helpdesk der letzten 2 Jahre (45.000 Tickets, jedes mit 150–200 Wörtern Beschreibungstext) - Datensatz C: Aktueller Quartalsbericht als PDF, 45 Seiten, mit Tabellen und Grafiken
Schritt-für-Schritt: 1. Schätzen Sie für jeden Datensatz die ungefähre Token-Anzahl (1 Token ≈ 0,75 Wörter oder 4 Zeichen). 2. Vergleichen Sie mit dem GPT-4o-Limit (128.000 Token). 3. Wählen Sie für jeden Datensatz die geeignete Strategie. 4. Diskutieren Sie im Kurs: Welche Datensätze kommen in Ihrem Arbeitsalltag vor?
Erwartetes Ergebnis: Strategie-Entscheidung für alle drei Datensätze mit Token-Schätzung und Begründung.
Musterlösung: Datensatz A: ca. 36.000 Token — passt in GPT-4o, direkt hochladen. Datensatz B: ca. 8,8 Mio. Token — weit über allen Limits; Vorabaggregation oder Chunking nach Kategorie erforderlich. Datensatz C: ca. 29.000 Token — passt in GPT-4o; direkt hochladen, OCR-Qualität bei Grafiken prüfen.
Übung 2 — PDF-Analyse in der Praxis
Übung 2 — PDF-Extraktion und Qualitätsprüfung
Aufgabe: Laden Sie ein bereitgestelltes Beispiel-PDF (technische Spezifikation, ca. 20 Seiten) in ChatGPT oder Claude hoch und beantworten Sie drei vorgegebene Fragen. Dokumentieren Sie, welche Antworten korrekt, unklar oder unvollständig sind.
Material: ChatGPT Plus oder Claude.ai, Beispiel-PDF (vom Trainer bereitgestellt).
Schritt-für-Schritt: 1. Laden Sie das PDF hoch. 2. Fragen Sie: „Fasse die wichtigsten technischen Anforderungen in maximal 10 Stichpunkten zusammen.” 3. Fragen Sie: „Welche Fristen oder Termine werden im Dokument genannt? Liste alle mit Datum und Kontext.” 4. Fragen Sie: „Gibt es spezifische Qualitätssicherungsanforderungen? Wenn ja, welche?” 5. Prüfen Sie jede Antwort gegen das Original-PDF. 6. Notieren Sie Ihre Bewertung: Sehr gut / Gut / Lückenhaft / Fehlerhaft — mit Begründung.
Erwartetes Ergebnis: Bewertung der drei Antworten mit Begründung, Identifikation fragiler Bereiche.
Musterlösung: Bei strukturierten PDFs liefern LLMs für Zusammenfassungen und Listenfragen üblicherweise sehr gute Ergebnisse. Fragilere Bereiche: Tabellenwerte (gelegentlich falsch extrahiert), sehr spezifische Zahlenangaben, Inhalte in Fußnoten.
Cheatsheet — Die wichtigsten Punkte
1 Token ≈ 0,75 Wörter: Faustregel für Token-Schätzung
GPT-4o = 128k Token: ca. 10.000 CSV-Zeilen (numerisch)
Stilles Abschneiden: Das gefährlichste Szenario — keine Warnung, falsche Ergebnisse
Erst filtern: Vor dem Upload immer auf relevante Spalten und Zeitraum reduzieren
Aggregation schlägt Rohdaten: 500-Zeilen-Pivot oft besser als 100.000-Zeilen-Rohdaten
Claude für lange Docs: Größeres Kontextfenster für Verträge und lange Berichte
Gemini für Massendaten: 1-Mio-Token-Fenster für sehr große Datensätze
NotebookLM für PDF-Mehrfach: Mehrere PDFs gleichzeitig analysieren mit Quellenangaben
Zeilenanzahl bestätigen: Im explorativen Prompt immer Zeilenanzahl bestätigen lassen
Reflexionsfragen
Welche Datensätze oder Dokumente in Ihrem Arbeitsalltag übersteigen wahrscheinlich das Kontextfenster von GPT-4o — und welche Strategie würden Sie anwenden?
Wie erkennen Sie, ob eine KI-Analyse auf abgeschnittenen Daten basiert — welche Warnsignale gibt es?
Warum ist eine Vorabaggregation oft besser als die Rohdaten, auch wenn die Rohdaten ins Kontextfenster passen würden?
Für welche PDF-Analyse-Aufgaben würden Sie Claude dem ChatGPT vorziehen — und warum?
Wie würden Sie in einem Kunden-Meeting erklären, warum eine KI-basierte Analyse eines 200.000-Zeilen-Datensatzes eine Vorabfilterung erfordert?
Vertiefung — Chunk-Strategie im Detail: Wie man große Datensätze systematisch zerlegt
Die Chunk-Strategie ist der wichtigste Workaround für Datensätze, die das Kontext-Fenster des LLMs überschreiten. Hier die vollständige Implementierung:
Schritt 1 — Datensatz segmentieren:
import pandas as pd
df = pd.read_csv('grosser_datensatz.csv')
chunk_size = 1000 # Zeilen pro Chunk
chunks = [df[i:i+chunk_size] for i in range(0, len(df), chunk_size)]
print(f"Datensatz aufgeteilt in {len(chunks)} Chunks à {chunk_size} Zeilen")
Schritt 2 — Jeden Chunk einzeln analysieren: Für jeden Chunk denselben Analyse-Prompt verwenden. Ergebnisse in einer Zusammenfassungstabelle dokumentieren.
Schritt 3 — Aggregation der Chunk-Ergebnisse: Prompt: „Ich habe folgenden Datensatz in [N] Chunks analysiert. Hier sind die Ergebnisse je Chunk: [Tabelle]. Aggregiere diese zu einem Gesamtergebnis. Welche Muster sind über alle Chunks konsistent — und welche Chunks weichen vom Muster ab?”
Wichtiger Hinweis: Bei der Aggregation können Verzerrungen entstehen (z. B. wenn ein Chunk überproportional viele Ausreißer enthält). Dokumentieren Sie immer die Chunk-Größe und ob die Aufteilung zufällig oder nach einem Kriterium (z. B. nach Zeitraum) erfolgte.
Übung 6 — PDF-Analyse: Vertrag auf Schlüsselklauseln prüfen
Aufgabe: Analysieren Sie ein echtes oder fiktives Vertragsdokument auf relevante Klauseln.
Voraussetzung: Ein PDF-Dokument von mindestens 5 Seiten (eigener Lieferantenvertrag, AGB, Arbeitsvertrag — oder ein öffentlich zugängliches Vertragsmuster).
Prompt-Sequenz: 1. „Extrahiere alle Zahlungsbedingungen aus diesem Vertrag. Liste sie als strukturierte Tabelle: Klausel, Seite/Abschnitt, Frist, Bedingung.” 2. „Welche Klauseln in diesem Vertrag könnten für den Auftragnehmer nachteilig sein? Bewerte jede Klausel mit Ampelfarbe (Grün/Gelb/Rot) und begründe.” 3. „Formuliere für die drei als Rot bewerteten Klauseln Alternativformulierungen, die für beide Seiten fairer sind.”
Wichtig: Schicken Sie niemals reale Verträge mit personenbezogenen oder vertraulichen Daten an externe KI-Dienste ohne AVV-Vereinbarung.
Zeit: 25 Minuten
Erweiterte Reflexionsfragen — UE 54
Welche Dokumente in Ihrem Arbeitsalltag (Reports, Verträge, Protokolle) würden von einer strukturierten KI-Analyse am stärksten profitieren — und was ist das erste Experiment, das Sie ausprobieren würden?
Wie unterscheidet sich die Qualitätssicherung bei einer CSV-Analyse (quantitative Daten) von einer PDF-Analyse (qualitative/text-basierte Daten)?
Welche Informationen würden Sie niemals in ein externes LLM hochladen — und welche internen Regeln würden Sie für Ihr Team zu diesem Thema formulieren?
Branchen-Vignette — Versicherung: Schadensmeldungen aus PDF-Berichten analysieren
Ein Versicherungsunternehmen erhält monatlich ca. 300 Schadensmeldungen als PDF-Dokumente. Die manuelle Erfassung von Schadensdatum, Schadensart, Schadenshöhe und involvierter Vertragsnummer dauert pro Dokument durchschnittlich 8 Minuten.
KI-gestützter Extraktionsworkflow: 1. PDF-Batch-Analyse: Pro Charge 20–30 PDFs hochladen (je nach Länge) 2. Strukturierter Extraktions-Prompt: „Extrahiere aus jedem dieser Schadensdokumente: Dokumentnummer, Datum, Schadensart, Schadenshöhe (in €), Vertragsnummer. Ausgabe als CSV-Tabelle.” 3. Manuelle Stichprobenprüfung: 5 % der extrahierten Daten gegen Original-PDFs prüfen
Ergebnis: Zeitaufwand pro Dokument von 8 auf unter 1 Minute reduziert. Fehlerrate bei der Datenextraktion: Ca. 2 % (hauptsächlich unstrukturierte oder handschriftliche Dokumente). Datenschutzlösung: Nutzung des unternehmenseigenen Azure OpenAI-Deployments mit Datenisolierung.
Übung 6 — PDF-Analyse: Vertrag auf Schlüsselklauseln prüfen
Aufgabe: Analysieren Sie ein öffentlich zugängliches Vertragsmuster auf relevante Klauseln.
Prompt-Sequenz: 1. „Extrahiere alle Zahlungsbedingungen aus diesem Vertrag. Liste sie als strukturierte Tabelle: Klausel, Abschnitt, Frist, Bedingung.” 2. „Welche Klauseln könnten für den Auftragnehmer nachteilig sein? Bewerte jede Klausel mit Ampelfarbe (Grün/Gelb/Rot) und begründe.” 3. „Formuliere für die drei als Rot bewerteten Klauseln Alternativformulierungen, die für beide Seiten fairer sind.”
Wichtig: Schicken Sie niemals reale Verträge mit personenbezogenen oder vertraulichen Daten an externe KI-Dienste ohne Datenverarbeitungsvertrag.
Zeit: 25 Minuten
Erweiterte Reflexionsfragen — UE 54
Welche Dokumente in Ihrem Arbeitsalltag (Reports, Verträge, Protokolle) würden von einer strukturierten KI-Analyse am stärksten profitieren?
Wie unterscheidet sich die Qualitätssicherung bei einer CSV-Analyse (quantitative Daten) von einer PDF-Analyse (qualitative Daten)?
Welche Informationen würden Sie niemals in ein externes LLM hochladen — und welche Regeln würden Sie für Ihr Team formulieren?
Vertiefung — Chunk-Strategie: Große Datensätze systematisch zerlegen
Wenn ein Datensatz das Kontextfenster des LLMs überschreitet, wird die Chunk-Strategie eingesetzt:
Schritt 1 — Datensatz segmentieren: Den Datensatz in Teile à 1.000–2.000 Zeilen aufteilen. Python-Code: chunks = [df[i:i+1000] for i in range(0, len(df), 1000)]
Schritt 2 — Jeden Chunk einzeln analysieren: Denselben Analyse-Prompt für jeden Chunk verwenden. Ergebnisse in einer Tabelle dokumentieren.
Schritt 3 — Aggregation: Prompt: „Ich habe einen Datensatz in [N] Chunks analysiert. Hier sind die Ergebnisse: [Tabelle]. Aggregiere zu einem Gesamtergebnis. Welche Chunks weichen vom Muster ab?”
Vertiefung — Token-Limits und Kontextfenster verstehen
Jedes LLM hat ein maximales Kontextfenster. Was bedeutet das für die Praxis?
Praktische Orientierungswerte (ca. 2025): - GPT-4o: ca. 128.000 Token ≈ ca. 100.000 Wörter ≈ ca. 400 Seiten Text - Claude 3.5 Sonnet: ca. 200.000 Token ≈ ca. 150.000 Wörter ≈ ca. 600 Seiten - Gemini 1.5 Pro: bis zu 1 Mio. Token (experimentell)
Was zählt zum Kontextfenster? Der gesamte Gesprächsverlauf inklusive aller Uploads. Wenn Sie in einer langen Sitzung viele Dateien hochladen und viele Prompts senden, kann das Kontextfenster voll werden — das Modell „vergisst” dann ältere Teile des Gesprächs.
Empfehlung: Für umfangreiche Analysen neue Sitzungen beginnen. Wichtige Prompts und Zwischenergebnisse in einer eigenen Datei sichern.
Merksatz
Kontextfenster-Grenzen sind kein Fehler des Modells — sie sind ein technisches Limit. Wer dieses Limit kennt, kann es mit strukturierter Prompt-Strategie (Chunking, neue Sitzungen, kompakte Prompts) gezielt umgehen.
Praxis-Tipp — PDF-Qualität und Extraktionsergebnisse
Die Qualität der PDF-Analyse hängt stark von der PDF-Qualität ab:
Digitale PDFs (erstellt aus Word, Excel): Hohe Extraktionsqualität, Text ist direkt eingebettet.
Gescannte PDFs (eingescannte Papierdokumente): Niedrige Qualität, KI muss OCR (Texterkennung) durchführen — Fehlerrate höher.
PDFs mit Tabellen: Tabellenstruktur geht bei PDFs oft verloren — Extraktion in Tabellenform erfordert expliziten Prompt.
Prompt für tabellenreiche PDFs: „Dieses PDF enthält Tabellen. Extrahiere alle Tabellen als strukturierte Markdown-Tabellen. Nummeriere jede Tabelle und gib Seitenzahl und Überschrift an.”
Hinweis: Bei der Analyse von Scans oder fotografierten Dokumenten empfiehlt sich immer eine erhöhte Validierungsintensität von 10–15 % der extrahierten Werte (statt der üblichen 5 %).
Quellen & Weiterlesen
| Quelle | Typ | URL |
| OpenAI Modell-Übersicht — Kontextfenster aktuell | Hersteller-Dok | https://platform.openai.com/docs/models |
| Anthropic Claude — Modellvergleich und Kontextfenster | Hersteller-Dok | https://www.anthropic.com/claude |
| Google NotebookLM — Einführung | Hersteller-Dok | https://notebooklm.google.com |
| Gemini 2.5 Pro — API-Dokumentation | Hersteller-Dok | https://ai.google.dev/gemini-api/docs |
| EU AI Act — Art. 4 Literacy (EUR-Lex) | Primärrecht | https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32024R1689 |
| pdfminer.six — Python PDF-Extraktion | Bibliotheks-Dok | https://pdfminersix.readthedocs.io |
Vertiefung — Retrieval-Augmented Generation und Dokumenten-Wissensbasis
Für Organisationen, die regelmäßig große Dokumentensammlungen analysieren müssen (Vertragsarchive, Normen-Bibliotheken, Forschungsberichte), gibt es einen technologischen Ansatz, der über das einfache Hochladen hinausgeht: Retrieval-Augmented Generation (RAG).
Wie RAG funktioniert: Eine Dokumentensammlung wird zunächst in kleine Textabschnitte (Chunks) aufgeteilt und für jeden Chunk ein mathematischer Repräsentationsvektor (Embedding) berechnet. Bei einer Anfrage wird zunächst nach den semantisch ähnlichsten Chunks gesucht (Retrieval) und nur diese relevanten Teile werden dem LLM als Kontext übergeben (Augmentation). Das Modell generiert dann die Antwort auf Basis dieser ausgewählten Chunks (Generation).
Praktische Relevanz: RAG ermöglicht es, eine Wissensbasis aus hunderten oder tausenden von Dokumenten zu erstellen, aus der LLMs präzise Antworten zu spezifischen Fragen geben können — ohne dass das gesamte Dokumentenarchiv in das Kontextfenster passt. Beispiele: Eine Kanzlei, die aus 500 Verträgen die Haftungsklauseln analysieren lassen möchte. Ein Pharmaunternehmen, das aus tausenden klinischen Studien die Evidenz zu einer spezifischen Wirkstoffklasse zusammenfassen möchte. Ein Ingenieursbüro, das aus 200 DIN-Normen die relevanten Anforderungen für ein Projekt extrahieren möchte.
Zugängliche RAG-Implementierungen: Google NotebookLM ist die zugänglichste RAG-Implementierung ohne Programmier-Kenntnisse: Bis zu 50 PDF-Dokumente können hochgeladen werden, und das Modell beantwortet Fragen auf Basis der gesamten Dokumentensammlung — mit Quellenangaben. Für größere Sammlungen gibt es LlamaIndex und LangChain (Python-Bibliotheken für RAG-Implementierung), die Programmier-Kenntnisse erfordern oder mit Code-Interpreter-Unterstützung konfigurierbar sind.
Grenzen und Vertrauenswürdigkeit: RAG verbessert die Zuverlässigkeit von LLM-Antworten erheblich — aber nicht auf 100 %. Fehler entstehen vor allem bei: unpräziser Chunk-Segmentierung (Kontext wird durch die Chunk-Grenzen zerstört), semantisch ähnlichen aber inhaltlich unterschiedlichen Chunks (falscher Chunk wird abgerufen), und Fragen, die mehrere Chunks aus verschiedenen Teilen der Dokumentensammlung kombinieren müssen. Quellenangaben (welches Dokument, welche Seite) sind bei NotebookLM automatisch enthalten — und sollten immer manuell verifiziert werden.
Lokale RAG-Lösungen für datenschutzsensible Dokumentensammlungen: Für Rot-klassifizierte Dokumente gibt es lokale RAG-Lösungen (Ollama + LlamaIndex + lokale Embeddings), die vollständig auf dem eigenen Server betrieben werden können — kein Cloud-Upload. Diese Lösungen erfordern IT-Expertise für die Einrichtung, ermöglichen aber die RAG-Analyse auch für hochsensible Dokumente.
Vertiefung — Intelligent Document Processing (IDP) — Systeme jenseits des manuellen Uploads
Der manuelle Upload einzelner Dokumente zu einem LLM ist der einfachste Einstieg in die Dokumentenanalyse. Für Organisationen, die regelmäßig große Mengen von Dokumenten verarbeiten müssen (Rechnungen, Verträge, Anträge, Berichte), gibt es spezialisierte IDP-Systeme (Intelligent Document Processing):
Was IDP kann: IDP-Systeme kombinieren OCR (Optical Character Recognition), NLP (Natural Language Processing) und ML (Machine Learning) um strukturierte Daten aus unstrukturierten Dokumenten zu extrahieren — automatisch, skalierbar und mit Lern-Mechanismen, die die Genauigkeit über Zeit verbessern.
Relevante IDP-Plattformen: - Microsoft Azure AI Document Intelligence (früher Form Recognizer): Extrahiert strukturierte Daten aus Formularen, Rechnungen, Verträgen. Integriert in Azure AI Services. - AWS Textract: Ähnliche Funktionalität in der AWS-Umgebung. - Google Document AI: Googles IDP-Plattform mit enger BigQuery-Integration. - Mindee, ABBYY FlexiCapture: Spezialisierte IDP-Anbieter für Rechnungsverarbeitung und Dokumentenklassifikation.
Typische IDP-Anwendungsfälle: - Rechnungsverarbeitung: Extraktion von Rechnungsdatum, Lieferant, Betrag, MwSt., Positionen aus Eingangsrechnungen. Automatisches Matching mit Bestelldaten. - Vertragsverwaltung: Extraktion von Vertragslaufzeiten, Kündigungsfristen, Parteien, Schlüsselklauseln. Automatische Befüllung des Vertragsmanagementsystems. - Antragsprüfung: Extraktion von Antragsdaten (Förderprogramme, Versicherungsanträge, Genehmigungen) und Abgleich mit Regelwerken.
Abgrenzung zum LLM-Upload: LLM-Dokumentenanalyse ist für explorative Einzeldokument-Analysen geeignet. IDP ist für skalierbare, automatisierte Massenverarbeitung. Für 10 Dokumente: LLM ausreichend. Für 10.000 Dokumente: IDP notwendig.
Vertiefung — Die Grenzen der PDF-Analyse und wie man sie überbrückt
PDFs sind für Menschen gut lesbar, für Maschinen eine Herausforderung. Das PDF-Format (Portable Document Format) speichert Seiteninhalt als Ansammlung von Textblöcken und grafischen Elementen — ohne semantische Struktur. Ein Tabelleninhalt in einem PDF ist aus Maschinensicht eine Reihe von Textblöcken, die zufällig nebeneinanderliegen — keine Tabellenstruktur im Sinne einer relationalen Datenbank.
Drei Kategorien von PDFs mit unterschiedlichen Analysechallenges:
Natives PDF (aus Word, LaTeX oder InDesign exportiert): Textelemente sind als Textblöcke eingebettet. Extraktion ist möglich, aber Tabellen müssen durch Layout-Analyse rekonstruiert werden. LLMs kommen damit in der Regel gut zurecht.
Gescanntes PDF (Scan ohne OCR): Enthält nur Bilddaten, keinen Text. Für die Analyse muss zuerst OCR (Optical Character Recognition) angewendet werden. Qualität abhängig von Scan-Qualität, Schriftart und Dokumentzustand. LLMs können gescannte PDFs nicht direkt verarbeiten — es braucht OCR als Vorschritt.
Formular-PDF: Enthält Formularfelder, die maschinenlesbar sind, aber oft auch komplexe Layouts. Für Massenverarbeitung von Formular-PDFs gibt es spezialisierte Tools (z. B. Python-Bibliothek pdfminer, Adobe Acrobat APIs).
Merksatz
Gescannte PDFs ohne OCR-Schicht sind für LLMs nicht direkt analysierbar. Wenn Uploads von gescannten Dokumenten keine sinnvollen Analyseergebnisse liefern, ist fehlende Texterkennung die häufigste Ursache. Lösung: OCR-Tool vorschalten (z. B. Adobe Acrobat, ABBYY FineReader, oder Python-Bibliothek tesseract) und das resultierende, durchsuchbare PDF hochladen.
Vertiefung — Strukturierte Extraktion aus unstrukturierten Dokumenten
Ein besonders wertvoller Anwendungsfall der PDF-Analyse ist die strukturierte Extraktion: Aus einem Fließtext (z. B. einem Vertrag, einem Forschungsbericht, einem Jahresabschluss) werden spezifische Datenpunkte extrahiert und in eine tabellarische Struktur überführt, die für weitere Analysen genutzt werden kann.
Beispiel: Ein Anwaltskanzlei verwaltet 500 Lieferantenverträge als PDFs. Für eine Vertragsneubewertung müssen folgende Informationen aus jedem Vertrag extrahiert werden: Vertragslaufzeit, Kündigungsfristen, Haftungsgrenzen, Zahlungsziele, automatische Verlängerungsklauseln und Preisanpassungsklauseln. Manuell: mehrere Wochen Arbeit. Mit KI: Massenextraktion in Stunden.
Der Prozess: 1. PDF hochladen oder Text kopieren 2. Extraktionsschema definieren: „Extrahiere aus diesem Vertrag folgende Informationen als JSON: {vertragslaufzeit_von, vertragslaufzeit_bis, kuendigungsfrist_tage, haftungsgrenze_eur, zahlungsziel_tage, automatische_verlaengerung: boolean, preisanpassungsklausel: boolean}” 3. KI liefert strukturierten JSON-Output 4. JSON aus mehreren Verträgen in eine Datenbank oder Excel-Tabelle zusammenführen 5. Aggregierte Auswertung: Wie viele Verträge haben automatische Verlängerung? Welche Haftungsgrenzen sind marktunüblich hoch?
Prompt-Vorlage
Prompt: Strukturierte Extraktion aus Vertragsdokument
„Analysiere den folgenden Vertragstext und extrahiere die folgenden Informationen als strukturiertes JSON-Objekt. Wenn eine Information nicht explizit genannt wird, verwende null. Markiere bei ‘unsicher: true’, wenn du einen Wert inferieren musstest, weil er nicht wörtlich im Vertrag steht.
Felder: vertragsbeginn (YYYY-MM-DD), vertragsende (YYYY-MM-DD), kuendigungsfrist_tage (integer), automatische_verlaengerung (boolean), verlaengerungsdauer_monate (integer), haftungsgrenze_eur (number), zahlungsziel_tage (integer), schiedsklausel (boolean), anwendbares_recht (string).
Vertragstext: [Vertragstext einfügen]”
Branchen-Anwendungen — PDF- und CSV-Analyse in der Praxis
IT-Dienstleistung & Beratung: Analyse von RFPs (Request for Proposals) auf Anforderungsstruktur und Bewertungskriterien, Extraktion von Leistungsbeschreibungen aus Ausschreibungsunterlagen, Auswertung von Kundenzufriedenheitsumfragen aus CSV-Exporten. KI kann aus einem 100-seitigen Ausschreibungsdokument in Minuten eine strukturierte Anforderungsmatrix erstellen.
Industrie & Fertigung: Technische Datenblätter (PDF) für Lieferantenvergleiche auswerten, Prüfberichte und Qualitätszertifikate auf Maßabweichungen analysieren, Stücklisten aus PDF-Zeichnungen extrahieren (begrenzte Zuverlässigkeit — OCR-Qualität entscheidend). CSV-Maschinenprotokolle auf Wartungsintervalle und Anomalien analysieren.
Finanzdienstleistung & Versicherung: Jahresabschlüsse von Kreditnehmern für Bonitätsanalysen auswerten, Versicherungspolicen auf Deckungsumfang und Ausschlüsse prüfen, regulatorische Meldungen auf Vollständigkeit validieren. Wichtig: Ergebnisse immer durch Fachleute gegenprüfen lassen — KI kann semantische Nuancen in Rechtsbegriffen missverstehen.
Öffentliche Verwaltung: Fördermittelanträge auf formale Vollständigkeit prüfen, Rechtsgutachten auf relevante Präzedenzfälle und Argumente zusammenfassen, Bürgeranfragen aus CSV-Exporten von Bürgerserviceportalen thematisch clustern und priorisieren.
Prompt-Vorlage
Prompt: Mehrere PDFs vergleichend analysieren
„Ich lade [Anzahl] Dokumente hoch, die [Beschreibung, z. B. Angebote verschiedener Lieferanten / Jahresberichte verschiedener Unternehmen / Vertragsentwürfe für dasselbe Thema] enthalten. Erstelle eine Vergleichsmatrix mit folgenden Dimensionen als Zeilen: [Dimension 1, 2, 3 …] und den Dokumenten als Spalten. Markiere Spalten mit den günstigsten Werten grün und den ungünstigsten rot (in der Textausgabe: mit [BEST] und [WORST]). Füge eine Empfehlung hinzu, welches Dokument unter Berücksichtigung aller Dimensionen am besten abschneidet.”
Vertiefung — Von der Einzelanalyse zur Batch-Verarbeitung
Wenn dieselbe Analyse für viele Dokumente wiederholt werden muss (z. B. 200 Rechnungen, 50 Lieferantenverträge, 500 Support-Tickets), ist manuelle Einzelverarbeitung mit LLM nicht praktikabel. Für Batch-Verarbeitung gibt es drei Ansätze:
Ansatz 1 — Code Interpreter mit Schleife: Alle Dokumente als ZIP-Datei hochladen, KI schreibt ein Python-Skript mit Schleife, das jedes Dokument verarbeitet und Ergebnisse in eine CSV schreibt.
Ansatz 2 — API-basierte Automatisierung: Direkter Zugang zur LLM-API (OpenAI API, Azure OpenAI, Google Gemini API), automatisierte Skriptverarbeitung. Erfordert Programmierkenntnisse oder den Einsatz von No-Code-Automatisierungstools wie n8n oder Make.
Ansatz 3 — Spezialisierte Dokumentenverarbeitungs-Tools: Für Rechnung-OCR und -Extraktion: Tools wie ABBYY Vantage, AWS Textract, Azure Form Recognizer. Für Vertragsanalyse: Spezialisierte Legal-Tech-Tools mit KI (z. B. Luminance, Kira). Diese bieten höhere Zuverlässigkeit für spezifische Dokumententypen als generische LLMs.
Merksatz
Für Einzeldokumente oder kleine Mengen (unter 20 Dokumente): Manuelle Verarbeitung mit LLM ist effizient. Für mittlere Mengen (20–200 Dokumente): Code Interpreter mit Schleife oder No-Code-Automatisierung. Für große Mengen (über 200 Dokumente) oder kritische Anwendungsfälle: Spezialisierte Dokumentenverarbeitungs-Tools und API-Integration einsetzen.
Hinweis für Trainer
Didaktischer Hinweis — Fehlerfälle demonstrieren: Zeigen Sie explizit, was schiefgeht, wenn ein gescanntes PDF ohne OCR-Schicht hochgeladen wird. Die KI-Antwort ist dann entweder eine Fehlermeldung oder — schlimmer — eine erfundene Antwort über ein leeres Dokument. Dieser Fehlerfall macht deutlich, warum Vorwissen über das Dateiformat wichtig ist und warum KI-Ergebnisse immer auf Plausibilität geprüft werden müssen. „Garbage In, Garbage Out” gilt auch für die beste KI.
Hinweise für AI Champions — So vermitteln Sie das Thema — UE 54
Timing (45 Min): 5 Min Einstieg (80.000-Zeilen-Datensatz-Szenario live nachstellen), 15 Min Lerntext (Token-Konzept + Strategien + PDF-Typen), 20 Min Übungen (Übung 1 als Gruppenarbeit, Übung 2 live), 5 Min Diskussion Entscheidungsregel.
Methodische Empfehlung: Das stille Abschneiden live demonstrieren — eine große Datei hochladen, Analyse anfordern, dann Zeilenanzahl bestätigen lassen und den Unterschied zeigen. Diese Demonstration ist einprägsamer als jede Theorie. Übung 1 als Gruppenarbeit mit drei verschiedenen Gruppen für die drei Datensätze — dann Ergebnisse vergleichen (in der Schulung in der Gruppe oder allein; als Selbstlernende/r: Abgleich mit der Musterlösung).
Häufige Stolpersteine: (a) Token-Konzept abstrakt — immer in Alltagseinheiten übersetzen (Seiten, CSV-Zeilen). (b) Teilnehmende glauben, dass das Tool immer warnt — Gegenbeispiel zeigen. (c) NotebookLM wird nicht als Option erkannt — explizit auf den PDF-Mehrquellen-Anwendungsfall hinweisen.
Diskussionsfragen: (1) „Welche geschäftlichen Risiken entstehen, wenn jemand nicht weiß, dass sein Datensatz abgeschnitten wurde?” (2) „Wann ist Vorabaggregation informativer als Rohdaten — auch wenn kein Kontextfenster-Problem besteht?”
Tafelbild-Vorschlag: Entscheidungsbaum mit Dateigrößen-Schwellenwerten und Tool-Empfehlungen.
Differenzierung: Power-User: Stratifizierte Stichprobe in Python generieren lassen und mit der Vollauswertung vergleichen. Einsteiger: Praktische Entscheidungsregel (5 Regeln) als Checkliste anwenden.
Tipp zur Branchenauswahl: Für Fertigungskunden das Jahresprotokoll-Beispiel (500.000 Zeilen) wählen und die Aggregations-Strategie konkret vorrechnen. Für Verwaltungskunden das NotebookLM-Szenario (mehrere Gesetzestexte gleichzeitig) als besonders nützlich hervorheben.
Übergang zur nächsten UE: „Wir wissen jetzt, wie wir mit großen Datensätzen umgehen. Aber bevor wir echte Produktivdaten hochladen, müssen wir eine grundlegende Frage klären: Welche Daten dürfen in externe KI-Tools — und welche nicht? Das ist das Thema von UE 55.”
Vertiefung — Kontextfenster-Management für Profis: Chunk-Strategie und Indexierung
Wenn ein Dokument oder Datensatz das Kontextfenster eines LLMs überschreitet, gibt es mehr als nur die einfache Strategie „kleinere Datei nehmen”. Professionelles Kontextfenster-Management kennt drei Stufen:
Stufe 1 — Direkte Strategie (bis ca. 150 Seiten / 100.000 Wörter): Modelle mit großem Kontextfenster (Claude 3.7, Gemini 1.5 Pro) können direkt mit dem vollständigen Dokument arbeiten. Für Geschäftsdokumente bis 100–150 Seiten ist diese Stufe ausreichend und am einfachsten.
Stufe 2 — Chunk-Strategie (150–500 Seiten): Das Dokument wird in sinnvolle Abschnitte (Chunks) zerlegt — typischerweise Kapitel, Abschnitte oder Seiten-Gruppen von ca. 20–30 Seiten. Jeder Chunk wird mit demselben Analyse-Prompt verarbeitet, die Einzelergebnisse werden anschließend aggregiert. Prompt für die Aggregation: „Ich habe ein 300-seitiges Dokument in 10 Abschnitte aufgeteilt und für jeden Abschnitt eine Zusammenfassung erstellt. Hier sind alle 10 Zusammenfassungen: [Liste]. Erstelle daraus eine übergeordnete Zusammenfassung: (1) Hauptthemen, (2) Wichtigste Erkenntnisse (Top 5), (3) Widersprüche zwischen Abschnitten.”
Stufe 3 — Retrieval-Augmented Generation (RAG, > 500 Seiten): Bei sehr großen Dokumentenmengen (Gesamtwerke, Compliance-Handbücher, Projektdokumentation) wird eine Vektordatenbank eingesetzt, die relevante Abschnitte für jede Anfrage gezielt abruft. Tools: LangChain, LlamaIndex, oder commercial RAG-Plattformen wie Langdock. Dieser Ansatz erfordert technische Unterstützung, ist aber für Organisationen mit großen Dokumentenmengen der Goldstandard.
Prompt-Vorlage — Strukturierte PDF-Extraktion
Prompt: Strukturierte Informationsextraktion aus einem PDF
„Ich lade ein PDF-Dokument hoch. Extrahiere daraus folgende Informationen in einem strukturierten Format:
Metadaten: Titel, Autor(en), Datum, Dokumenttyp (z. B. Vertrag, Bericht, Leitlinie).
Kerninformationen: [3–5 spezifische Informationstypen, z. B. für einen Vertrag: Vertragsparteien, Vertragslaufzeit, Hauptverpflichtungen, Zahlungsbedingungen, Kündigungsfristen].
Risiko-Flags: Identifiziere alle Aussagen, die Fristen, Bußgelder, Haftungsausschlüsse oder Bedingungen enthalten — liste sie mit Seitenzahl und wörtlichem Zitat.
Offene Punkte: Gibt es Platzhalter, Lücken oder widersprüchliche Aussagen im Dokument?
Ausgabeformat: Strukturierte Liste mit Überschriften. Für jede extrahierte Information: Zitat aus dem Originaldokument in Anführungszeichen und Seitenzahl.”
Vertiefung — Batch-Verarbeitung mehrerer Dokumente
In der Praxis geht es selten um ein einzelnes Dokument. Ein Procurement-Manager hat 40 Lieferantenverträge, alle im PDF-Format — und möchte einen Überblick über Lieferzeiten, Zahlungsziele und Kündigungsfristen. Die manuelle Durchsicht würde mehrere Tage dauern.
Mit einer Batch-Verarbeitungsstrategie: Für jedes Dokument denselben Extraktions-Prompt anwenden (s. Prompt-Vorlage), Ergebnisse in eine Tabelle zusammenfassen, Tabelle für Vergleichsanalysen nutzen. Ohne Code-Kenntnisse kann diese Batch-Strategie mit dem Code Interpreter umgesetzt werden: Alle PDFs in einem ZIP-Archiv hochladen, Extraktionsskript generieren lassen, Ergebnisse als Excel-Tabelle exportieren.
Wichtige Einschränkung: Scan-PDFs ohne OCR-Layer können nicht von LLMs analysiert werden. Lösung: Vorher OCR-Software (z. B. Adobe Acrobat, Google Drive Scan-Funktion) für die Texterkennung einsetzen.
Zusatzübung — Vertragsvergleich per KI
Zusatzübung — Zwei Dokumente vergleichen
Aufgabe: Laden Sie zwei ähnliche Dokumente (z. B. zwei Versionen einer Leistungsbeschreibung, zwei Musterverträge oder zwei Berichte desselben Typs aus verschiedenen Perioden) in eine KI hoch und lassen Sie einen strukturierten Vergleich erstellen.
Schritt-für-Schritt: 1. Zwei Dokumente auswählen (öffentlich zugänglich oder vollständig anonymisiert — Datenschutz-Check nach UE 55). 2. Beide Dokumente in eine Konversation hochladen (bei Claude oder Gemini möglich; bei ChatGPT: Dokument 1 + Prompt, dann Dokument 2 + Vergleichs-Prompt in derselben Konversation). 3. Vergleichs-Prompt: „Vergleiche Dokument A und Dokument B nach folgenden Kriterien: (1) Gemeinsamkeiten (mind. 3), (2) Unterschiede (mind. 3, mit wörtlichem Zitat aus beiden Dokumenten), (3) Welches Dokument ist für [definierten Zweck] besser geeignet — und warum?” 4. Prüfen Sie zwei der genannten Unterschiede manuell — stimmen die Zitate mit dem Original überein? 5. Fazit: Welche Einschränkungen hat der KI-Vergleich? Was übersieht er möglicherweise?
Erwartetes Ergebnis: Strukturierter Vergleich mit verifizierten Zitaten, persönliche Einschätzung der Verlässlichkeit des KI-Outputs.
Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung mit Anhängen und Musterlösungen: als PDF anfordern.
Zurück zur Modul-Übersicht