Zum Inhalt

// dokumente

Mit PDFs arbeiten

Kurzbeschreibung

PDFs sind das häufigste Dokumentformat in basebox. Diese Seite erklärt, was mit Text-PDFs und gescannten PDFs geschieht, wie Sie das Beste aus großen Dokumenten herausholen und woran es liegt, wenn ein PDF nicht verarbeitet wird.

Zwei Arten von PDF

Text-PDFs – aus Word, einem Berichtsgenerator oder einem Browser erzeugt. Der Text ist als Text enthalten (Sie können ihn im PDF-Reader markieren). basebox extrahiert ihn direkt.

Gescannte PDFs – Seiten, die als Bild vorliegen: Scans, Faxe, fotografierte Dokumente. Hier gibt es keinen markierbaren Text. basebox liest den Inhalt per Texterkennung (OCR) – wo eine GPU verfügbar ist beschleunigt, sonst auf der CPU. Sie müssen nichts dafür tun; beide Arten laden Sie gleich hoch.

Auch Mischformen funktionieren: ein Text-PDF mit eingebetteten gescannten Anhängen zum Beispiel.

PDF hochladen und befragen

  1. Ziehen Sie das PDF in den Chat oder nutzen Sie die Büroklammer (im Chat: bis 10 MB pro Datei).
  2. Warten Sie auf die Bestätigung des Uploads.
  3. Stellen Sie eine konkrete Frage: „Welche Kündigungsfristen nennt der Vertrag?" statt „Was steht da?"

Für Dokumente, die Sie immer wieder brauchen, legen Sie sie in die Wissensbasis einer App. Dort gelten höhere Limits, und Antworten kommen mit Quellenangaben bis zur Fundstelle.

Große PDFs

Im Chat zählt die Textmenge, nicht die Dateigröße. Als Richtwert passen etwa 50 Seiten in einen Chat; ein dicht bedrucktes PDF mit 30 Seiten kann schon zu viel sein. Erscheint ein Verarbeitungsfehler oder „Kontextfenster erreicht", helfen drei Wege:

  • Aufteilen – nur die relevanten Seiten extrahieren oder das Dokument in Abschnitte teilen und nacheinander auswerten.
  • Neuer Chat – ein lang laufender Chat hat weniger Platz frei. Ein neuer Chat startet mit vollem Kontextfenster.
  • App-Wissensbasis – dort werden Dokumente in Abschnitte zerlegt und gezielt durchsucht, statt vollständig ins Kontextfenster geladen zu werden. Das ist der richtige Weg für Handbücher, Leitlinien und Sammlungen.

Hintergrund: Kontextfenster.

Wenn ein PDF nicht verarbeitet wird

Meldung / Symptom Ursache Lösung
„Text kann nicht gelesen werden" Datei beschädigt oder passwortgeschützt In einem anderen Programm öffnen; Passwortschutz entfernen
„Datei zu groß" Über dem Limit für den Kontext Komprimieren, aufteilen, nur relevante Seiten
Verarbeitungsfehler ohne Grund Zu viel Text für das Kontextfenster Aufteilen oder neuer Chat
Antwort ignoriert Teile des Dokuments Frage zu allgemein, oder Dokument sehr umfangreich Enger fragen; Wissensbasis nutzen
Leere oder lückenhafte Erkennung bei Scans Schlechte Scanqualität, schräge Seiten, Handschrift Neu scannen (gerade, kontrastreich, 300 dpi); Handschrift wird nur eingeschränkt erkannt

Gescannte PDFs ohne auswählbaren Text sind kein Problem – sie werden per OCR gelesen. Ein Problem sind nur verschlüsselte oder beschädigte Dateien.

Hinweise

Tipps für gute Ergebnisse

  • Nennen Sie in der Frage, welchen Teil des Dokuments Sie meinen: „im Abschnitt Zahlungsbedingungen", „auf den letzten zwei Seiten".
  • Lassen Sie sich bei langen Dokumenten zuerst eine Gliederung geben, dann fragen Sie gezielt nach.
  • Prüfen Sie Zahlen und Zitate im Original – bei einer App-Wissensbasis über den Quellen-Chip, der Ihnen die Fundstelle zeigt.

Hinweis

Aus einem PDF erzeugt basebox auf Wunsch neue Dokumente – etwa eine Zusammenfassung als Word-Datei oder eine Tabelle als Excel. Siehe Dokumente erzeugen.

Häufige Fragen

Erkennt basebox Tabellen in PDFs? Ja, Tabellen werden als Text mit ihrer Struktur extrahiert. Für Berechnungen ist eine Excel-Datei besser geeignet.

Werden Bilder in einem PDF ausgewertet? Text in Bildern wird per OCR gelesen. Reine Grafiken ohne Text liefern keinen verwertbaren Inhalt.

Kann ich mehrere PDFs auf einmal vergleichen? Ja, hängen Sie beide an und fragen Sie: „Worin unterscheiden sich Version A und Version B?" Achten Sie auf das Kontextfenster.

Benötigen Sie Hilfe? Support kontaktieren