Zum Inhalt

// dokumente

Mit Bildern arbeiten

Kurzbeschreibung

Fotos, Screenshots und Scans: Was basebox aus Bildern liest, wo die Grenzen liegen und wie Sie Texterkennung gezielt einsetzen. Kurz gesagt: basebox liest den Text in einem Bild per Texterkennung (OCR) und macht ihn analysierbar wie ein Dokument.

Welche Bilder Sie hochladen können

Format Typisch für
JPG Fotos, Handyaufnahmen von Dokumenten
PNG Screenshots, Grafiken mit Text
TIFF Scans aus Dokumentenscannern
HEIC Fotos von Apple-Geräten
GIF Einfache Grafiken
SVG, EMF Vektorgrafiken und Windows-Metadateien

Bilder laden Sie direkt als eigenständige Datei hoch – Sie müssen sie nicht erst in ein PDF oder Word-Dokument einbetten. Auch reine Bild-PDFs und Word-Dateien, die nur Bilder enthalten, werden per Texterkennung gelesen.

Was mit einem Bild passiert

  1. Sie laden das Bild in den Chat (Büroklammer oder Drag & Drop) oder in die Wissensbasis einer App.
  2. basebox erkennt den enthaltenen Text per OCR. Wo eine GPU verfügbar ist, läuft das beschleunigt; sonst automatisch auf der CPU.
  3. Der erkannte Text steht dem Assistenten zur Verfügung – Sie können ihn zusammenfassen, übersetzen, in eine Tabelle überführen oder Fragen dazu stellen.

Die Texterkennung arbeitet überall gleich: im Chat wie in der Wissensbasis.

Typische Einsatzfälle

  • Fotografiertes Formular – „Übertrage die Angaben aus dem Formular in eine Tabelle."
  • Screenshot einer Fehlermeldung – „Was bedeutet diese Meldung und was kann ich tun?"
  • Gescannter Brief – „Fasse den Brief zusammen und nenne die Frist."
  • Whiteboard-Foto – „Mache aus den Stichpunkten ein sauberes Protokoll." (Handschrift wird nur eingeschränkt erkannt.)
  • Visitenkarte oder Beleg – „Extrahiere Name, Firma, Betrag und Datum."

Grenzen

basebox liest Text – es beschreibt keine Bilder

Ein Bild ohne Text – etwa ein Foto einer Landschaft oder ein Diagramm ohne Beschriftung – liefert keinen Inhalt, den basebox weiterverarbeiten kann. Erwarten Sie keine Bildbeschreibung.

Weitere Grenzen:

  • Handschrift wird nur eingeschränkt erkannt; gedruckter Text funktioniert deutlich zuverlässiger.
  • Schlechte Qualität – unscharf, schräg, dunkel, kleine Schrift – verschlechtert das Ergebnis.
  • Mehrsprachige Bilder funktionieren, gemischte Schriftsysteme können Fehler erzeugen.

Tipps für gute Erkennung

  • Fotografieren Sie gerade von oben, bei gleichmäßigem Licht, ohne Schatten.
  • Nutzen Sie beim Scannen 300 dpi und Schwarz-Weiß oder Graustufen für Textdokumente.
  • Schneiden Sie Ränder und Hintergrund weg; das Dokument sollte das Bild füllen.
  • Bei mehreren Seiten: lieber ein mehrseitiges PDF als viele Einzelbilder – dann bleibt die Reihenfolge erhalten.

Hinweise

Hinweis

  • Im Chat gilt auch für Bilder das Limit von 10 MB pro Datei. Handyfotos sind oft größer als nötig – eine Verkleinerung schadet der Texterkennung selten.
  • Videos werden nicht verarbeitet. Brauchen Sie den Ton, extrahieren Sie die Audiospur; siehe Speech-to-Text nutzen.
  • Prüfen Sie erkannte Zahlen – 0 und O, 1 und l sind klassische OCR-Fehler.

Häufige Fragen

Kann ich ein Bild direkt in den Chat einfügen (Strg+V)? Laden Sie Bilder über die Büroklammer oder per Drag & Drop hoch.

Warum kommt bei meinem Bild nichts zurück? Wahrscheinlich enthält es keinen erkennbaren Text, oder die Qualität ist zu schlecht. Prüfen Sie, ob Sie den Text selbst gut lesen können.

Werden Bilder in einer Wissensbasis dauerhaft gespeichert? Ja, wie jede andere Datei der App – bis Sie sie entfernen. Achten Sie darauf, nur Bilder hochzuladen, deren Inhalt alle Nutzer der App sehen dürfen.

Benötigen Sie Hilfe? Support kontaktieren